모델

플래그십 모델

텍스트 음성 변환

음성 인식

음악

모델 개요

ElevenLabs API는 다양한 사용 사례, 품질 수준 및 성능 요구 사항에 최적화된 여러 오디오 모델을 제공합니다.

모델 ID설명언어
eleven_v4가장 풍부한 감정과 표현력을 제공하는 음성 합성 모델90개 이상의 언어
eleven_v4_turbo가장 뛰어난 표현력을 제공하는 실시간 음성 합성 모델(~100ms†)90개 이상의 언어
eleven_v3사람처럼 자연스럽고 표현력 있는 음성 생성70개 이상의 언어
eleven_v3_conversational가장 뛰어난 표현력을 제공하는 실시간 음성 합성 모델(~280ms†)70개 이상의 언어
eleven_ttv_v3사람처럼 자연스럽고 표현력 있는 보이스 디자인 모델(Text to Voice)70개 이상의 언어
eleven_multilingual_v2풍부한 감정 표현을 제공하는 생생한 음성 모델en, ja, zh, de, hi, fr, ko, pt, it, es, id, nl, tr, fil, pl, sv, bg, ro, ar, cs, el, fi, hr, ms, sk, da, ta, uk, ru
eleven_flash_v2_5실시간 사용에 최적화된 초고속 모델(~75ms†)모든 eleven_multilingual_v2 언어 및 hu, no, vi
eleven_flash_v2실시간 사용에 최적화된 초고속 모델(~75ms†)en
eleven_multilingual_sts_v2최첨단 다국어 보이스 체인저 모델(음성 변환)en, ja, zh, de, hi, fr, ko, pt, it, es, id, nl, tr, fil, pl, sv, bg, ro, ar, cs, el, fi, hr, ms, sk, da, ta, uk, ru
eleven_multilingual_ttv_v2최첨단 다국어 보이스 디자인 모델(Text to Voice)en, ja, zh, de, hi, fr, ko, pt, it, es, id, nl, tr, fil, pl, sv, bg, ro, ar, cs, el, fi, hr, ms, sk, da, ta, uk, ru
eleven_english_sts_v2영어 전용 보이스 체인저 모델(음성 변환)en
scribe_v2_realtime실시간 음성 인식 모델90개 이상의 언어
scribe_v2_medical임상 오디오에 맞게 미세 조정된 음성 인식90개 이상의 언어
scribe_v2최첨단 음성 인식 모델90개 이상의 언어
scribe_v2_medical의료 및 임상 오디오에 특화된 음성 인식 모델90개 이상의 언어
eleven_text_to_sound_v2텍스트 프롬프트로 음향 효과 생성해당 없음
music_v2_5가장 발전된 음악 모델입니다. 텍스트 프롬프트, 작곡 계획 및 이전에 생성한 곡으로 스튜디오급 음악을 생성하며, music_v2보다 품질과 프롬프트 준수 성능이 향상되었습니다en, es, de, ja 등
music_v2텍스트 프롬프트, 작곡 계획 및 이전에 생성한 곡으로 스튜디오급 음악 생성en, es, de, ja 등
music_v1텍스트 프롬프트로 스튜디오급 음악 생성. music_v2 및 music_v2_5보다 성능이 낮음en, es, de, ja 등
† 애플리케이션 및 네트워크 지연 시간 제외

지원 중단된 모델

eleven_turbo_v2_5 및 eleven_turbo_v2 모델은 Flash 모델의 평균 지연 시간이 더 낮다는 점을 제외하면 각각 eleven_flash_v2_5 및 eleven_flash_v2 모델과 기능적으로 동일합니다. 모든 사용 사례에서 Turbo 모델보다 Flash 모델을 사용하는 것을 권장합니다.

모델 ID설명언어권장 대체 모델
eleven_turbo_v2_51세대 저지연 모델(Flash 모델보다 성능이 낮음)en, ja, zh, de, hi, fr, ko, pt, it, es, id, nl, tr, fil, pl, sv, bg, ro, ar, cs, el, fi, hr, ms, sk, da, ta, uk, ru, hu, no, vieleven_flash_v2_5
eleven_turbo_v21세대 저지연 모델(Flash 모델보다 성능이 낮음)eneleven_flash_v2
scribe_v11세대 음성 인식(v2 모델보다 성능이 낮음)90개 이상의 언어scribe_v2

Eleven v4

Eleven v4는 최고 품질의 오디오, 표현력, 그리고 음성 연기 방식에 대한 제어 기능을 제공하는 최첨단 음성 합성 모델입니다. Eleven v4는 긴 텍스트 생성에서도 화자를 안정적으로 유지하는 고충실도 음성 복제를 지원합니다.

이 모델은 다음과 같은 상황에서 효과적입니다.

  • 캐릭터 보이스오버: 폭넓은 감정 표현으로 게임과 애니메이션에 적합합니다.
  • 감정이 담긴 대화: 뛰어난 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 대화를 생성합니다.
  • 오디오북 제작: 복잡한 감정 전달이 필요한 긴 내레이션에 적합합니다.
  • 다국어 프로젝트: 언어가 전환되어도 일관된 음성 품질을 유지합니다.

Eleven v4는 Text to Dialogue API를 통해 사용할 수 있습니다.

지원 언어

Eleven v4 모델 제품군은 다음을 포함한 90개 이상의 언어를 지원합니다.

아프리칸스어 (afr), 암하라어 (amh), 아랍어 (ara), 아르메니아어 (hye), 아삼어 (asm), 아스투리아스어 (ast), 아제르바이잔어 (aze), 벨라루스어 (bel), 벵골어 (ben), 보스니아어 (bos), 불가리아어 (bul), 버마어 (mya), 광둥어 (yue), 카탈루냐어 (cat), 세부아노어 (ceb), 크로아티아어 (hrv), 체코어 (ces), 덴마크어 (dan), 네덜란드어 (nld), 영어 (eng), 에스토니아어 (est), 필리핀어 (fil), 핀란드어 (fin), 프랑스어 (fra), 풀라어/풀라르어 (ful), 갈리시아어 (glg), 조지아어 (kat), 독일어 (deu), 그리스어 (ell), 구자라트어 (guj), 하우사어 (hau), 히브리어 (heb), 힌디어 (hin), 헝가리어 (hun), 아이슬란드어 (isl), 인도네시아어 (ind), 이탈리아어 (ita), 일본어 (jpn), 자바어 (jav), 캄바어 (kam), 칸나다어 (kan), 카자흐어 (kaz), 한국어 (kor), 키르기스어 (kir), 라오어 (lao), 라트비아어 (lav), 링갈라어 (lin), 리투아니아어 (lit), 루간다어 (lug), 룩셈부르크어 (ltz), 마케도니아어 (mkd), 말레이어 (msa), 말라얄람어 (mal), 몰타어 (mlt), 중국어 표준어 (cmn), 마오리어 (mri), 마라티어 (mar), 몽골어 (mon), 네팔어 (nep), 노르웨이어 보크몰 (nob), 오크어 (oci), 오디아어 (ori), 파슈토어 (pus), 페르시아어 (fas), 폴란드어 (pol), 포르투갈어, 브라질 (por), 펀자브어 (pan), 루마니아어 (ron), 러시아어 (rus), 세르비아어 (srp), 쇼나어 (sna), 신드어 (snd), 슬로바키아어 (slk), 슬로베니아어 (slv), 소말리어 (som), 소라니 쿠르드어 (ckb), 스페인어, 라틴아메리카 (spa), 스와힐리어 (swa), 스웨덴어 (swe), 타지크어 (tgk), 타밀어 (tam), 텔루구어 (tel), 태국어 (tha), 터키어 (tur), 우크라이나어 (ukr), 우르두어 (urd), 우즈베크어 (uzb), 베트남어 (vie), 웨일스어 (cym), 월로프어 (wol), 줄루어 (zul).

Eleven v4 Turbo

Eleven v4 Turbo는 실시간 음성 합성을 위한 최첨단 모델로, 고품질 오디오와 뛰어난 표현력, 그리고 음성 연기 방식에 대한 제어 기능을 제공합니다. Eleven v4 Turbo는 고충실도 음성 복제를 지원하며 중앙값 추론 지연 시간 약 100ms로 결과를 제공합니다.

이 모델은 다음과 같은 상황에서 효과적입니다.

  • 지원 에이전트: 고객 문의를 실시간으로 해결하는 음성 에이전트를 구동합니다.
  • AI 어시스턴트: 뛰어난 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 대화를 생성합니다.
  • 인터랙티브 캐릭터: 표현력 있는 캐릭터가 등장하는 오디오 경험에 탁월합니다.

Eleven v4 Turbo는 Text to Dialogue websocket를 통해 사용할 수 있습니다.

지원 언어

Eleven v4 모델 제품군은 다음을 포함한 90개 이상의 언어를 지원합니다.

아프리칸스어 (afr), 암하라어 (amh), 아랍어 (ara), 아르메니아어 (hye), 아삼어 (asm), 아스투리아스어 (ast), 아제르바이잔어 (aze), 벨라루스어 (bel), 벵골어 (ben), 보스니아어 (bos), 불가리아어 (bul), 버마어 (mya), 광둥어 (yue), 카탈루냐어 (cat), 세부아노어 (ceb), 크로아티아어 (hrv), 체코어 (ces), 덴마크어 (dan), 네덜란드어 (nld), 영어 (eng), 에스토니아어 (est), 필리핀어 (fil), 핀란드어 (fin), 프랑스어 (fra), 풀라어/풀라르어 (ful), 갈리시아어 (glg), 조지아어 (kat), 독일어 (deu), 그리스어 (ell), 구자라트어 (guj), 하우사어 (hau), 히브리어 (heb), 힌디어 (hin), 헝가리어 (hun), 아이슬란드어 (isl), 인도네시아어 (ind), 이탈리아어 (ita), 일본어 (jpn), 자바어 (jav), 캄바어 (kam), 칸나다어 (kan), 카자흐어 (kaz), 한국어 (kor), 키르기스어 (kir), 라오어 (lao), 라트비아어 (lav), 링갈라어 (lin), 리투아니아어 (lit), 루간다어 (lug), 룩셈부르크어 (ltz), 마케도니아어 (mkd), 말레이어 (msa), 말라얄람어 (mal), 몰타어 (mlt), 중국어 표준어 (cmn), 마오리어 (mri), 마라티어 (mar), 몽골어 (mon), 네팔어 (nep), 노르웨이어 보크몰 (nob), 오크어 (oci), 오디아어 (ori), 파슈토어 (pus), 페르시아어 (fas), 폴란드어 (pol), 포르투갈어, 브라질 (por), 펀자브어 (pan), 루마니아어 (ron), 러시아어 (rus), 세르비아어 (srp), 쇼나어 (sna), 신드어 (snd), 슬로바키아어 (slk), 슬로베니아어 (slv), 소말리어 (som), 소라니 쿠르드어 (ckb), 스페인어, 라틴아메리카 (spa), 스와힐리어 (swa), 스웨덴어 (swe), 타지크어 (tgk), 타밀어 (tam), 텔루구어 (tel), 태국어 (tha), 터키어 (tur), 우크라이나어 (ukr), 우르두어 (urd), 우즈베크어 (uzb), 베트남어 (vie), 웨일스어 (cym), 월로프어 (wol), 줄루어 (zul).

Eleven v3

Eleven v3는 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 음성을 생성하는 이전 세대 음성 합성 모델입니다.

Eleven v3에는 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 대화를 생성할 수 있는 새로운 Text to Dialogue API가 포함되어 있습니다. Eleven v3는 Text to Speech API와 함께 사용하여 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 갖춘 자연스럽고 생생한 음성을 생성할 수도 있습니다.

Text to Dialogue API에 대한 자세한 내용은 여기에서 확인하세요.

지원 언어

Eleven v3 모델은 다음을 포함한 70개 이상의 언어를 지원합니다.

아프리칸스어 (afr), 아랍어 (ara), 아르메니아어 (hye), 아삼어 (asm), 아제르바이잔어 (aze), 벨라루스어 (bel), 벵골어 (ben), 보스니아어 (bos), 불가리아어 (bul), 카탈루냐어 (cat), 세부아노어 (ceb), 치체와어 (nya), 크로아티아어 (hrv), 체코어 (ces), 덴마크어 (dan), 네덜란드어 (nld), 영어 (eng), 에스토니아어 (est), 필리핀어 (fil), 핀란드어 (fin), 프랑스어 (fra), 갈리시아어 (glg), 조지아어 (kat), 독일어 (deu), 그리스어 (ell), 구자라트어 (guj), 하우사어 (hau), 히브리어 (heb), 힌디어 (hin), 헝가리어 (hun), 아이슬란드어 (isl), 인도네시아어 (ind), 아일랜드어 (gle), 이탈리아어 (ita), 일본어 (jpn), 자바어 (jav), 칸나다어 (kan), 카자흐어 (kaz), 키르기스어 (kir), 한국어 (kor), 라트비아어 (lav), 링갈라어 (lin), 리투아니아어 (lit), 룩셈부르크어 (ltz), 마케도니아어 (mkd), 말레이어 (msa), 말라얄람어 (mal), 중국어 표준어 (cmn), 마라티어 (mar), 네팔어 (nep), 노르웨이어 (nor), 파슈토어 (pus), 페르시아어 (fas), 폴란드어 (pol), 포르투갈어 (por), 펀자브어 (pan), 루마니아어 (ron), 러시아어 (rus), 세르비아어 (srp), 신드어 (snd), 슬로바키아어 (slk), 슬로베니아어 (slv), 소말리어 (som), 스페인어 (spa), 스와힐리어 (swa), 스웨덴어 (swe), 타밀어 (tam), 텔루구어 (tel), 태국어 (tha), 터키어 (tur), 우크라이나어 (ukr), 우르두어 (urd), 베트남어 (vie), 웨일스어 (cym).

Eleven v3 Conversational

Eleven v3 Conversational은 실시간 음성 합성을 위한 이전 세대 모델입니다. 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 음성을 생성합니다.

Eleven v3 Conversational에는 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 대화를 생성할 수 있는 새로운 Text to Dialogue WebSocket이 포함되어 있습니다.

Eleven v3 Conversational에는 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 대화를 생성할 수 있는 새로운 Text to Dialogue WebSocket이 포함되어 있습니다.

Text to Dialogue WebSocket에 대한 자세한 내용은 여기에서 확인하세요.

지원 언어

Eleven v3 모델은 다음을 포함한 70개 이상의 언어를 지원합니다.

아프리칸스어 (afr), 아랍어 (ara), 아르메니아어 (hye), 아삼어 (asm), 아제르바이잔어 (aze), 벨라루스어 (bel), 벵골어 (ben), 보스니아어 (bos), 불가리아어 (bul), 카탈루냐어 (cat), 세부아노어 (ceb), 치체와어 (nya), 크로아티아어 (hrv), 체코어 (ces), 덴마크어 (dan), 네덜란드어 (nld), 영어 (eng), 에스토니아어 (est), 필리핀어 (fil), 핀란드어 (fin), 프랑스어 (fra), 갈리시아어 (glg), 조지아어 (kat), 독일어 (deu), 그리스어 (ell), 구자라트어 (guj), 하우사어 (hau), 히브리어 (heb), 힌디어 (hin), 헝가리어 (hun), 아이슬란드어 (isl), 인도네시아어 (ind), 아일랜드어 (gle), 이탈리아어 (ita), 일본어 (jpn), 자바어 (jav), 칸나다어 (kan), 카자흐어 (kaz), 키르기스어 (kir), 한국어 (kor), 라트비아어 (lav), 링갈라어 (lin), 리투아니아어 (lit), 룩셈부르크어 (ltz), 마케도니아어 (mkd), 말레이어 (msa), 말라얄람어 (mal), 중국어 표준어 (cmn), 마라티어 (mar), 네팔어 (nep), 노르웨이어 (nor), 파슈토어 (pus), 페르시아어 (fas), 폴란드어 (pol), 포르투갈어 (por), 펀자브어 (pan), 루마니아어 (ron), 러시아어 (rus), 세르비아어 (srp), 신드어 (snd), 슬로바키아어 (slk), 슬로베니아어 (slv), 소말리어 (som), 스페인어 (spa), 스와힐리어 (swa), 스웨덴어 (swe), 타밀어 (tam), 텔루구어 (tel), 태국어 (tha), 터키어 (tur), 우크라이나어 (ukr), 우르두어 (urd), 베트남어 (vie), 웨일스어 (cym).

Multilingual v2

Eleven Multilingual v2는 감정을 인식하는 이전 세대 음성 합성 모델입니다. 여러 언어에서 폭넓은 감정 표현과 문맥 이해를 바탕으로 자연스럽고 생생한 음성을 생성합니다.

이 모델은 화자의 고유한 특성과 억양을 유지하면서 모든 지원 언어에서 일관된 음성 품질과 개성을 제공합니다.

이 모델은 고품질의 섬세한 감정 표현이 필요한 다음과 같은 상황에서 탁월합니다.

  • 캐릭터 보이스오버: 폭넓은 감정 표현으로 게임과 애니메이션에 적합합니다.
  • 전문 콘텐츠: 기업 비디오와 e러닝 자료에 적합합니다.
  • 다국어 프로젝트: 언어가 전환되어도 일관된 음성 품질을 유지합니다.
  • 안정적인 품질: 일관된 고품질 오디오 출력을 생성합니다.

Flash 모델보다 지연 시간과 문자당 비용이 높지만, 생생한 음성이 중요한 프로젝트에서는 더 뛰어난 품질을 제공합니다.

다국어 v2 모델은 29개 언어를 지원합니다.

영어(미국, 영국, 호주, 캐나다), 일본어, 중국어, 독일어, 힌디어, 프랑스어(프랑스, 캐나다), 한국어, 포르투갈어(브라질, 포르투갈), 이탈리아어, 스페인어(스페인, 멕시코), 인도네시아어, 네덜란드어, 터키어, 필리핀어, 폴란드어, 스웨덴어, 불가리아어, 루마니아어, 아랍어(사우디아라비아, UAE), 체코어, 그리스어, 핀란드어, 크로아티아어, 말레이어, 슬로바키아어, 덴마크어, 타밀어, 우크라이나어 및 러시아어.

Flash v2.5

Eleven Flash v2.5는 실시간 애플리케이션 및 Agents Platform용으로 설계된 가장 빠른 음성 합성 모델입니다. 32개 언어에서 초저지연(~75ms†)으로 고품질 음성을 제공합니다.

이 모델은 속도와 품질의 균형을 갖춰 인터랙티브 애플리케이션에 적합하며, 언어 전반에서 자연스러운 출력과 일관된 음성 특성을 유지합니다.

이 모델은 특히 다음 용도에 적합합니다.

  • Agents Platform: 실시간 음성 에이전트와 챗봇에 적합합니다.
  • 인터랙티브 애플리케이션: 즉각적인 응답이 필요한 게임과 애플리케이션에 적합합니다.
  • 대규모 처리: 대량의 텍스트 음성 변환을 효율적으로 처리합니다.

API 생성의 더 낮은 가격과 75ms 지연 시간을 갖춘 Flash v2.5는 여러 언어에서 빠르고 안정적인 음성 합성이 필요한 모든 사용자에게 비용 효율적인 옵션입니다.

Flash v2.5는 v2 모델의 모든 언어와 다음 언어를 포함해 32개 언어를 지원합니다.

헝가리어, 노르웨이어 및 베트남어

† 애플리케이션 및 네트워크 지연 시간 제외

고려 사항

Flash v2.5를 사용할 때 숫자는 예상한 방식으로 기본 정규화되지 않습니다. 예를 들어 전화번호는 사용자에게 명확하지 않은 방식으로 읽힐 수 있습니다. 날짜와 통화도 비슷한 영향을 받습니다.

Flash v2.5에서는 낮은 지연 시간을 유지하기 위해 기본적으로 정규화가 비활성화되어 있습니다. 하지만 이제 엔터프라이즈 고객은 요청에서 apply_text_normalization 매개변수를 “on”으로 설정하여 v2.5 모델의 텍스트 정규화를 활성화할 수 있습니다.

Multilingual v2 모델은 숫자 정규화를 더 잘 처리하므로 전화번호 및 숫자 정규화가 중요한 다른 경우에는 이 모델을 사용하는 것이 좋습니다.

저지연 또는 Agents Platform 애플리케이션의 모범 사례는 TTS 모델에 전달하기 전에 LLM으로 텍스트를 정규화하거나 apply_text_normalization 매개변수를 사용하는 것입니다(v2.5 모델에서는 엔터프라이즈 플랜 전용).

모델 선택 가이드

요구 사항과 사용 사례에 가장 적합한 모델에 대한 안내는 모델 선택 가이드를 참조하세요.

품질

eleven_v4 또는 eleven_multilingual_v2 사용

풍부한 감정 표현을 갖춘 고충실도 오디오 출력에 가장 적합합니다.

저지연

eleven_v4_turbo 사용

실시간 애플리케이션에 최적화됨(~100ms 지연 시간)

콘텐츠 제작

eleven_v4 또는 eleven_multilingual_v2 사용

전문 콘텐츠, 오디오북 및 비디오 내레이션에 적합합니다.

Agents Platform

eleven_v4_turbo, eleven_flash_v2_5, eleven_flash_v2 또는 eleven_multilingual_v2 사용

실시간 대화형 애플리케이션에 적합합니다. 가장 표현력 있는 전달을 위해서는 eleven_v4_turbo를 사용하세요.

보이스 체인저

eleven_multilingual_sts_v2 사용

음성 변환에 특화됨

문자 제한

단일 텍스트 음성 변환 요청에서 지원되는 최대 문자 수는 모델에 따라 다릅니다.

모델 ID문자 제한대략적인 오디오 길이
eleven_v410,000약 10분
eleven_v35,000약 5분
eleven_flash_v2_540,000약 40분
eleven_flash_v230,000약 30분
eleven_multilingual_v210,000약 10분
eleven_multilingual_v110,000약 10분
eleven_english_sts_v210,000약 10분
eleven_english_sts_v110,000약 10분
더 긴 콘텐츠의 경우 입력을 여러 요청으로 나누는 것을 고려하세요.

Scribe v2

Scribe v2는 90개 이상의 언어에서 정확한 전사를 제공하도록 설계된 최첨단 음성 인식 모델입니다. 정밀한 단어 수준 타임스탬프와 화자 분리, 동적 오디오 태깅 같은 고급 기능을 제공합니다.

이 모델은 정확한 음성-텍스트 변환이 필요한 다음과 같은 상황에서 뛰어난 성능을 발휘합니다.

  • 전사 서비스: 오디오/비디오 콘텐츠를 텍스트로 변환하는 데 적합
  • 회의 문서화: 대화를 기록하고 문서화하는 데 이상적
  • 콘텐츠 분석: 오디오 콘텐츠 처리 및 분석에 적합
  • 다국어 인식: 90개 이상의 언어에서 정확한 전사 지원

주요 기능:

  • 단어 수준 타임스탬프를 포함한 정확한 전사
  • 다화자 오디오를 위한 화자 분리
  • 향상된 맥락 정보를 위한 동적 오디오 태깅
  • 90개 이상의 언어 지원
  • 엔터티 감지
  • 키워드 프롬프팅
  • 전사본 편집

Scribe v2에 대한 자세한 내용은 여기에서 확인하세요.

Scribe v2 Realtime

가장 빠르고 정확한 실시간 음성 인식 모델인 Scribe v2 Realtime은 150ms의 초저지연으로 90개 이상의 언어에서 최첨단 수준의 정확도를 제공합니다.

이 모델은 대화형 사용 사례에서 뛰어난 성능을 발휘합니다.

  • 실시간 회의 전사: 실시간 전사에 적합
  • AI 에이전트: 실시간 대화에 이상적
  • 다국어 인식: 자동 언어 인식을 통해 90개 이상의 언어에서 정확한 전사 지원

주요 기능:

  • 초저지연: 약 150밀리초 내에 부분 전사본 제공
  • 스트리밍 지원: 오디오를 청크 단위로 전송하면서 실시간으로 전사본 수신
  • 다양한 오디오 형식: PCM(8kHz~48kHz) 및 μ-law 인코딩 지원
  • 음성 활동 감지(VAD): 무음 감지를 기반으로 한 자동 음성 분할
  • 수동 커밋 제어: 전사 세그먼트를 확정할 시점을 완전히 제어
  • 엔터티 감지
  • 전사본 편집

Scribe v2 Realtime에 대한 자세한 내용은 여기에서 확인하세요.

Scribe v2 Medical

Scribe v2 Medical은 의료 및 임상 오디오에 특화된 배치 음성 인식 모델입니다. Scribe v2를 Finetune한 모델로, 일상 음성에서 Scribe v2와 동일한 정확도를 유지하면서 약품명, 해부학, 병리학 및 임상 받아쓰기 인식 성능을 개선합니다. Scribe v2와 동일한 텍스트 음성 변환 API를 사용하며, 요금도 동일합니다. model_id에 scribe_v2_medical을 전달하세요.

사용 목적

Scribe v2 Medical은 개발자와 조직이 임상의와 환자 간 대화, 받아쓰기, 접수 및 진료 조정 통화 등 임상 오디오를 문서화 및 관련 관리 워크플로를 위한 초안 전사본으로 변환하는 애플리케이션에 통합할 수 있는 배치 음성-텍스트 API 모델입니다. 생성된 텍스트는 사용 전에 의료 전문가 또는 기타 권한이 있는 사용자가 검토하고 수정해야 합니다. Scribe v2 Medical은 임상 정보를 해석하거나 진단, 치료 권고, 임상적 결정 또는 기타 임상 지침을 제공하기 위한 용도가 아닙니다.

이 모델은 다음 용도에 적합합니다.

  • 임상 문서화: 대화 중간에 의학 용어가 등장하는 앰비언트 진료 및 기록
  • 받아쓰기: 약물, 용량 및 소견이 밀도 높게 이어지는 경우
  • 접수 및 조정 통화: 환자가 주로 전화로 자신의 상태를 설명하는 경우
  • 컴플라이언스 워크플로: PHI 카테고리용 엔터티 감지와 결합

주요 기능:

  • Scribe v2와 동일한 요청 형식(keyterms, entity_detection, no_verbatim, 화자 분리, 타임스탬프)
  • 약품명, 해부학 및 병리학 용어의 인식 성능 향상
  • Scribe v2 대비 일상 음성 성능 저하 없음
  • 90개 이상의 언어 지원
  • 다화자 오디오를 위한 화자 분리
  • 동적 오디오 태깅
  • PHI 카테고리를 포함한 엔터티 감지

Scribe v2 Medical은 배치 모델입니다. 실시간 전사에는 Scribe v2 Realtime을 사용하세요.

Scribe v2 Medical은 HIPAA 대상이며, 엔터프라이즈 고객에게는 비즈니스 제휴 계약(BAA) 및 제로 보존 모드(ZRM)를 제공합니다. ZRM을 활성화하면 각 요청이 완료된 직후 오디오 입력과 텍스트 출력이 삭제됩니다. ElevenLabs는 아무것도 보관하지 않으며, 애플리케이션은 전체 API 응답을 수신하고 자체 제어하에 전사본을 보관합니다.

HIPAA 준수가 필요한 기업은 보호 대상 건강 정보를 전송하기 전에 ElevenLabs 영업팀에 문의하여 비즈니스 제휴 계약(BAA)을 체결해야 합니다.

텍스트 음성 변환에 대한 자세한 내용은 여기에서 확인하세요.

Eleven Music

Eleven Music은 스튜디오급 음악 생성 모델입니다. 자연어 프롬프트로 어떤 스타일의 음악이든 생성할 수 있습니다.

이 모델은 다음과 같은 상황에 적합합니다.

  • 게임 사운드트랙: 게임을 위한 몰입감 있는 사운드트랙 제작
  • 팟캐스트 배경음: 전문적인 음악으로 팟캐스트 완성도 향상
  • 마케팅: 광고 릴에 배경 음악 추가

주요 기능:

  • 장르, 스타일 및 구조를 완벽하게 제어
  • 보컬 또는 연주곡만 선택 가능
  • 영어, 스페인어, 독일어, 일본어 등을 포함한 다국어 지원
  • 개별 섹션 또는 곡 전체의 사운드와 가사 편집

Eleven Music에 대한 자세한 내용은 여기에서 확인하세요.

동시성 및 우선순위

구독 플랜에 따라 동시에 처리할 수 있는 요청 수와 큐에서 요청의 우선순위가 결정됩니다. 텍스트 음성 변환에는 상향된 동시성 한도가 적용됩니다. 동시성 한도에 도달하면 이후 요청은 우선순위가 낮은 요청과 함께 큐에서 처리됩니다. 실제로는 일반적으로 약 50ms의 지연만 추가됩니다.

플랜동시성 한도
(Multilingual v2)
동시성 한도
(Flash)
STT 동시성 한도실시간 STT 동시성 한도음악 동시성 한도우선순위
무료248603
스타터3612924
크리에이터510201525
프로1020403025
스케일1530604555
비즈니스1530604555
엔터프라이즈상향됨상향됨상향됨상향됨최고6
스타트업 지원금 수혜자는 스케일 플랜 혜택을 받습니다.

응답 헤더에는 동시성을 모니터링하는 데 사용할 수 있는 current-concurrent-requests 및 maximum-concurrent-requests가 포함됩니다.

분당 API 요청 수와 동시 요청 수

분당 API 요청 수와 동시 요청 수는 사용 패턴에 따라 달라지는 서로 다른 지표라는 점을 이해하는 것이 중요합니다.

분당 API 요청 수는 각 요청의 소요 시간과 요청이 배치되는 방식에 따라 달라지므로 동시 요청 수와 다를 수 있습니다.

예시 1: 간격을 둔 요청 각각 완료까지 1초가 걸리는 분당 180개의 요청을 0.33초 간격으로 전송했다면, 항상 3개의 요청이 진행 중이므로 최대 동시 요청 수와 평균은 모두 3입니다.

예시 2: 배치 요청 반면, 각각 완료까지 3초가 걸리는 분당 180개의 요청을 모두 한 번에 전송하는 등 다른 사용 패턴이라면 최대 동시 요청 수는 180이고 평균은 9입니다(1분 중 처음 3초에는 180개 요청이 한 번에 발생하고, 마지막 57초에는 요청이 0개입니다).

시스템은 동시성을 기준으로 처리하므로, 분당 요청 수보다 각 요청의 소요 시간과 전송 패턴이 더 중요합니다.

엔드포인트 요청 방식은 동시성 한도에 영향을 줍니다.

  • HTTP에서는 각 요청이 동시성 한도에 개별적으로 반영됩니다.
  • 텍스트 음성 변환 WebSocket에서는 모델이 오디오를 생성하는 시간만 동시성 한도에 반영됩니다. 따라서 대부분의 시간 동안 열려 있는 websocket은 동시성 한도에 전혀 반영되지 않습니다.
  • 텍스트 음성 대화 WebSocket은 다르게 작동합니다. 각 열린 연결은 열려 있는 동안 별도 풀에서 대화 세션 하나를 예약하며, 연결을 통해 생성되는 오디오는 표준 동시성 한도에 반영되지 않습니다. 연결 하나가 세션 하나이므로 이해하기 쉽도록 설계되었으며, 새로운 동시성 방식에 맞춰 대화 세션 한도가 조정됩니다. 텍스트 음성 대화 동시성을 참조하세요.

동시성 한도 이해하기

플랜에 연결된 동시성 한도를 동시에 처리할 수 있는 대화, 전화 통화, 캐릭터 보이스오버 등의 최대 수로 해석해서는 안 됩니다. 실제 수는 사용되는 특정 AI 음성과 사용 사례의 특성을 비롯한 여러 요인에 따라 달라집니다.

일반적으로 동시성 한도 5는 약 100개의 동시 오디오 방송을 지원할 수 있습니다.

이는 TTS 요청 처리 시간에 비해 오디오 생성 속도가 빠르기 때문입니다. 아래 다이어그램은 2개의 동시 요청만으로 서로 다른 사용자와의 동시 통화 4개를 지원하는 예시입니다.

동시성 한도

TTS를 사용해 대화를 지원하는 경우, 동시성 한도 5는 AI 에이전트와 사람 참여자 간의 균형 잡힌 대화에서 약 100개의 방송을 지원할 수 있습니다.

고객 지원 상호작용처럼 AI 에이전트가 사람보다 덜 자주 말하는 사용 사례에서는 100개 이상의 동시 대화를 지원할 수 있습니다.

일반적으로 동시성 한도 5로 100개 이상의 동시 캐릭터 보이스오버를 지원할 수 있습니다.

캐릭터의 대사 빈도, 멈춤 시간, 대사 사이의 게임 내 행동에 따라 수는 달라질 수 있습니다.

동시 더빙 스트림은 일반적으로 제공된 기준을 따릅니다.

방송에 대화가 멈추는 구간(예: 사운드트랙, 시각적 장면 등으로 인한 경우)이 포함되면, 제안된 수보다 더 많은 동시 더빙 스트림을 처리할 수 있습니다.

언제든 플랜의 동시성 한도를 초과했고 엔터프라이즈 플랜을 사용 중인 경우, 사용 가능한 용량에 따라 최선의 노력 기준으로 모델 요청이 더 느리게나마 성공할 수 있습니다.

동시성 한도 및 큐 우선순위를 높이려면 구독 플랜을 업그레이드하세요.

엔터프라이즈 고객은 계정 관리자에게 문의하여 더 높은 동시성 한도를 요청할 수 있습니다.

텍스트 음성 대화 동시성

텍스트 음성 대화 요청은 API 호출 방식에 따라 두 가지 방식으로 측정됩니다.

  • HTTP 엔드포인트(대화 생성 및 대화 스트리밍)는 다른 텍스트 음성 변환 요청과 마찬가지로 오디오가 생성되는 동안 플랜의 표준 동시성 한도에 반영됩니다.
  • 텍스트 음성 대화 WebSocket과 같은 WebSocket 엔드포인트는 대화 세션으로 측정됩니다. 열린 연결은 현재 오디오 생성 여부와 관계없이 열려 있는 동안 대화 세션을 유지합니다.

세션 기반 측정은 용량 계획을 간단하게 유지합니다. 연결 하나가 세션 하나이므로 생성 활동에 따라 사용량이 변동하지 않습니다. 오디오 생성 중에만이 아니라 전체 연결 기간 동안 세션이 유지되므로, 새로운 동시성 방식에 맞춰 대화 세션 한도가 조정됩니다.

플랜WebSocket 세션
무료14
스타터21
크리에이터35
프로70
스케일105
비즈니스105
엔터프라이즈상향됨

워크스페이스의 모든 대화 세션을 사용 중인 상태에서 연결을 열면 새 연결은 too_many_concurrent_requests 오류와 함께 거부됩니다. 더 이상 필요하지 않은 연결을 닫아 세션을 확보하세요. keep_alive 메시지를 보내지 않으면 연결은 20초 동안 비활성 상태일 때 자동으로 닫힙니다.

대화 세션을 모니터링하려면 대시보드 사이드바 하단에서 개발자를 열고 분석 탭을 선택한 다음, 사용량 보기에서 동시 요청 지표를 확인하세요. 대화 세션은 다른 동시 요청과 별도로 TTD Websocket Sessions라는 별도 시리즈로 보고됩니다.

동시성 한도 확장 테스트

확장 테스트는 클라이언트 측 확장 문제를 파악하고 사용 사례에 맞게 동시성 한도가 올바르게 설정되었는지 검증하는 데 유용합니다.

실제 사용 환경과 최대한 유사한 엔드투엔드 워크플로를 테스트하는 것을 강력히 권장합니다. 이를 위해 지원할 수 있는 사용자 수를 시뮬레이션하고 측정하는 방법을 권장합니다. 다음 사항이 중요합니다.

  • 원시 요청이 아닌 사용자 시뮬레이션
  • 요청 전에 오디오 재생, 사용자 발화 또는 전사가 완료되기를 기다리는 등 일반적인 사용자 행동 시뮬레이션
  • 수 분에 걸쳐 사용자 수를 천천히 증가
  • 요청 타이밍과 요청 크기에 무작위성 도입
  • API에서 반환되는 지연 시간 지표 및 오류 코드 수집

예를 들어, 100개의 동시 대화를 지원하도록 설계된 에이전트 시스템을 테스트하려면 각각 대화를 시뮬레이션하는 최대 100명의 개별 “사용자”를 생성합니다. 대화는 일반적으로 약 10초의 사용자 발화, 약 150자를 위한 TTS API 호출, 약 10초의 사용자 오디오 재생이 반복되는 주기로 구성됩니다. 따라서 각 사용자는 20초마다 150자 텍스트에 대한 websocket 텍스트 음성 변환 API 호출을 수행해야 하며, 대기 시간과 요청 문자 수에 약간의 무작위성을 도입해야 합니다. 테스트는 초당 사용자 1명을 생성하여 100명에 도달한 후, 전반적인 안정성을 확인하기 위해 총 10분 동안 테스트하는 방식으로 진행됩니다.

이 예시는 테스트 프레임워크로 locust를 사용하며 ElevenLabs API에 직접 API 호출을 수행합니다.

위에 나열된 예시를 따르며, 각 사용자가 20초마다 요청 1개를 전송하는 대화형 에이전트 시스템을 테스트합니다.

Python
import json
import random
import time
import gevent
import locust
from locust import User, task, events, constant_throughput
import websocket
# Averages up to 10 seconds of audio when played, depends on the voice speed
DEFAULT_TEXT = (
"Hello, this is a test message. I am testing if a long input will cause issues for the model "
"like this sentence. "
)
TEXT_ARRAY = [
"Hello.",
"Hello, this is a test message.",
DEFAULT_TEXT,
DEFAULT_TEXT * 2,
DEFAULT_TEXT * 3
]
# Custom command line arguments
@events.init_command_line_parser.add_listener
def on_parser_init(parser):
parser.add_argument("--api-key", default="YOUR_API_KEY", help="API key for authentication")
parser.add_argument("--encoding", default="mp3_22050_32", help="Encoding")
parser.add_argument("--text", default=DEFAULT_TEXT, help="Text to use")
parser.add_argument("--use-text-array", default="false", help="Text to use")
parser.add_argument("--voice-id", default="aria", help="Text to use")
class WebSocketTTSUser(User):
# Each user will send a request every 20 seconds, regardless of how long each request takes
wait_time = constant_throughput(0.05)
def __init__(self, *args, **kwargs):
super().__init__(*args, **kwargs)
self.api_key = self.environment.parsed_options.api_key
self.voice_id = self.environment.parsed_options.voice_id
self.text = self.environment.parsed_options.text
self.encoding = self.environment.parsed_options.encoding
self.use_text_array = self.environment.parsed_options.use_text_array
if self.use_text_array:
self.text = random.choice(TEXT_ARRAY)
self.all_recieved = False
@task
def tts_task(self):
# Do jitter waiting of up to 1 second
# Users appear to be spawned every second so this ensures requests are not aligned
gevent.sleep(random.random())
max_wait_time = 10
# Connection details
uri = f"{self.environment.host}/v1/text-to-speech/{self.voice_id}/stream-input?auto_mode=true&output_format={self.encoding}"
headers = {"xi-api-key": self.api_key}
ws = None
self.all_recieved = False
try:
init_msg = {"text": " "}
# Use proper header format for websocket - this is case sensitive!
ws = websocket.create_connection(uri, header=headers)
ws.send(json.dumps(init_msg))
# Start measuring after websocket initiated but before any messages are sent
send_request_time = time.perf_counter()
ws.send(json.dumps({"text": self.text}))
# Send to flush and receive the audio
ws.send(json.dumps({"text": ""}))
def _receive():
t_first_response = None
audio_size = 0
try:
while True:
# Wait up to 10 seconds for a response
ws.settimeout(max_wait_time)
response = ws.recv()
response_data = json.loads(response)
if "audio" in response_data and response_data["audio"]:
audio_size = audio_size + len(response_data["audio"])
if t_first_response is None:
t_first_response = time.perf_counter()
first_byte_ms = (
t_first_response - send_request_time
) * 1000
if audio_size is None:
# The first response should always have audio
locust.events.request.fire(
request_type="websocket",
name="Bad Response (no audio)",
response_time=first_byte_ms,
response_length=audio_size,
exception=Exception("Response has no audio"),
)
break
if "isFinal" in response_data and response_data["isFinal"]:
# Fire this event once finished streaming, but report the important TTFB metric
locust.events.request.fire(
request_type="websocket",
name="TTS Stream Success (First Byte)",
response_time=first_byte_ms,
response_length=audio_size,
exception=None,
)
break
except websocket.WebSocketTimeoutException:
locust.events.request.fire(
request_type="websocket",
name="TTS Stream Timeout",
response_time=max_wait_time * 1000,
response_length=audio_size,
exception=Exception("Timeout waiting for response"),
)
except Exception as e:
# Typically JSON decode error if the server returns HTTP backoff error
locust.events.request.fire(
request_type="websocket",
name="TTS Stream Failure",
response_time=0,
response_length=0,
exception=e,
)
finally:
self.all_recieved = True
gevent.spawn(_receive)
# Sleep until recieved so new tasks aren't spawned
while not self.all_recieved:
gevent.sleep(1)
except websocket.WebSocketTimeoutException:
locust.events.request.fire(
request_type="websocket",
name="TTS Stream Timeout",
response_time=max_wait_time * 1000,
response_length=0,
exception=Exception("Timeout waiting for response"),
)
except Exception as e:
locust.events.request.fire(
request_type="websocket",
name="TTS Stream Failure",
response_time=0,
response_length=0,
exception=e,
)
finally:
# Try and close the websocket gracefully
try:
if ws:
ws.close()
except Exception:
pass