텍스트 음성 변환
텍스트 음성 변환
ElevenLabs로 텍스트를 생생한 음성 오디오로 변환하는 방법을 알아보세요.
개요
ElevenLabs 텍스트 음성 변환(TTS) API는 섬세한 억양, 속도 및 감정 인식을 바탕으로 텍스트를 생생한 오디오로 변환합니다. ElevenLabs 모델은 32개 언어와 다양한 음성 스타일에서 텍스트 단서에 맞춰 조정되며, 다음과 같은 용도로 사용할 수 있습니다.
- 글로벌 미디어 캠페인 및 광고 내레이션
- 복잡한 감정 표현이 필요한 다국어 오디오북 제작
- 텍스트에서 실시간 오디오 스트리밍
샘플을 들어 보세요.
보이스 라이브러리에서 프로젝트에 꼭 맞는 음성을 찾아보세요.
음성 품질
실시간 애플리케이션에서는 Flash v2.5가 초저지연 75ms를 제공하며, Multilingual v2는 더욱 섬세한 표현으로 최고 품질의 오디오를 제공합니다.
음성 옵션
ElevenLabs는 여러 생성 방식을 통해 32개 언어로 수천 개의 음성을 제공합니다.
- 커뮤니티에서 공유한 3,000개 이상의 음성을 제공하는 보이스 라이브러리
- 가장 높은 충실도의 복제본을 위한 프로페셔널 음성 복제
- 빠른 음성 복제를 위한 즉석 음성 복제
- 텍스트 설명으로 맞춤형 음성을 생성하는 보이스 디자인
음성 옵션에 대해 자세히 알아보세요.
지원되는 출력 형식
기본 응답 형식은 mp3이지만, pcm, ulaw 등 다른 형식도 사용할 수 있습니다.
- MP3
- 샘플 레이트: 22.05kHz - 44.1kHz
- 비트레이트: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- 샘플 레이트: 16kHz - 44.1kHz
- 비트레이트: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16비트 깊이
- μ-law
- 8kHz 샘플 레이트
- 전화 애플리케이션에 최적화
- A-law
- 8kHz 샘플 레이트
- 전화 애플리케이션에 최적화
- Opus
- 샘플 레이트: 48kHz
- 비트레이트: 32kbps - 192kbps
고품질 오디오 옵션은 유료 요금제에서만 제공됩니다. 자세한 내용은 요금제 페이지를 참조하세요.
지원 언어
다국어 v2 모델은 29개 언어를 지원합니다.
영어(미국, 영국, 호주, 캐나다), 일본어, 중국어, 독일어, 힌디어, 프랑스어(프랑스, 캐나다), 한국어, 포르투갈어(브라질, 포르투갈), 이탈리아어, 스페인어(스페인, 멕시코), 인도네시아어, 네덜란드어, 터키어, 필리핀어, 폴란드어, 스웨덴어, 불가리아어, 루마니아어, 아랍어(사우디아라비아, UAE), 체코어, 그리스어, 핀란드어, 크로아티아어, 말레이어, 슬로바키아어, 덴마크어, 타밀어, 우크라이나어 및 러시아어.
Flash v2.5는 v2 모델의 모든 언어와 다음 언어를 포함해 32개 언어를 지원합니다.
헝가리어, 노르웨이어 및 베트남어
지원되는 언어로 텍스트를 입력한 후 보이스 라이브러리에서 일치하는 음성을 선택하기만 하면 됩니다. 가장 자연스러운 결과를 얻으려면 대상 언어 및 지역에 맞는 억양의 음성을 선택하세요.
프롬프팅
모델은 텍스트 입력에서 감정적 맥락을 직접 해석합니다. 예를 들어, “그녀가 신나게 말했다”와 같은 설명 텍스트를 추가하거나 느낌표를 사용하면 음성의 감정에 영향을 줍니다. 안정성 및 유사성과 같은 음성 설정은 일관성을 제어하는 데 도움이 되며, 기본 감정은 텍스트 단서에서 비롯됩니다.
자세한 내용은 프롬프팅 가이드를 참조하세요.
설명 텍스트는 모델이 그대로 발화하므로, 원하는 경우 오디오에서 수동으로 잘라내거나 제거해야 합니다.
FAQ
내 목소리를 복제할 수 있나요?
예. 짧은 오디오 클립으로 자신의 음성을 즉석 음성 복제할 수 있습니다. 높은 충실도의 복제가 필요하다면 프로페셔널 음성 복제 기능을 확인하세요.
오디오 출력물의 소유권은 저에게 있나요?
예. 생성한 모든 오디오의 소유권은 유지됩니다. 단, 상업적 사용 권한은 유료 요금제에서만 제공됩니다. 유료 구독을 이용하면 입력 콘텐츠의 IP 권리를 보유한 경우 생성된 오디오를 상업적 목적으로 사용하고 결과물로 수익을 창출할 수 있습니다.
무료 재생성의 조건은 무엇인가요?
무료 재생성을 이용하면 다음 조건에 따라 추가 비용 없이 동일한 텍스트 음성 변환 콘텐츠를 다시 생성할 수 있습니다.
- 각 콘텐츠는 최대 2회까지 무료로 재생성할 수 있습니다.
- 콘텐츠는 이전 생성본과 정확히 동일해야 합니다. 텍스트, 음성 설정 또는 기타 파라미터를 변경하면 새 유료 생성이 필요합니다.
무료 재생성은 오디오 출력에 약간의 왜곡이 있을 때 유용합니다. ElevenLabs의 내부 벤치마크에 따르면 재생성은 품질 문제의 약 절반을 해결하며, 남은 문제는 대개 부실한 학습 데이터로 인해 발생합니다.
실시간 사용 사례에서 지연 시간을 줄이려면 어떻게 해야 하나요?
실시간에 가까운 대화형 또는 인터랙티브 시나리오에 최적화된 저지연 Flash 모델(Flash v2 또는 v2.5)을 사용하세요. 자세한 내용은 지연 시간 최적화 가이드를 참조하세요.
출력이 가끔 일관되지 않은 이유는 무엇인가요?
모델은 비결정적입니다. 일관성을 높이려면 선택 사항인 seed 파라미터를 사용하세요. 다만 미세한 차이는 여전히 발생할 수 있습니다.
긴 텍스트 변환의 모범 사례는 무엇인가요?
긴 텍스트를 세그먼트로 나누고 실시간 재생 및 효율적인 처리를 위해 스트리밍을 사용하세요. 청크 간 자연스러운 운율 흐름을 유지하려면 이전/다음 텍스트 또는 이전/다음 요청 ID 파라미터를 포함하세요.
핵심 정보
- 결정성: 출력은 비결정적 — 더 일관된 결과를 위해
seed파라미터 사용 - 무료 재생성: 생성당 최대 2회 무료 재생성(동일 콘텐츠 및 파라미터에만 적용)
- 소유권: 생성된 오디오의 소유권은 유지되며, 상업적 사용에는 유료 요금제가 필요
- 저지연 사용 사례: Flash 모델(
eleven_flash_v2또는eleven_flash_v2_5) 사용 — 지연 시간 최적화 가이드 참조 - 긴 텍스트: 긴 텍스트를 세그먼트로 나누고 청크 간 자연스러운 운율을 유지하려면
previous_text/next_text파라미터 사용