텍스트 음성 변환

ElevenLabs로 텍스트를 음성으로 변환하는 방법 안내

개요

ElevenLabs의 텍스트 음성 변환 기술은 전 세계 다양한 애플리케이션에서 고품질 AI 생성 음성을 제공하며, ElevenLabs 서비스의 핵심을 이루고 있습니다. 이미 생생한 오디오 경험을 제공하는 ElevenLabs 음성을 들어 보셨을 가능성이 높습니다.

텍스트 음성 변환으로 첫 오디오를 생성하는 방법은 매우 간단합니다. 하지만 이 기능을 최대한 활용하려면 몇 가지 유의할 점이 있습니다.

가이드

텍스트 음성 변환 데모

1

텍스트 입력

텍스트 음성 변환 페이지의 입력 상자에 텍스트를 입력하거나 붙여넣으세요.

2

음성 선택

화면 왼쪽 하단의 음성 목록에서 사용할 음성을 선택하세요.

3

설정 조정(선택 사항)

원하는 결과에 맞게 음성 설정을 수정하세요.
4

생성

‘생성’ 버튼을 클릭해 오디오 파일을 만드세요.

설정

고품질 음성을 만들기 위한 음성, 모델 및 설정을 알아보세요.

사용하는 설정, 특히 음성과 모델은 출력 결과에 큰 영향을 줍니다. 이러한 요소를 익히고 모범 사례를 이해하는 것이 매우 중요합니다. 다른 설정도 출력에 영향을 주지만, 선택한 음성과 모델에 비하면 영향은 크지 않습니다.

중요도 순서는 다음과 같습니다. 음성 선택이 가장 중요하고, 그다음이 모델 선택, 그리고 모델 설정입니다. 이 모든 요소와 그 조합이 출력 결과에 영향을 줍니다.

음성

텍스트 음성 변환 음성
선택

엄선된 기본 음성, 상상할 수 있는 거의 모든 음성을 갖춘 방대한 보이스 라이브러리, 보이스 디자인 도구로 만든 완전 합성 음성 등 다양한 종류의 음성을 제공합니다. 또한 즉시 음성 복제와 프로페셔널 음성 복제라는 두 가지 기술을 사용해 직접 복제한 음성 컬렉션을 만들 수 있습니다.

모든 음성이 동일한 품질을 제공하는 것은 아니며, 음성을 만드는 데 사용된 원본 오디오에 따라 크게 달라집니다. 어떤 음성은 더 자연스럽고 사람 같은 연기와 전달력을 제공하는 반면, 다른 음성은 더 안정적일 수 있습니다.

콘텐츠에 맞는 음성을 선택하는 것은 매우 중요합니다. 이는 최종 출력에 가장 큰 영향을 미치는 결정일 가능성이 높습니다. 성별, 톤, 억양, 리듬, 전달 방식을 결정합니다. 완벽한 음성을 선택하고 일관되게 기대에 부합하는지 제대로 테스트하는 데 시간을 더 투자할 가치가 있습니다.

특정 언어로 음성을 생성할 때는 보이스 라이브러리에서 해당 언어의 원어민 음성을 사용하거나, 올바른 억양으로 그 언어를 말하는 음성을 복제하면 최상의 결과를 얻을 수 있습니다. 기술적으로는 어떤 음성이든 어떤 언어로도 말할 수 있지만, 원래 억양은 유지됩니다. 예를 들어 원어민 영어 음성으로 프랑스어 음성을 생성하면, AI가 학습하지 않은 언어에서 그 음성이 어떻게 들릴지를 일반화해야 하므로 프랑스어로 출력되지만 영어 억양이 남을 가능성이 높습니다.

음성에 대해 자세히 알아보기

마음에 드는 음성이 있지만 전달 방식을 바꾸고 싶다면 보이스 리믹싱 도구를 활용할 수 있습니다. 자연어 프롬프트를 사용해 음성의 전달 방식, 리듬, 톤, 성별, 심지어 억양까지 바꿀 수 있습니다. 억양을 변경할 때는 기본 음성과 목표 억양이 매우 중요합니다. 결과는 달라질 수 있으며, 완벽하게 작동할 때도 있지만 원하는 결과를 얻기까지 몇 번 시도해야 할 수도 있습니다.

보이스 리믹싱으로 매우 좋은 결과를 얻을 수 있지만, 일반적으로 제대로 복제된 프로페셔널 음성 복제만큼 좋지는 않습니다. 즉시 음성 복제에 더 가까운 결과를 제공합니다.

보이스 리믹싱은 특정 음성에서만 작동한다는 점을 유의하세요. 예를 들어 보이스 라이브러리의 음성은 리믹스할 수 없습니다. 직접 만든 음성이나 기본 음성만 리믹스할 수 있습니다.

모델

텍스트 음성 변환 모델
선택

두 가지 모델 제품군을 제공합니다. 표준(고품질) 모델과 매우 낮은 지연 시간에 최적화된 Flash 모델입니다. 대부분의 제품군에는 영어 전용 버전과 다국어 버전이 모두 포함됩니다.

Eleven v4는 최신 모델입니다. Eleven v4와 Eleven v4 Turbo의 두 가지 버전으로 제공됩니다.

모델 선택은 음성 선택 다음으로 최종 오디오 출력에 큰 영향을 미칩니다. 선택한 음성으로 여러 모델을 테스트해 가장 잘 맞는 조합을 찾는 것이 좋습니다. 모든 모델에는 장단점이 있으며 일부 음성과는 다른 음성보다 더 잘 작동하므로, 좋은 조합을 찾는 것이 중요합니다.

출력이 영어로만 구성된다면 영어 전용 모델 중 하나를 사용하는 것을 강력히 권장합니다. 일반적으로 사용하기 쉽고 안정적이며, 영어 전용 콘텐츠에서 더 뛰어난 성능을 제공합니다. 콘텐츠가 다른 언어이거나 다국어일 가능성이 있다면 다국어 모델 중 하나를 사용해야 합니다.

모델에 대해 자세히 알아보기

음성 설정

텍스트 음성 변환 음성
설정

가장 일반적인 설정은 안정성 약 50, 유사성 약 75, 스타일 0이며, 이후에는 최소한의 조정만 하는 것입니다. 물론 이는 원본 음성과 목표로 하는 연기 스타일에 따라 달라집니다.

AI는 비결정적이라는 점에 유의해야 합니다. 슬라이더를 특정 값으로 설정해도 매번 같은 결과가 보장되지는 않습니다. 대신 슬라이더는 각 생성 결과 간 무작위화의 범위를 결정하는 역할을 합니다.

속도

속도 설정으로 생성된 음성의 재생 속도를 높이거나 낮출 수 있습니다. 기본값은 1.0이며, 속도가 조정되지 않은 상태를 의미합니다. 1.0 미만의 값은 최소 0.7까지 음성 속도를 낮춥니다. 1.0 초과의 값은 최대 1.2까지 음성 속도를 높입니다. 극단적인 값은 생성된 음성의 품질에 영향을 줄 수 있습니다.

속도는 Eleven v3 모델에서 사용할 수 없습니다.

안정성

안정성 슬라이더는 음성의 안정성과 각 생성 간 무작위성을 결정합니다. 이 슬라이더를 낮추면 음성의 감정 표현 범위가 넓어집니다. 앞서 언급했듯이 이는 원본 음성의 영향을 크게 받습니다. 슬라이더를 너무 낮게 설정하면 지나치게 무작위적인 어색한 연기가 나타나거나 캐릭터가 너무 빠르게 말할 수 있습니다. 반면 너무 높게 설정하면 감정 표현이 제한된 단조로운 음성이 될 수 있습니다.

더 생동감 있고 극적인 연기를 원한다면 안정성 슬라이더를 낮게 설정하고, 마음에 드는 결과를 찾을 때까지 몇 번 생성하는 것이 좋습니다.

반면 매우 높은 값에서는 단조롭게 느껴질 수 있는, 더 진지한 연기를 원한다면 안정성 슬라이더를 높게 설정하는 것이 좋습니다. 더 일관되고 안정적이므로 원하는 결과를 얻기 위해 일반적으로 많은 샘플을 생성할 필요가 없습니다. 자신에게 가장 적합한 설정을 찾아보세요!

유사성

유사성 슬라이더는 AI가 원본 음성을 재현할 때 얼마나 가깝게 따를지를 결정합니다. 원본 오디오의 품질이 낮고 유사성 슬라이더가 너무 높게 설정되면, 원본 녹음에 아티팩트나 배경 소음이 있었을 경우 AI가 음성을 모방하면서 이를 재현할 수 있습니다.

유사성은 Eleven v3 모델에서 사용할 수 없습니다.

스타일 과장

최신 모델 도입과 함께 스타일 과장 설정도 추가했습니다. 이 설정은 원래 화자의 스타일을 증폭하려고 시도합니다. 추가 컴퓨팅 리소스를 사용하며, 0이 아닌 값으로 설정하면 지연 시간이 증가할 수 있습니다. 이 설정을 사용하면 원본 음성의 스타일을 강조하고 모방하려 하기 때문에 모델의 안정성이 약간 떨어질 수 있다는 점에 유의해야 합니다.

일반적으로 이 설정은 항상 0으로 유지하는 것을 권장합니다.

화자 부스트

이 설정은 원래 화자와의 유사성을 높입니다. 하지만 이 설정을 사용하면 컴퓨팅 부하가 약간 증가하고, 이에 따라 지연 시간도 늘어납니다. 이 설정으로 인한 차이는 일반적으로 상당히 미묘합니다.

화자 부스트는 Eleven v3 모델에서 사용할 수 없습니다.

생성

음성을 선택하고 모델을 고른 뒤 설정을 구성했다면 생성 과정은 간단합니다. 텍스트를 입력하고 “음성 생성”을 누르면 오디오가 생성됩니다.

표면적으로는 매우 간단한 과정이지만, 원하는 출력을 얻으려면 입력 텍스트가 매우 중요합니다. 낯선 이름, 일반적이지 않은 약어, 기호, 이모지처럼 AI가 학습 중 거의 접하지 못한 요소, 즉 “분포 밖”의 단어를 사용하면 AI가 혼란스러워지고 출력이 불안정해질 수 있습니다. 특히 이모지와 특정 기호는 AI가 올바르게 해석하기 어렵습니다.

UI에서 텍스트 음성 변환을 사용할 때는 텍스트 가독성을 높이고 AI가 더 쉽게 처리할 수 있도록 입력에 자동 정규화 단계를 적용합니다. 일반적으로 이 단계에서는 기호와 숫자를 풀어 쓴 텍스트로 변환하여 AI가 올바르게 발음하도록 안내합니다.

특히 다국어 모델을 사용할 때는 숫자를 숫자 형태로 쓰거나 기호를 사용하는 것을 피하는 것이 강력히 권장하는 모범 사례입니다. 영어 전용 모델에도 적용됩니다. 숫자와 기호는 여러 언어에서 동일하게 표기되지만 발음은 다르므로, 숫자 표기에 의존하면 AI에 모호함이 생깁니다. 예를 들어 숫자 “1”은 영어와 다른 많은 언어에서 동일하게 쓰이지만 발음은 다릅니다. “one”처럼 숫자를 텍스트로 풀어 쓰면 AI가 무엇을 해야 하는지 해석할 필요가 없어집니다.

오디오 태그라고 부르는 기능을 사용해 AI의 전달 방식과 연기에 영향을 줄 수 있는 더 고급 워크플로를 개발하고 있습니다. 이 기능은 Eleven v4와 Eleven v3에서 사용할 수 있습니다. 이 기능에 대해 자세히 알고 싶다면 프롬프팅 가이드를 읽어보시기 바랍니다.

FAQ

첫 번째이자 가장 중요한 요소 중 하나는 좋은 품질의 일관된 입력이 좋은 품질의 일관된 출력으로 이어진다는 점입니다.

AI에 이상적이지 않은 오디오, 예를 들어 소음이 많거나 선명한 음성에 리버브가 있거나 여러 화자가 있거나 볼륨 또는 연기와 전달 방식이 일관되지 않은 오디오를 제공하면 AI가 더 불안정해지고 출력 결과도 더 예측하기 어려워집니다.

자신의 음성을 복제할 계획이라면, 최상의 기반에서 시작할 수 있도록 적절한 음성 복제본을 만드는 방법에 관한 문서의 가이드라인을 반드시 확인하는 것이 좋습니다. 즉시 음성 복제만 사용할 계획이더라도 프로페셔널 음성 복제 섹션도 읽어보는 것이 좋습니다. 두 기술의 요구 사항은 약간 다르지만, 이 섹션에는 음성 복제본을 만드는 데 유용한 정보가 담겨 있습니다.

두 번째로 고려할 요소는 선택한 음성이 출력 결과에 막대한 영향을 준다는 점입니다. 첫 번째 요소에서 언급했듯이 특정 복제본을 만들기 위해 사용된 샘플의 품질과 일관성뿐 아니라 음성의 언어와 톤도 매우 중요합니다.

행복하고 밝게 들리는 음성을 원한다면 행복하고 밝은 샘플을 사용해 복제한 음성을 사용해야 합니다. 반대로 사색적이고 침잠한 느낌의 음성을 원한다면 그러한 특성을 가진 음성을 선택해야 합니다.

하지만 올바른 언어로 학습된 음성을 사용하는 것도 매우 중요합니다. 예를 들어 기본 음성으로 제공하는 모든 프로페셔널 음성 복제는 영어 음성이며 영어 샘플로 학습되었습니다. 따라서 이러한 음성으로 다른 언어를 말하게 하면 해당 언어에서의 연기는 예측하기 어려울 수 있습니다. AI가 말하게 하려는 언어를 해당 음성이 말한 샘플로 복제된 음성을 사용하는 것이 필수적입니다.

다소 사소해 보일 수 있지만 큰 차이를 만들 수 있습니다. AI는 사용된 단어뿐 아니라 단어의 조합 방식, 문장 부호 사용, 문법, 텍스트의 전반적인 형식을 포함한 텍스트 자체의 맥락을 바탕으로 읽는 방법을 이해하려고 합니다.

이는 AI의 전달 방식에 작지만 큰 영향을 줄 수 있습니다. 단어 철자를 틀리면 AI는 이를 수정하지 않고 작성된 대로 읽으려 합니다.

AI의 설정은 비결정적입니다. 즉, 동일한 초기 조건(음성, 설정, 모델)에서도 성우가 매번 약간씩 다른 연기를 선보이는 것처럼 약간씩 다른 출력이 생성됩니다.

이러한 변동성은 앞서 언급한 음성, 설정, 모델 등의 다양한 요인으로 인해 발생할 수 있습니다. 일반적으로 변동성의 폭은 안정성 슬라이더로 제어할 수 있습니다. 안정성 설정이 낮을수록 생성 결과 간 변동 범위가 넓어지지만, AI가 조금 더 연기하듯 표현하는 생성 간 변동성도 생깁니다.

안정성을 너무 높게 설정하면 AI가 더 다양한 콘텐츠를 생성할 여유를 충분히 얻지 못해 특정 음성이 단조롭게 들릴 수 있으므로, 더 넓은 변동성이 바람직한 경우가 많습니다. 하지만 안정성을 너무 낮게 설정하면 생성 결과가 불안정해지는 다른 문제가 발생할 수 있으며, 특히 복제 과정에서 이상적이지 않은 오디오를 사용했을 수 있는 특정 음성에서 그렇습니다.

기본값인 50은 대부분의 애플리케이션에서 훌륭한 시작점입니다.

Eleven v4로 전환하고 자체 콘텐츠로 테스트해 보시기를 권장합니다.

Eleven v4는 최신이자 가장 발전된 텍스트 음성 변환 모델이며, 새로운 세대 모델의 첫 번째 모델입니다. Eleven v3와 비교해 출력 품질, 음성 정확도, 감정, 오디오 태그 및 언어 지원 범위가 개선되었습니다.

Eleven v4에서는 음성 복제 정확도가 크게 향상되었습니다. 복제 음성은 이전 어떤 모델보다 원본 음성의 특성인 음색, 말의 리듬 및 전달 방식을 더 충실하게 담아냅니다.

즉시 음성 복제(IVC)는 Eleven v4에서 그 어느 때보다 정확합니다. 원본 음성의 핵심 특성을 더 충실하게 포착하므로, 짧은 오디오 샘플만으로도 설득력 있는 복제 음성을 빠르게 만들 수 있습니다.

프로페셔널 음성 복제(PVC)는 Eleven v4에서 완전히 지원됩니다. 동일한 음성 정확도 향상을 바탕으로, 최고 수준의 일관성과 제어가 필요한 워크플로에 원본 음성을 더 충실하게 재현합니다.

Eleven v4는 두 가지 버전으로 제공되므로, 사용 사례에 맞는 품질과 속도의 균형을 선택할 수 있습니다.

  • Eleven v4 (eleven_v4) — 최고 품질의 모델로, 콘텐츠 제작, 오디오북, 캐릭터 보이스오버 및 품질이 최우선인 모든 사용 사례에 적합합니다.
  • Eleven v4 Turbo (eleven_v4_turbo) — 인상적으로 낮은 지연 시간을 유지하면서도 매우 높은 품질을 제공하며, 대화형 에이전트 및 인터랙티브 음성 경험과 같은 실시간 사용 사례를 위해 설계되었습니다.

두 버전 모두 안정성 및 유사성의 두 가지 음성 설정을 사용합니다. Eleven v4에서는 스타일 및 속도 슬라이더를 사용할 수 없으며, SSML도 지원되지 않습니다.

생성하려는 언어가 참조 음성의 언어와 같으면 기존과 마찬가지로 원래 억양이 그대로 유지됩니다. 생성하려는 언어가 참조 음성의 언어와 다르면, Eleven v4는 참조 음성의 원래 언어 억양을 가져오는 대신 대상 언어로 유창하고 자연스러운 음성을 생성합니다.

모델 ID eleven_v4를 사용하여 음성 생성 및 음성 스트리밍으로 생성할 수 있습니다. 여러 화자의 경우 대화 생성 및 대화 스트리밍을 사용하세요.

복제, 억양, 비교 및 전체 설명은 Eleven v4를 참조하세요. 태그 및 프롬프팅은 Eleven v4 프롬프팅을 참조하세요.

Eleven v4로 전환하고 자체 콘텐츠로 테스트해 보시기를 권장합니다. Eleven v4의 다양한 프롬프팅 기법은 Eleven v3에도 적용됩니다.

Eleven v3는 감정 표현이 풍부한 텍스트 음성 변환 모델입니다. 70개 이상의 언어에서 폭넓은 감정 표현과 맥락 이해를 바탕으로 자연스럽고 생생한 음성을 생성합니다.

Eleven v3의 기능:

  • 오디오 태그 지원
    • 감정: [sad] [angry] [happily]
    • 전달 방식 지시: [whispers] [shouts]
    • 비언어적 반응: [laughs] [clears throat] [sighs]
  • 여러 화자가 자연스럽게 들리는 오디오를 위한 대화 모드
  • 70개 이상의 언어 지원

이 모델은 캐릭터 간 대화, 오디오북 내레이션 및 감정적인 대화에 적합합니다.

모델 ID eleven_v3을 지정하면 API의 음성 생성 및 음성 스트리밍 엔드포인트를 통해 v3로 생성할 수 있습니다.

대화 생성 및 대화 스트리밍 엔드포인트를 사용해 여러 화자가 등장하는 자연스러운 대화를 만들 수도 있습니다.

자세한 내용은 다음 리소스를 참조하세요.

음성 속도 제어는 음성 합성, Studio, ElevenAgents 및 API를 통한 텍스트 음성 변환에서 사용할 수 있습니다.

속도 설정을 사용해 음성 속도를 조절할 수 있습니다.

설정 가능한 값은 0.7~1.2입니다. 1보다 작은 값은 음성을 느리게 하고, 1보다 큰 값은 빠르게 합니다. 극단적인 값은 생성된 음성의 품질에 영향을 줄 수 있습니다. 

이 설정은 모든 음성과 모든 모델에서 사용할 수 있습니다. 음성 설정에서 찾을 수 있습니다.

API 사용 시 음성을 제어하는 방법은 API 레퍼런스를 참조하세요.

모든 음성은 지원되는 모든 언어를 말할 수 있습니다.

현재 모델에서는 특정 언어를 선택하는 대신 AI가 말할 언어로 텍스트를 작성하면 AI가 자동으로 이해합니다. 다만 서로 다른 언어에는 비슷한 단어와 어휘를 사용하지만 발음과 억양은 매우 다른 경우가 있으므로, 올바른 억양의 언어로 말하는 음성을 복제한 음성을 사용해야 합니다.

언어는 텍스트로 결정되고, 억양과 발음은 음성 자체로 결정됩니다. 최적으로 작동하려면 이 두 가지 맥락이 모두 필요합니다.

언어 선택을 더 쉽게 하는 새로운 기술을 개발하고 있지만, AI의 구조상 이 모든 기능은 아직 개발 중입니다.

생성된 파일은 두 가지 방법으로 다운로드할 수 있습니다.

콘텐츠를 생성한 후 오른쪽 하단의 다운로드 버튼을 클릭하면 생성된 파일을 바로 다운로드할 수 있습니다.

이전에 생성한 파일은 기록에서 다운로드할 수 있습니다. 

기록에 액세스하려면 계정에 로그인한 후 사이드바에서 텍스트 음성 변환을 선택하고, 화면 오른쪽 패널의 기록 탭을 클릭하세요. 좁은 화면에서는 음성 생성 버튼 위의 기록 아이콘을 클릭해 기록에 액세스할 수 있습니다.

기록에서 다운로드 아이콘을 클릭하면 MP3(128kbps) 또는 WAV 파일로 다운로드하는 옵션을 볼 수 있습니다. 

고급을 클릭하면 추가 파일 형식으로도 다운로드할 수 있습니다.

  • MP3(192kbps)
  • MP3(256kbps)
  • M4A
  • FLAC

네. Eleven v4 및 Eleven v3에서는 [sighs] 또는 [exhales] 같은 오디오 태그를 사용해 생성된 음성에 숨소리와 유사한 반응을 추가할 수 있습니다.

오디오 태그와 전달 방식 제어에 대한 자세한 내용은 프롬프팅 가이드를 참고하세요.

Flash 및 Turbo 모델은 지연 시간이 짧은 애플리케이션을 위해 특별히 개발되었습니다.

Flash v2와 Flash v2.5는 초저지연 모델로, 75ms 이내에 오디오를 생성합니다. Flash v2는 영어만 지원하며, Flash v2.5는 32개 언어를 지원합니다. 지원되는 모든 언어의 전체 목록은 여기에서 확인할 수 있습니다.

Turbo 모델도 지연 시간이 짧지만, Flash 모델이 매우 유사한 결과를 제공하므로 Turbo보다 Flash 모델 사용을 권장합니다. Turbo v2는 영어만 지원하며, Turbo v2.5는 32개 언어를 지원하고 Turbo v2보다 25% 빠르며 약 300ms 내에 오디오를 생성합니다.

Flash와 Turbo는 모두 음성 성능을 희생하지 않으면서도 사용자가 ElevenLabs 모델에 기대하는 품질 기준을 유지하도록, 지연 시간이 짧은 애플리케이션에 맞게 특별히 최적화된 모델입니다.

두 모델 모두 API를 통해 생성하면 할인된 가격이 적용됩니다. 자세한 내용은 API 가격을 참고하세요.

맞춤형 대화형 음성 에이전트를 배포할 수 있는 플랫폼인 ElevenAgents도 제공합니다. 자세한 내용은 ElevenAgents 문서를 참고하세요.

일시 정지나 휴지를 넣고 화자의 리듬과 억양을 조절하는 방법은 몇 가지가 있습니다. 사용할 방법은 모델에 따라 다릅니다.

오디오 태그(Eleven v4 및 Eleven v3)

Eleven v4 및 Eleven v3에서는 오디오 태그와 문장 부호를 사용해 속도와 전달 방식을 제어하세요. 이 모델은 SSML break 태그를 지원하지 않습니다.

일시 정지와 전달 방식을 프롬프팅하는 방법은 프롬프팅 가이드를 참고하세요.

Break 태그(Multilingual v2, Flash v2 및 Flash v2.5)

Multilingual v2, Flash v2 및 Flash v2.5에서 일시 정지를 추가하는 가장 일관된 방법은 SSML break 태그 구문 <break time="1.5s" />을 사용하는 것입니다. 이 방식은 음성에 정확하고 자연스러운 일시 정지를 만듭니다. 단어 사이에 단순히 무음을 삽입하는 것이 아니라, 모델이 구문을 이해하고 자연스러운 일시 정지를 추가합니다.

이러한 일시 정지를 처리하는 방식은 모델에 따라 달라질 수 있습니다. 사용하는 음성이 출력 결과에 중요한 역할을 합니다. “uh”나 “ah” 같은 소리가 포함된 데이터로 학습된 일부 음성은 실제 화자처럼 일시 정지 중에 이러한 음성적 습관을 삽입할 수 있습니다.

예시는 다음과 같습니다.

“생각할 시간을 1초만 주세요.” <break time="1.0s" /> “네, 그렇게 하면 되겠네요.”

Break 시간은 초 단위로 지정해야 합니다. AI는 최대 3초까지의 일시 정지를 처리할 수 있으며, 텍스트 음성 변환과 API에서 사용할 수 있습니다.

텍스트에 SSML break를 과도하게 사용하면 문제가 발생할 수 있습니다. 음성이 빨라지거나 오디오에 더 많은 노이즈 및 기타 아티팩트가 생길 수 있습니다. 이 문제를 해결하기 위해 작업하고 있습니다.

문장 부호

이 옵션들은 break 태그나 오디오 태그보다 일관성은 떨어지지만, 속도에 영향을 줄 수 있습니다.

간단한 대시 - 또는 긴 대시 —가 잘 작동하는 경우가 많습니다. 더 긴 일시 정지를 위해 -- --처럼 여러 대시를 추가할 수 있습니다.

“이제 - 시간이 - 늦었어요.”

말줄임표 ...는 때때로 단어 사이에 일시 정지를 추가할 수 있지만, 대개 음성에 망설임이나 긴장감을 더하므로 항상 적합하지는 않을 수 있습니다.

“저는… 네, 그런 것 같아요…”

Eleven v3는 국제 음성 기호(IPA)를 기본 지원합니다. 자세한 내용은 Eleven v3의 IPA에서 확인하세요.

SSML 음소 태그(Flash v2 및 Turbo v2 전용)

Flash v2 및 Turbo v2에서는 SSML 음소 태그로 특정 발음을 지정할 수 있습니다. IPA와 CMU를 모두 지원합니다. 현재 구현에서는 CMU가 좀 더 예측 가능하고 일관된 경향이 있습니다. 자세한 내용은 발음 가이드에서 확인할 수 있습니다.

대체 철자

또 다른 해결 방법은 대체 철자를 찾아 단어를 발음에 가깝게 표기하는 것입니다. 대문자, 대시, 아포스트로피를 사용하거나 단일 문자 또는 여러 글자를 작은따옴표로 묶는 등 다양한 방법을 활용할 수 있습니다.

예를 들어 “trapezii” 같은 단어는 단어의 “ii”를 더 강조하기 위해 “trapezIi”로 표기할 수 있습니다.

Eleven v4 및 Eleven v3는 오디오 태그를 지원합니다. Eleven v4를 권장합니다. 짧은 지시문을 대괄호로 묶어 전달 방식이 바뀌어야 하는 위치에 텍스트로 넣으세요. 두 모델에서 동일한 태그를 사용할 수 있습니다.

  • 감정: [curious] [crying] [mischievously]
  • 전달 방식 지시: [whispers] [shouts]
  • 사람의 반응: [laughs] [clears throat] [sighs]

자세한 내용은 프롬프팅 가이드를 참고하세요.

모델 ID eleven_v4 또는 eleven_v3을 지정하여 음성 생성 및 음성 스트리밍 엔드포인트를 통해 API로 생성할 수 있습니다.

대화 생성 및 대화 스트리밍 엔드포인트를 사용하면 여러 화자가 참여하는 자연스러운 대화도 만들 수 있습니다.

실시간 애플리케이션에서는 Eleven v4 Turbo(eleven_v4_turbo)도 오디오 태그를 지원합니다.

자세한 내용은 다음 리소스를 참고하세요.

텍스트 음성 변환 또는 보이스 체인저로 생성한 파일은 MP3, WAV, M4A 또는 FLAC 파일로 다운로드할 수 있습니다. WAV, M4A 및 FLAC 파일은 기록에서 다운로드해야 합니다.   

WAV 파일 다운로드 방법

사이드바에서 텍스트 음성 변환 또는 보이스 체인저를 선택한 다음, 화면 오른쪽 패널의 기록 탭을 클릭해 기록에 액세스하세요. 좁은 화면에서는 음성 생성 버튼 위의 기록 아이콘을 클릭해 기록에 액세스할 수 있습니다.

기록에서 다운로드 아이콘을 클릭하면 MP3 또는 WAV 파일로 다운로드하는 옵션을 볼 수 있습니다.

FLAC 또는 M4A 파일 다운로드 방법

사이드바에서 텍스트 음성 변환 또는 보이스 체인저를 선택한 다음, 화면 오른쪽 패널의 기록 탭을 클릭해 기록에 액세스하세요. 좁은 화면에서는 음성 생성 버튼 위의 기록 아이콘을 클릭해 기록에 액세스할 수 있습니다.

기록에서 다운로드 아이콘을 클릭하면 MP3 또는 WAV 파일로 다운로드하는 옵션을 볼 수 있습니다. FLAC 및 M4A를 포함한 추가 파일 형식에 액세스하려면 고급을 클릭하고 원하는 형식을 선택하세요.

웹사이트에서 생성할 때의 언어

ElevenLabs 웹사이트에서 오디오를 생성하면 AI가 프롬프트 텍스트의 문맥을 바탕으로 언어를 자동 감지합니다. 따라서 하나의 프롬프트에 여러 언어를 사용하면 어떤 언어를 사용해야 하는지 혼란을 일으킬 수 있으므로 피하는 것이 좋습니다. 현재 웹사이트에서 생성할 때는 언어를 지정할 수 없습니다. 

API로 생성할 때의 언어

API를 통해 오디오를 생성하는 경우 language_code 파라미터를 사용해 프롬프트의 언어를 직접 지정할 수 있습니다. 이 선택적 파라미터는 ISO 639-1 언어 코드를 허용합니다. 

텍스트에 숫자만 포함된 경우처럼 짧거나 모호한 프롬프트에 유용할 수 있습니다. 언어를 지정하면 정규화 도구가 해당 언어에 맞는 규칙을 적용하도록 할 수 있습니다.

정규화에 대한 자세한 내용은 이 문서. 를 참고하세요.

억양

생성에 사용되는 억양은 선택한 음성에서 비롯됩니다. 생성하려는 언어로 학습되지 않은 음성을 사용하면 음성의 원래 언어에서 비롯된 약한 억양이 느껴질 수 있습니다.

최상의 결과를 위해서는 생성하려는 언어와 선호하는 억양의 오디오로 학습된 음성을 사용하는 것이 좋습니다. 이렇게 하면 AI가 발음과 억양을 더 정확하게 이해할 수 있습니다.

이는 서로 유사하거나 공통 단어가 많은 언어에서 특히 중요합니다. 올바른 언어로 학습된 음성을 선택하면 AI가 올바른 발음과 억양을 사용하도록 할 수 있습니다.

다음과 같은 방법을 사용할 수 있습니다.

  • 선호하는 언어와 억양의 오디오를 사용해 복제 음성 만들기
  • 보이스 라이브러리 탐색 후 검색 필터를 사용해 필요에 맞는 음성 찾기

웹사이트에서 Eleven v3로 생성하는 비용은 문자당 1크레딧입니다. API 생성에는 할인이 적용됩니다. 자세한 내용은 API 가격을 참고하세요. 

자세한 내용은 다음 리소스를 참고하세요.

Eleven v4 및 Eleven v3에서는 [laughs] 같은 오디오 태그를 사용해 생성된 음성에 웃음과 기타 반응을 추가할 수 있습니다. 자세한 내용은 프롬프팅 가이드를 참고하세요.

다른 모델에서는 감정 표현이 문맥, 문장 부호 및 음성 설정에 따라 달라집니다. 감정을 표현하려면 어떻게 하나요?를 참고하세요.

모델은 각 발화의 더 넓은 맥락에 민감합니다. 앞뒤 텍스트와의 연결을 통해 내용이 자연스러운지 판단합니다. 이러한 넓은 관점 덕분에 여러 문장에 걸친 특정 생각의 흐름에 일관된 감정 패턴을 입혀, 긴 구절도 적절한 억양으로 표현할 수 있습니다.

감정을 표현하는 팁:

  • 특정 감정을 생성하려면 맥락이 중요합니다. 웃거나 재미있는 텍스트를 입력하면 행복한 결과가 나올 수 있습니다. 분노, 슬픔 및 기타 감정도 마찬가지로 맥락 설정이 핵심입니다.
  • 출력 방식에는 문장 부호와 음성 설정이 가장 큰 영향을 줍니다.
  • 관련 단어나 구절을 따옴표로 묶어 강조하세요.
  • 복제된 음성으로 생성한 음성은 복제에 사용하기 위해 업로드한 샘플의 말하기 스타일을 출력에 재현합니다. 업로드한 샘플의 음성이 단조롭다면, 모델이 표현력 있는 결과를 생성하기 어려울 수 있습니다.

Eleven v4 및 Eleven v3에서는 오디오 태그를 사용해 감정과 전달 방식을 더 직접적으로 제어할 수도 있습니다. 예: [happy], [sad], [angry], [whispers], [laughs]. 자세한 내용은 프롬프팅 가이드를 참조하세요.

이 팁은 감정 표현을 유도하는 데 도움이 되지만, 특정 결과를 보장하지는 않습니다.

죄송하지만 현재는 생성 기반 차감의 대안으로 다운로드 기반 차감을 제공하지 않습니다. 현재는 할당량을 차감하지 않고 생성 결과를 미리 볼 수 있는 방법이 없습니다.

웹사이트에서 ‘Generate’를 누르면 서버를 가동하고 오디오를 생성해야 하므로 크레딧이 차감됩니다. 크레딧을 사용하지 않고 자체 텍스트로 음성을 테스트하거나 미리 볼 수 있는 방법은 없습니다.

웹사이트의 텍스트 음성 변환에서는 다음 조건에서 무료 재생성을 2회 허용합니다.

  • 프롬프트(텍스트 음성 변환의 경우) 또는 파일(보이스 체인저의 경우), 음성 및 모델이 동일해야 합니다. 음성 설정 슬라이더는 변경할 수 있습니다.
  • 첫 번째 생성 후 2시간이 지나지 않아야 합니다.
  • 원본 오디오를 생성한 후 페이지를 새로고침하지 않아야 합니다.

이 조건에 해당하면 ‘Regenerate speech’가 표시됩니다. ‘Regenerate speech’ 버튼에 마우스를 올리면 남은 무료 재생성 횟수가 표시됩니다.

무료 재생성을 모두 사용하면 버튼이 ‘Generate speech’로 돌아가며, 생성에 사용할 크레딧 수가 표시됩니다.

무료 재생성은 웹사이트의 텍스트 음성 변환에서만 사용할 수 있습니다. API에서는 사용할 수 없습니다.

가격이나 비용을 올리지 않고 이 품질로 미리보기를 제공할 방법을 검토하고 있습니다. 또한 미리보기가 필요 없도록 AI의 제어 가능성을 높여, 가능하면 첫 시도에 원하는 결과를 얻을 수 있는 방법도 모색하고 있습니다.

Eleven v4 및 Eleven v3는 대화 모드를 제공합니다. 대화 모드를 사용하면 대화 맥락에 따라 자연스러운 속도로 중단, 어조 변화 및 감정적 단서를 처리하는 역동적인 다화자 대화를 생성할 수 있습니다.

웹사이트에서 여러 화자를 사용하면 대화 모드를 이용할 수 있습니다.

Text to Dialogue API 엔드포인트를 사용해 다화자 상호작용을 생성할 수도 있습니다. 자세한 내용은 API 문서를 참조하세요.

자세한 내용은 다음 리소스를 참조하세요.

모든 음성은 현재 AI가 지원하는 모든 언어를 말할 수 있습니다. 하지만 AI가 말하게 하려는 언어의 원어민 음성을 사용하지 않는 경우, 예를 들어 생성된 음성이나 영어로 말하는 음성을 복제해 사용하는 경우에는 AI에 약한 영어 억양이 생기거나 유사한 언어 사이를 오갈 수 있습니다.

지원되는 전체 언어 목록은 다음 문서를 참조하세요. 어떤 언어를 지원하나요?

현재 모델에서는 특정 언어를 선택하지 않습니다. 대신 AI가 말하게 하려는 언어로 작성하면 AI가 자동으로 이해합니다. 다만 서로 다른 언어 간에는 유사한 단어와 어휘를 사용하지만 발음과 억양이 상당히 다른 경우가 있으므로, 올바른 억양으로 해당 언어를 말하는 음성을 복제한 음성을 사용해야 합니다. 그러면 AI가 무엇을 어떤 언어로 말해야 하는지에 대한 맥락을 가장 잘 파악할 수 있습니다.

언어는 텍스트로 결정되며, 억양과 발음은 음성 자체로 결정됩니다.

언어 선택을 지원하는 새로운 기술을 개발하는 방안을 검토하고 있지만, AI의 구조상 이 모든 기능은 아직 개발 중입니다.

웹사이트의 텍스트 음성 변환에서는 모든 유료 플랜에서 한 번에 최대 5,000자, 모든 무료 플랜에서 최대 2,500자를 생성할 수 있습니다.

하지만 수천 자가 넘는 긴 형식의 콘텐츠를 생성하려는 경우, 책과 소설처럼 매우 긴 콘텐츠를 쉽게 생성할 수 있는 Studio 사용을 적극 권장합니다. 자세한 내용은 여기에서 확인할 수 있습니다.

API로 생성하는 경우 최대 입력 길이는 사용하는 모델에 따라 다릅니다.

텍스트 음성 변환

Flash v2.5 - 최대 40,000자(약 40분 분량의 오디오)

Turbo v2.5 - 최대 40,000자(약 40분 분량의 오디오)

Flash v2 - 최대 30,000자(약 30분 분량의 오디오)

Turbo v2 - 최대 30,000자(약 30분 분량의 오디오)

Multilingual v2 - 최대 10,000자(약 10분 분량의 오디오)

보이스 체인저

Multilingual v2 - 최대 10분 분량의 오디오

모든 사전 제작 음성과 생성된 음성은 영어 기반입니다. 따라서 다른 언어를 말할 때 정확한 억양이나 발음이 나오지 않을 수 있습니다.

보이스 라이브러리의 프로페셔널 카테고리에서는 커뮤니티가 ElevenLabs와 공유한 음성을 찾을 수 있습니다. 이 음성들은 본인이 직접 만든 프로페셔널 음성 복제 음성입니다. 일반적으로 복제된 언어를 나타내는 언어 태그가 있어 해당 언어의 원어민 음성으로 사용할 수 있습니다. 특정 언어로 필터링하려면 언어 검색 필터를 사용할 수도 있습니다.

숫자, 날짜, 기호, 약어는 올바르게 읽는 방식이 여러 가지일 수 있어 AI에 어려움이 될 수 있습니다. 사용하는 언어에 따라서도 달라질 수 있습니다. 예를 들어 “11”은 “Eleven”으로 읽을 수도 있지만, 스페인어에서는 “Once”, 독일어에서는 “Elf”로 읽을 수도 있습니다.

숫자, 날짜, 약어, 기호를 올바르게 읽도록 하는 방법은 여러 가지가 있습니다.

단어로 모두 풀어서 쓰기

최상의 결과를 위해 숫자, 약어, 날짜, 기호를 AI가 읽기를 원하는 방식대로 단어로 모두 풀어 쓰는 것을 권장합니다. 이렇게 하면 AI가 충분한 문맥을 이해하여 올바른 결과를 제공할 수 있습니다. 예를 들어 “$100”의 경우, 원하는 결과를 얻으려면 “a hundred dollars” 또는 “one hundred dollars”라고 쓰는 것을 권장합니다.

LLM 사용하기

예를 들어 ElevenAgents를 사용할 때처럼 대규모 언어 모델을 사용해 텍스트 프롬프트를 생성하는 경우, 숫자, 날짜, 기호, 약어를 AI가 읽기를 원하는 방식에 맞춰 항상 단어로 풀어 쓰도록 모델에 프롬프트를 지정할 수 있습니다.

정규화

API를 통해 생성하는 경우 apply_text_normalization 파라미터를 사용하여 텍스트 정규화를 적용할지 지정할 수 있습니다. 텍스트 정규화는 더 나은 발음을 위해 숫자와 날짜를 단어로 풀어 씁니다. 이 옵션은 정규화 과정에 추가 처리 시간이 필요하므로 지연 시간이 늘어납니다.

apply_text_normalization 파라미터에는 세 가지 모드가 있습니다.

  • on: 항상 적용합니다.
  • off: 적용하지 않습니다.
  • auto: AI가 텍스트 정규화를 적용할 시점을 자동으로 결정합니다.

language_code 파라미터를 사용하여 프롬프트의 언어를 지정할 수도 있습니다. 이 선택적 파라미터는 ISO 639-1 언어 코드를 허용합니다.

텍스트에 숫자나 기호만 포함된 경우처럼 짧거나 모호한 프롬프트에 유용할 수 있습니다. 언어를 지정하면 정규화 도구가 해당 언어에 맞는 올바른 규칙을 적용합니다.

자세한 내용은 API 레퍼런스를 참고하세요.

웹사이트에서 텍스트 음성 변환을 사용해 생성할 때는 기본적으로 정규화가 활성화됩니다.

Studio에서는 기본적으로 정규화가 자동 적용되며, AI가 텍스트 정규화를 적용할 시점을 결정합니다. 정규화를 항상 적용하도록 설정할 수도 있습니다. 이 옵션은 프로젝트 설정의 고급 탭에 있습니다.

잘못된 발음은 여러 이유로 발생할 수 있습니다. 가장 흔한 원인은 단어의 철자가 잘못된 경우입니다. AI는 철자가 잘못된 단어를 수정하지 않으며, 작성된 그대로 읽으려고 합니다. 따라서 AI가 읽기 전에 텍스트를 다시 확인하고 교정을 마무리하는 것이 중요합니다.

특정 발음을 강제하려면 Flash v2 모델에서 SSML 음소 태그를 사용할 수 있습니다. 자세한 내용은 발음 가이드를 참고하세요.

AI가 단어를 잘못 발음하거나 예상과 다른 이상한 억양으로 말하는 경우도 있습니다. 이는 여러 이유로 발생할 수 있으며, 대부분 음성과 언어에 따라 크게 달라집니다. 올바른 억양과 발음을 보장하는 가장 좋은 방법은 올바른 억양과 발음을 가진 음성을 복제하는 것입니다. 이렇게 하면 AI가 오디오를 생성할 때 가장 많은 문맥을 확보할 수 있습니다.

언어는 텍스트로 지정되고, 억양은 음성으로 지정됩니다. 따라서 공통 단어가 많거나 다른 언어와 상당히 밀접한 언어로 작성하는 경우, AI가 특정 단어의 발음 방식이나 억양 전환을 이해하기 어려울 수 있습니다.

하지만 특정 상황에서는 영어에서도 AI가 올바르게 작성된 단어를 잘못 발음할 수 있습니다. 이는 사용한 음성과 텍스트에 크게 좌우되는 것으로 보이지만, 드물게 발생해야 합니다.

No results