Eleven v4
최신이자 가장 진보된 텍스트 음성 변환 모델입니다.
Eleven v4는 최신이자 가장 진보된 텍스트 음성 변환 모델이며, 새로운 세대의 첫 번째 모델입니다. Eleven v3와 비교해 출력 품질, 음성 정확도, 일관성, 감정, 전달 방식, 오디오 태그 및 언어 지원 범위가 향상되었습니다.
전반적으로 Eleven v4는 Eleven v3보다 거의 모든 경우에서 더 나은 결과를 제공하는 업그레이드입니다. 직접 차이를 확인할 수 있도록 v4로 전환한 뒤 자체 음성과 콘텐츠로 테스트해 보실 것을 강력히 권장합니다. 일부 특수한 경우에는 다른 모델이 더 적합할 수 있지만, 대부분의 사용자에게는 v4가 더 나은 선택일 것입니다.
태그, 문장 부호 및 대화 프롬프팅은 Eleven v4 프롬프팅을 참조하세요.
음성 복제
Eleven v4로 음성 복제 정확도가 크게 향상되었습니다. 복제된 음성은 어떤 이전 모델보다도 원본 음성의 특성, 즉 음색, 리듬, 전달 방식을 더욱 충실히 담아냅니다.
인스턴트 음성 복제(IVC)는 Eleven v4에서 그 어느 때보다 정확합니다. 원본 음성의 핵심 특성을 더욱 충실히 담아내므로, 짧은 오디오 샘플만으로도 설득력 있는 복제 음성을 빠르게 만들기 쉬워집니다.
인스턴트 음성 복제는 Eleven v4에서 대폭 업그레이드되어 전반적으로 눈에 띄게 향상된 정확도를 제공합니다. 아직 사용해 보지 않으셨다면 지금이 자체 오디오로 테스트해 보기 좋은 때입니다.
프로페셔널 음성 복제(PVC)는 Eleven v4에서 완전히 지원됩니다. 음성 정확도 개선을 동일하게 적용하여, 최고 수준의 일관성과 제어가 필요한 워크플로에 원본 음성을 더욱 충실하게 재현합니다.
Eleven v4의 프로페셔널 음성 복제 지원은 현재 모든 사용자에게 순차적으로 제공 중이며, 며칠 내에 이용할 수 있을 예정입니다.
이처럼 정확도가 크게 향상되었기 때문에 Eleven v4는 Eleven v3와 상당히 다르게 들릴 수 있습니다. Eleven v3는 전달 방식과 정확성에 중점을 두며 Eleven v4의 토대를 마련했고, Eleven v4는 이 기반 위에서 음성 정확도를 크게 개선했습니다. 따라서 Eleven v4는 원본 음성을 더욱 충실하게 포착하도록 설계되었지만, Eleven v3에서 들리던 음성을 더 선호할 수도 있습니다. 정확성과 개인적 선호는 항상 같지 않으므로, 사용 사례에 가장 적합한 모델을 선택하려면 자체 콘텐츠로 두 버전을 비교해 보시길 권장합니다.
Eleven v4는 액센트, 전달 방식, 음량 및 기타 고유한 특성을 포함해 원본 음성의 특성을 더 충실히 재현하므로, 원본 녹음의 품질이 그 어느 때보다 중요합니다. 선명하고 깨끗한 학습 오디오는 원치 않는 소리나 특성을 추가하지 않고 Eleven v4가 음성을 정확하게 포착하도록 돕습니다. 배경 소음, 왜곡 또는 기타 녹음 문제는 결과에 영향을 줄 수 있습니다.
Eleven v4를 가장 잘 사용하는 방법을 파악하기 위해 계속 실험하고 있습니다. 지금까지는 특히 프로페셔널 음성 복제처럼 학습 오디오가 많은 경우에 미묘한 오디오 특성을 포착하는 능력이 훨씬 뛰어난 것으로 보입니다. 더 다양한 데이터 세트로 모델을 제어하는 방법을 계속 테스트함에 따라 다양한 학습 데이터 사용에 관한 지침도 바뀔 수 있습니다. 현재로서는 학습 오디오에서 하나의 말하기 스타일을 유지하는 것이 좋으며, Eleven v4는 이전 모델보다 이를 더 잘 포착할 것입니다.
네이티브 액센트 처리
이는 Eleven v4가 이전 모델들과 비교해 가장 크게 바뀐 부분 중 하나이므로, 명확히 이해할 필요가 있습니다.
생성하려는 언어가 참조 음성의 언어와 같으면 기존과 마찬가지로 원래 액센트가 그대로 유지됩니다.
생성하려는 언어가 참조 음성의 언어와 다르면, Eleven v4는 참조 음성의 원래 언어 액센트를 유지하는 대신 대상 언어로 유창하고 자연스럽게 들리는 음성을 생성합니다.
예를 들어 한국어 화자의 음성을 복제한 후 영어를 생성하면, Eleven v4는 한국어 액센트가 섞인 영어가 아니라 자연스럽고 유창한 영어를 생성합니다. 따라서 지원되는 모든 언어에서 모든 음성을 사용할 수 있으며, 특히 더빙, 다국어 콘텐츠, 단일 음성으로 여러 언어의 사용자에게 서비스를 제공해야 하는 음성 에이전트에 유용합니다.
워크플로에서 음성이 다른 언어에서도 원래 액센트를 유지해야 한다면, 마이그레이션하기 전에 Eleven v4에서 이 동작을 직접 테스트하세요. 이는 언어 간 생성 방식의 의도적인 변경이며 버그가 아닙니다.
다만 이 새로운 기능은 아직 미세 조정 중이며, 항상 켜져 있는 대신 토글로 설정할 수 있는 방법을 모색하고 있습니다. 이는 아직 연구 프로젝트 단계이므로, 현재로서는 일정이나 추가 정보가 없습니다.
모델 변형
Eleven v4는 두 가지 변형 모델로 제공되므로, 사용 사례에 맞춰 품질과 속도의 적절한 균형을 선택할 수 있습니다.
- Eleven v4 (
eleven_v4) — 최고 품질의 모델로, 콘텐츠 제작, 오디오북, 캐릭터 보이스오버 및 품질이 최우선인 모든 사용 사례에 이상적입니다. - Eleven v4 Turbo (
eleven_v4_turbo) — 매우 낮은 지연 시간을 유지하면서도 탁월한 고품질을 제공하며, 대화형 에이전트와 인터랙티브 음성 경험 같은 실시간 사용 사례를 위해 설계되었습니다.
두 변형 모델 모두 안정성 및 유사성이라는 두 가지 음성 설정을 사용합니다.
안정성은 생성 결과 전반에 걸쳐 전달 방식이 얼마나 일관되게 유지되는지 제어합니다. 값이 낮을수록 더욱 표현력 있고 다양한 전달이 가능하며, 값이 높을수록 고정된 기준선에 가까운 표현을 유지합니다.
유사성은 출력이 참조 음성을 얼마나 가깝게 따르는지 제어합니다. 값이 높을수록 참조 음성을 더 엄격하게 따르지만, 자연스러움이 일부 떨어질 수 있습니다.
Eleven v4에서는 스타일 및 속도 슬라이더를 사용할 수 없으며, SSML도 지원되지 않습니다.
오디오 태그(예: [whispering], [shouting], [laughing])를 사용하면 전달 방식을 세밀하게 제어할 수 있으며, Eleven v4는 이전 모델보다 한층 더 섬세하게 처리합니다. 아직 완벽하지는 않으며, 모델이 태그 지시를 얼마나 안정적으로 따르는지 계속 개선하고 있습니다. 이는 지속적으로 투자 중인 분야이며 계속 발전할 것입니다.
쇼케이스
이 예시는 원본 그대로입니다. EQ, 압축, 정규화, 치찰음 제거, 파열음 제거 등 어떤 처리도 크게 적용하지 않았습니다. 클리핑, 파열음, 고르지 않은 EQ, 음량 변화처럼 반복되는 문제가 들린다면 해당 음성의 학습 데이터에 포함되어 있을 가능성이 매우 높습니다. Eleven v4 모델은 결함까지도 정확하게 포착할 만큼 정확하기 때문에 이를 그대로 포착했을 뿐입니다. 모델이 생성한 결과를 들을 수 있도록 오디오는 손대지 않았습니다.
음성 복제 정확도
각 예시는 보이스 라이브러리 미리보기로 시작합니다. 그런 다음 일부 텍스트를 가져와 Eleven v3와 Eleven v4에서 해당 음성의 인스턴트 음성 복제를 사용해 생성했습니다.
완벽한 비교는 아닙니다. Eleven v4는 매칭을 더욱 향상할 수 있는 프로페셔널 음성 복제도 지원합니다. 그러나 더 공정한 비교를 위해 Eleven v3와 Eleven v4 모두 인스턴트 음성 복제를 사용했습니다.
이 예시는 모델이 원본 음성을 얼마나 포착하는지 보여줍니다. 여기에는 EQ, 품질, 음량뿐 아니라 파열음, 거친 치찰음, 음량 변동 등 오디오의 기타 사소한 세부 사항과 불완전성도 포함된다는 점에 유의하세요.
미리보기, Eleven v3, Eleven v4 순서로 들어보세요.
음성 NfUrCNRReUL9RXS9upG1.
음성 HBDoL4wkcalemIO0nUAu.
성우 연기
이는 Eleven v4로 생성한 결과입니다. 텍스트의 오디오 태그가 전달 방식을 지정합니다.
음성 EkK5I93UQWFDigLMpZcX.
음성 t7VaN65ClS2VrEUwk1nR.
오디오북
이는 Eleven v4 내레이션입니다. 태그가 장면의 속도와 분위기를 설정합니다.
음성 KHRvDizAHFVPzoSehNY6.
모델은 계속 발전합니다
Eleven v4는 지속적으로 활발히 개발되고 있습니다. 출시 후에도 모델을 계속 학습하고 개선함에 따라 품질이 향상되면서 시간이 지나 행동 방식이 달라질 수 있습니다. 모델이 발전함에 따라 사용 사례를 정기적으로 다시 테스트해 보시길 권장하며, 의미 있는 업데이트가 제공되면 공유하겠습니다.
FAQ
Eleven v4는 어떤 언어를 지원하나요?
Eleven v4는 아프리칸스어, 암하라어, 아랍어, 아르메니아어, 아삼어, 아스투리아스어, 아제르바이잔어, 벨라루스어, 벵골어, 보스니아어, 불가리아어, 버마어, 광둥어, 카탈루냐어, 세부아노어, 크로아티아어, 체코어, 덴마크어, 네덜란드어, 영어, 에스토니아어, 필리핀어, 핀란드어, 프랑스어, 풀라어(풀라르어), 갈리시아어, 조지아어, 독일어, 그리스어, 구자라트어, 하우사어, 히브리어, 힌디어, 헝가리어, 아이슬란드어, 인도네시아어, 이탈리아어, 일본어, 칸나다어, 카자흐어, 한국어, 키르기스어, 라오어, 링갈라어, 리투아니아어, 루간다어, 룩셈부르크어, 마케도니아어, 말레이어, 말라얄람어, 몰타어, 표준 중국어, 마오리어, 마라티어, 몽골어, 네팔어, 노르웨이어 보크몰, 오크어, 오디아어, 파슈토어, 페르시아어, 폴란드어, 포르투갈어(브라질), 펀자브어, 루마니아어, 러시아어, 세르비아어, 쇼나어, 신디어, 슬로바키아어, 슬로베니아어, 소말리어, 소라니 쿠르드어, 스페인어(라틴 아메리카), 스와힐리어, 스웨덴어, 타지크어, 타밀어, 텔루구어, 태국어, 튀르키예어, 우크라이나어, 우르두어, 우즈베크어, 베트남어, 웨일스어, 월로프어를 지원합니다.
일부 언어는 다른 언어보다 더 유창하게 처리되지만, 전반적으로 Eleven v4는 이들 언어 대부분을 매우 잘 처리합니다.
복제된 음성은 액센트를 유지하나요?
참조 음성과 생성된 음성이 같은 언어일 때는 음성의 액센트가 유지됩니다. 예를 들어 특정 영어 액센트로 영어를 말하는 사람의 음성을 복제하고 영어 음성을 생성하면 해당 액센트가 유지됩니다.
음성이 원래 액센트로 다른 언어를 말하게 할 수 있나요?
기본적으로 생성 언어가 참조 음성의 언어와 다르면 Eleven v4는 참조 액센트를 유지하는 대신 대상 언어로 유창하고 자연스럽게 들리는 음성을 생성합니다. 오디오 태그를 사용해 액센트나 전달 스타일을 유도해 볼 수 있지만, 결과는 달라질 수 있으므로 구체적인 음성과 사용 사례로 테스트하세요.
Eleven v4 복제 음성은 Eleven v3 버전과 비슷하게 들리나요?
일반적으로 Eleven v4는 음색, 리듬, 전달 방식 및 기타 말투를 포함해 원본 음성의 특성을 Eleven v3보다 훨씬 정확하게 재현합니다. 따라서 Eleven v4 복제 음성은 일반적으로 원본 음성과 더 비슷하게 들리며, Eleven v3 버전과 상당히 다르게 들릴 수 있습니다.
Eleven v4를 학습시켜야 하나요?
Eleven v4는 인스턴트 음성 복제와 프로페셔널 음성 복제를 모두 지원합니다.
인스턴트 음성 복제에서는 별도의 학습 단계 없이 음성을 만들 수 있습니다. 일반적으로 1~2분 길이의 짧은 샘플을 업로드하면 몇 초 안에 사용할 수 있는 음성을 얻을 수 있습니다.
프로페셔널 음성 복제는 이전 모델에서와 동일한 방식으로 작동합니다. 더 긴 녹음 세트로 전용 모델을 학습시킵니다.
이미 프로페셔널 음성 복제가 있고 Eleven v4에서 학습하려면 내 음성을 열고 목록에서 해당 음성을 찾은 다음 마우스를 올리세요. 해당 음성에 사용할 수 있는 모델이 표시됩니다. Eleven v4 옆의 더하기 버튼을 클릭해 미세 조정을 시작하세요.
Eleven v4에서 보이스 디자인을 사용해야 하나요?
보이스 디자인 음성은 Eleven v4에서 작동하지만, 이전 모델만큼 표현력이 좋거나 좋은 음질을 내지 못할 수 있습니다.