Eleven v4란 무엇인가요?

Eleven v4로 전환하고 자체 콘텐츠로 테스트해 보시기를 권장합니다.

Eleven v4로 전환하고 자체 콘텐츠로 테스트해 보시기를 권장합니다.

Eleven v4는 최신이자 가장 발전된 텍스트 음성 변환 모델이며, 새로운 세대 모델의 첫 번째 모델입니다. Eleven v3와 비교해 출력 품질, 음성 정확도, 감정, 오디오 태그 및 언어 지원 범위가 개선되었습니다.

Eleven v4에서는 음성 복제 정확도가 크게 향상되었습니다. 복제 음성은 이전 어떤 모델보다 원본 음성의 특성인 음색, 말의 리듬 및 전달 방식을 더 충실하게 담아냅니다.

즉시 음성 복제(IVC)는 Eleven v4에서 그 어느 때보다 정확합니다. 원본 음성의 핵심 특성을 더 충실하게 포착하므로, 짧은 오디오 샘플만으로도 설득력 있는 복제 음성을 빠르게 만들 수 있습니다.

프로페셔널 음성 복제(PVC)는 Eleven v4에서 완전히 지원됩니다. 동일한 음성 정확도 향상을 바탕으로, 최고 수준의 일관성과 제어가 필요한 워크플로에 원본 음성을 더 충실하게 재현합니다.

Eleven v4는 두 가지 버전으로 제공되므로, 사용 사례에 맞는 품질과 속도의 균형을 선택할 수 있습니다.

  • Eleven v4 (eleven_v4) — 최고 품질의 모델로, 콘텐츠 제작, 오디오북, 캐릭터 보이스오버 및 품질이 최우선인 모든 사용 사례에 적합합니다.
  • Eleven v4 Turbo (eleven_v4_turbo) — 인상적으로 낮은 지연 시간을 유지하면서도 매우 높은 품질을 제공하며, 대화형 에이전트 및 인터랙티브 음성 경험과 같은 실시간 사용 사례를 위해 설계되었습니다.

두 버전 모두 안정성 및 유사성의 두 가지 음성 설정을 사용합니다. Eleven v4에서는 스타일 및 속도 슬라이더를 사용할 수 없으며, SSML도 지원되지 않습니다.

생성하려는 언어가 참조 음성의 언어와 같으면 기존과 마찬가지로 원래 억양이 그대로 유지됩니다. 생성하려는 언어가 참조 음성의 언어와 다르면, Eleven v4는 참조 음성의 원래 언어 억양을 가져오는 대신 대상 언어로 유창하고 자연스러운 음성을 생성합니다.

모델 ID eleven_v4를 사용하여 음성 생성 및 음성 스트리밍으로 생성할 수 있습니다. 여러 화자의 경우 대화 생성 및 대화 스트리밍을 사용하세요.

복제, 억양, 비교 및 전체 설명은 Eleven v4를 참조하세요. 태그 및 프롬프팅은 Eleven v4 프롬프팅을 참조하세요.