가장 감정 표현력이 뛰어난 모델, Eleven v4 소개
- 게시일
- 최종 업데이트
듣기이 글 오디오로 듣기
텍스트 한 줄도 어떻게 말하느냐에 따라 크게 달라질 수 있습니다. “진정하셔야 합니다”라는 말은 겁에 질린 환자에게 부드럽게 말하는 의사와, 전투에 투입되기 전 분대원들에게 외치는 게임 속 캐릭터가 말할 때 서로 다르게 들려야 합니다.
오늘 ElevenLabs는 Eleven v4, 역대 가장 감정 표현력이 뛰어난 텍스트 음성 변환 모델과 저지연 버전인 Eleven v4 Turbo를 출시합니다.

Artificial Analysis 선정 1위1를 차지하고, 경쟁 모델과의 블라인드 일대일 테스트에서 약 75%의 청취자가 선호한2 Eleven v4는 톤, 속도, 감정, 캐릭터, 맥락을 해석하도록 설계되었습니다. 화자의 정체성을 유지하면서도 드라마틱하고, 다정하며, 긴박하고, 코믹하거나, 대화체로 들리는 음성을 생성합니다. 더욱 자연스러운 다화자 역학으로 대화가 개별 문장을 이어 붙인 듯한 느낌이 아니라 즉각 반응하는 것처럼 느껴집니다. 화자들은 대화의 맥락에 반응하여 더 자연스러운 대화와 캐릭터 간 상호작용을 만들어 냅니다.

성능을 위해 설계된 새로운 아키텍처
완전히 새로운 아키텍처를 기반으로 한 Eleven v4는 Artificial Analysis에서 1위로 평가받은 가장 감정 표현력이 뛰어난 텍스트 음성 변환 모델입니다1. Eleven v4 Turbo는 이와 동일한 기술을 에이전트 같은 저지연 활용 사례에 제공합니다. 약 100ms의 중앙값 추론 지연 시간으로, 두 사람이 대화할 때의 평균적인 침묵보다 더 빠르게 응답할 수 있습니다.
두 모델 모두 기계적이기보다 감정이 느껴지는 음성을 생성할 수 있습니다. 전반적인 오디오 충실도도 높아져, 더욱 깨끗하고 자연스러운 결과물을 제공합니다.
이전 세대의 텍스트 음성 변환 모델도 텍스트를 소리 내어 읽을 수는 있지만, Eleven v4는 훨씬 더 자연스럽게 느껴지는 감정적 깊이를 음성에 더합니다. 이 모델은 의도된 톤, 음성의 속도, 글의 특성, 텍스트의 맥락을 해석해 감정적으로 공감되는 음성을 제공합니다.
사용자는 결과물을 세밀하게 제어하고, 문장을 어떻게 전달할지 자연어로 설명할 수도 있습니다. 특정 구절의 발음 방식이나 전달해야 할 감정, 심지어 음향 효과까지 구체적으로 지시할 수 있습니다. [laughs], [said angrily in French accent], [light rain], [phone buzzing] 같은 인라인 태그를 사용하면 됩니다. Eleven v4는 이전 모델보다 이러한 오디오 태그와 지시 프롬프트를 더 정확하게 따르므로, 설명한 대로 전달됩니다. 따라서 내레이션을 연출하고, 캐릭터나 대사를 구체화하는 등 전달 방식이 중요한 작업이 더 쉬워집니다.
ElevenLabs 개발자 문서에서 전체 태그 구문과 API를 통해 태그를 적용하는 방법을 확인할 수 있습니다. 국제 음성 기호(IPA) 음소 지원도 크게 개선되어 맞춤 발음이 더욱 안정적으로 작동합니다.
Eleven v4는 일관성과 여러 화자 간의 역동적인 대화도 개선했습니다. 화자의 정체성을 포착하는 새로운 방식을 사용해 각 음성의 고유한 특성을 보존합니다. 에이전트 대화, 오디오북, 광고 전반에서 일관된 음성을 유지할 수 있습니다. 모델이 장면 전체의 맥락을 이해하기 때문에, 고립된 문장을 이어 붙이는 대신 화자들이 방금 말한 내용에 반응하는 자연스러운 대화를 생성합니다.
저지연 활용 사례를 위한 Turbo 모델
고품질 음성 모델은 음성 생성 속도가 느린 경향이 있어, 사용자는 빠른 음성 에이전트와 표현력 있는 음성 에이전트 중 하나를 선택해야 했습니다. 많은 이들이 능숙하지만 단조로운 에이전트를 선택했고, 이는 문제를 해결하려는 당황한 고객에게 로봇처럼 느껴질 수 있습니다.
Eleven v4 Turbo는 약 150ms의 첫 음성 출력 중앙값 시간으로 속도와 감정을 결합합니다3. 이를 통해 의료 분야에서 의학 용어를 정확하게 발음하는 따뜻하고 안심을 주는 에이전트부터, 게임에서 플레이어를 즐겁게 하는 빠른 말투와 슬랭을 구사하는 에이전트까지, 수많은 산업에 강력한 에이전트를 배포할 수 있습니다.

Eleven v4 Turbo 모델은 ElevenLabs의 대화형 에이전트 플랫폼인 ElevenAgents와 함께 작동하도록 설계되었습니다. 다른 에이전트 빌더는 여러 공급업체의 모델과 소프트웨어를 조합하기 때문에, 사용자는 개별 활용 사례에 맞게 모델 출력을 세밀하게 조정하거나 개선할 방법이 없습니다. ElevenLabs의 연구 및 엔지니어링 팀은 Eleven v4 Turbo와 ElevenAgents를 하나의 시스템으로 함께 최적화하여, 더 표현력이 뛰어나고 신뢰할 수 있으며 지연 시간이 낮은 에이전트를 제공합니다.
하나의 음성, 수많은 언어
소통 방식은 맥락과 장소, 심지어 시간대에 따라 달라집니다. 이를 반영하는 표현력 있는 음성을 여러 언어로 구현하는 일은 여전히 AI 오디오 분야에서 가장 어려운 과제 중 하나입니다.
Eleven v4는 이 모든 영역에서 한 단계 발전했으며, 개선 사항은 단순히 모델의 구절 발음 방식을 넘어섭니다. Eleven v4는 언어 전반의 리듬, 감정, 전달 방식을 더 잘 포착하여, 크리에이터가 언어와 맥락에 자연스럽게 어울리는 음성을 만들도록 돕습니다. 예를 들어 일본에서 처음 만난 고령자에게 말하는 방식은 이탈리아에서 그들에게 말하는 방식과 상당히 다릅니다.
Eleven v4와 Eleven v4 Turbo는 모두 90개 이상의 언어를 지원합니다. 이제 한 언어로 녹음한 음성도 원래 화자의 정체성을 유지하면서 원어민 억양을 구사해 다른 모든 언어를 유창하게 말합니다. 억양 유지 성능이 이전보다 눈에 띄게 강화되어, 생성이 진행되는 동안 음성이 원래 언어의 억양으로 되돌아가지 않습니다.
카탈루냐어
스페인어
더빙과 현지화에서는, 함께 작업하는 유명 배우의 음성이든 회사 스타일에 가장 잘 맞는 톤이든 선택한 브랜드의 음성이 Eleven v4가 지원하는 모든 언어에서 훌륭하게 들린다는 의미입니다.
더욱 진정성 있고 일관된 음성 복제
Eleven v4와 Eleven v4 Turbo 전반에서 음성 복제는 더욱 진정성 있고 강력하며 일관되게 작동하고, 원본 소스 음성과의 화자 유사성도 크게 향상되었습니다. 이제 즉석 음성 복제는 단 10초의 오디오만으로도 높은 충실도로 음성을 포착할 수 있습니다.
실제 음성
Eleven v4
Eleven v4는 생성, 대화, 내레이션, 재생성된 문장 전반에서 화자 정체성도 더욱 안정적으로 보존합니다. 따라서 장편 프로젝트에서도 캐릭터, 내레이터, 복제 음성이 제작 전 과정에서 일관성을 유지합니다. Eleven v4는 최고 충실도의 복제가 필요한 활용 사례를 위해 프로페셔널 음성 복제(PVC)도 지원합니다.
장편 콘텐츠를 위해 여러 생성을 연결하는 요청 스티칭도 Eleven v4에서 훨씬 더 안정적으로 작동하여 ElevenLabs Studio와 ElevenLabs Reader App에서의 작업 경험을 개선합니다.
직접 차이를 들어보세요
Eleven v4와 Eleven v4 Turbo는 표현력 있는 음성 생성에 관한 최신 연구의 집약체입니다. 오디오북, 캐릭터 연기, 보이스오버, 더빙, 대화형 에이전트 현지화처럼 단어 자체만큼 전달 방식이 중요한 콘텐츠를 위해 설계되었습니다.
두 모델은 이제 ElevenAgents, ElevenCreative 및 ElevenAPI를 통해 이용할 수 있습니다. 무료 계정 만들기를 통해 지금 Eleven v4 또는 Eleven v4 Turbo로 생성을 시작하세요.
- Artificial Analysis, Provider Voice Arena 리더보드, 2026년 9월
- 2026년 9월 Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS, Google Gemini 3.8 Flash TTS를 대상으로 실시한 블라인드 일대일 사용자 선호도 테스트를 기반으로 합니다. 각 쌍에서 평가자는 Eleven v4와 경쟁사 모델 하나가 동일한 문장을 말하는 것을 블라인드로 듣고, 어느 쪽이 더 표현력이 뛰어나고 더 자연스럽게 들리는지 판단했습니다. 동점은 0.5점으로 계산했습니다.
- 요청부터 음성이 들리기까지의 중앙값 시간입니다. 2026년 9월 Cartesia Sonic 3.6, xAI TTS, Google Gemini 3.8 Flash-Lite TTS, OpenAI GPT-4o mini TTS를 대상으로 동일한 스크립트와 기본 설정으로 측정했으며, 모든 시스템에서 네트워크 지연 시간은 측정 후 제외했습니다. Eleven v4 Turbo는 WebSocket 스트리밍으로 측정했습니다.
Mati is the cofounder of ElevenLabs, where he leads teams building AI that can communicate at human level. Before ElevenLabs, Mati worked at Palantir where he embedded with enterprises and governments to help them deploy new technology. He grew up in Poland, before moving to the UK to study Mathematics at Imperial College London.




