Apresentamos o Eleven v4, nosso modelo mais expressivo
- Publicado
- Última atualização
OuvirOuça este artigo
Uma linha de texto pode mudar bastante dependendo de como é falada. “Preciso que você mantenha a calma" deve soar diferente conforme quem a diz: um médico falando gentilmente com um paciente assustado ou um personagem de jogo gritando para seu esquadrão antes de entrar em batalha.
Hoje, estamos lançando o Eleven v4, nosso modelo de Text to Speech mais emotivo até hoje, e sua variante de baixa latência, o Eleven v4 Turbo.

Classificado em 1º lugar pela Artificial Analysis1, e preferido por cerca de 75% dos ouvintes em testes comparativos às cegas contra modelos concorrentes2, o Eleven v4 foi desenvolvido para interpretar tom, ritmo, emoção, personagem e contexto. Ele gera vozes que podem soar dramáticas, ternas, urgentes, cômicas ou conversacionais, mantendo a identidade de quem fala. Dinâmicas mais naturais entre vários falantes tornam as conversas mais responsivas, em vez de parecerem linhas isoladas reunidas. Os falantes reagem ao contexto da conversa, criando diálogos e interações entre personagens mais naturais.

Uma nova arquitetura desenvolvida para performance
Construído com uma arquitetura totalmente nova, o Eleven v4 é nosso modelo de Text to Speech mais emotivo, classificado em 1º lugar pela Artificial Analysis1. O Eleven v4 Turbo leva essa mesma tecnologia a casos de uso de baixa latência, como agentes. Com uma latência mediana de inferência de cerca de 100 ms, ele pode responder mais rápido do que a pausa média entre duas pessoas conversando.
Os dois modelos podem gerar vozes que parecem emotivas, e não mecânicas. A fidelidade de áudio também é maior em todos os aspectos, com resultados mais limpos e naturais.
Gerações anteriores de modelos de conversão de texto em voz conseguem ler textos em voz alta, mas o Eleven v4 traz uma profundidade emocional muito mais natural à fala. O modelo consegue interpretar o tom desejado, o ritmo da fala, o estilo do texto e seu contexto para gerar uma voz emocionalmente envolvente.
Os usuários também têm controle detalhado sobre os resultados e podem descrever, em linguagem natural, como uma linha deve ser interpretada. Também podem adicionar instruções específicas sobre como dizer determinadas frases, que emoção devem transmitir e até efeitos sonoros, usando tags em linha como [laughs], [said angrily in French accent], [light rain] ou [phone buzzing]. O Eleven v4 segue essas tags de áudio e instruções de direção com mais precisão do que os modelos anteriores, então a interpretação que você descreve é a que recebe. Isso facilita dirigir narrações, desenvolver personagens ou seus diálogos e outros casos em que a interpretação faz diferença.
A documentação para desenvolvedores da ElevenLabs aborda a sintaxe completa das tags e como aplicá-las pela API. O suporte aos fonemas do Alfabeto Fonético Internacional (IPA) também melhorou significativamente, para que pronúncias personalizadas funcionem de forma mais confiável.
O Eleven v4 também traz melhorias na consistência e nas conversas dinâmicas entre vários falantes. Com um novo método para capturar a identidade dos falantes, o Eleven v4 preserva as qualidades únicas de cada voz. Ele consegue manter a fala consistente em conversas com agentes, audiolivros ou anúncios. Como o modelo entende o contexto de uma cena inteira, gera diálogos naturais nos quais os falantes respondem ao que acabou de ser dito, em vez de juntar linhas isoladas.
Um modelo Turbo para casos de uso de baixa latência
Modelos de voz de alta qualidade costumam gerar fala mais lentamente, o que obriga os usuários a escolher entre agentes de voz rápidos ou expressivos. Muitos optaram por agentes competentes, porém monótonos, que podem parecer robóticos para um cliente frustrado que só quer resolver seu problema.
O Eleven v4 Turbo combina velocidade e emoção com um tempo mediano até a primeira fala de cerca de 150 ms3, possibilitando a implementação de agentes avançados em inúmeros setores: de agentes acolhedores e tranquilizadores, capazes de pronunciar termos médicos corretamente na área da saúde, a agentes que falam rápido e usam gírias para entreter jogadores em games.

O modelo Eleven v4 Turbo foi criado para funcionar com a plataforma de agentes conversacionais da ElevenLabs, o ElevenAgents. Outros criadores de agentes combinam modelos e softwares de diferentes fornecedores, deixando os usuários sem uma forma de refinar ou melhorar os resultados dos modelos para seus casos de uso específicos. As equipes de pesquisa e engenharia da ElevenLabs otimizaram o Eleven v4 Turbo e o ElevenAgents juntos como um único sistema, oferecendo agentes mais expressivos, confiáveis e de baixa latência.
Uma voz, inúmeros idiomas
A forma como nos comunicamos varia conforme o contexto, o local e até a hora do dia. Criar vozes expressivas que reflitam isso em diferentes idiomas continua sendo um dos desafios mais difíceis da IA de áudio.
O Eleven v4 representa um avanço em todas essas áreas, e as melhorias vão além da forma como o modelo pronuncia as frases. O Eleven v4 capta melhor o ritmo, a emoção e a interpretação em diferentes idiomas, ajudando criadores a produzir vozes que soam naturais para cada idioma e contexto. Por exemplo, a forma como você falaria com um idoso desconhecido no Japão é bem diferente de como falaria com essa pessoa na Itália.
Tanto o Eleven v4 quanto o Eleven v4 Turbo oferecem suporte a mais de 90 idiomas. Agora, uma voz gravada em um idioma também fala qualquer outro com fluência, adotando o sotaque de um falante nativo e preservando a identidade da voz original. A fidelidade ao sotaque é visivelmente maior do que antes, então a voz não volta gradualmente ao sotaque de origem ao longo de uma geração.
Catalão
Espanhol
Para dublagem e localização, isso significa que a voz da marca que você escolheu — seja a de um ator famoso com quem você trabalha ou um tom que melhor combine com o estilo da sua empresa — soará excelente em qualquer idioma compatível com o Eleven v4.
Clonagem de voz mais autêntica e consistente
A clonagem de voz é mais autêntica, avançada e consistente no Eleven v4 e no Eleven v4 Turbo, com uma similaridade significativamente maior com a voz de origem. Agora, as Clonagens Instantâneas de Voz podem capturar vozes em alta fidelidade usando apenas 10 segundos de áudio.
Voz real
Eleven v4
O Eleven v4 também preserva a identidade do falante de forma mais confiável entre gerações, diálogos, narrações e linhas regeneradas. Isso significa que, em projetos de longa duração, os personagens, narradores e vozes clonadas permanecem consistentes durante toda a produção. O Eleven v4 também adiciona suporte a Clonagens Profissionais de Voz (PVC), para casos de uso que exigem a maior fidelidade possível.
O encadeamento de solicitações — que conecta gerações para criar conteúdos mais longos — também é significativamente mais confiável no Eleven v4, melhorando a experiência de trabalho no Estúdio da ElevenLabs e no App ElevenLabs Reader.
Ouça a diferença você mesmo
O Eleven v4 e o Eleven v4 Turbo são o resultado de nossas pesquisas mais recentes em geração de fala expressiva. Eles foram criados para conteúdos em que a interpretação importa tanto quanto as próprias palavras, como audiolivros, interpretações de personagens, locuções, dublagem ou localização de agentes conversacionais.
Os dois modelos já estão disponíveis no ElevenAgents, no ElevenCreative e pela ElevenAPI. Crie uma conta gratuita para começar a gerar conteúdo com o Eleven v4 ou o Eleven v4 Turbo hoje.
- Artificial Analysis, Provider Voice Arena Leaderboard, set. de 2026
- Com base em testes cegos de preferência dos usuários, comparando diretamente o Cartesia Sonic 3.6, o Inworld TTS-2, o Google Gemini 3.8 Flash-Lite TTS e o Google Gemini 3.8 Flash TTS, realizados em setembro de 2026. Em cada comparação, os avaliadores ouviram a mesma frase gerada pelo Eleven v4 e por um concorrente, sem saber qual era qual, e julgaram qual era mais expressiva e qual soava mais natural; os empates contaram como meio ponto.
- Tempo mediano entre a solicitação e a fala audível. Medido em setembro de 2026 com roteiros idênticos e configurações padrão, em comparação com Cartesia Sonic 3.6, xAI TTS, Google Gemini 3.8 Flash-Lite TTS e OpenAI GPT-4o mini TTS; a latência de rede foi medida e removida para todos os sistemas. Eleven v4 Turbo por streaming via WebSocket.




