Apresentando o Eleven v3 (alpha)
- Publicado
OuvirOuça este artigo
Temos o prazer de apresentar o Eleven v3 (alpha) — o modelo de Text to Speech mais expressivo.
Esta prévia de pesquisa traz um nível inédito de controle e realismo para a geração de voz com:
- Mais de 70 idiomas
- Diálogo com vários falantes
- Tags de áudio como [excited], [whispers] e [sighs]
Eleven v3 (alpha) exige mais engenharia de prompt do que os modelos anteriores — mas as gerações são impressionantes.
Se você trabalha com vídeos, audiolivros ou ferramentas de mídia, isso abre um novo nível de expressividade. Para casos de uso em tempo real e conversacionais, recomendamos continuar usando o v2.5 Turbo ou Flash por enquanto. Uma versão em tempo real do v3 está em desenvolvimento.
O Eleven v3 está disponível hoje em nosso site e na API.
Por que criamos o v3
Desde o lançamento do Multilingual v2, vimos a IA de voz ser adotada no cinema profissional, no desenvolvimento de jogos, na educação e na acessibilidade. Mas a limitação constante não era a qualidade do som — era a expressividade. Emoções mais intensas, interrupções em conversas e trocas convincentes entre falantes eram difíceis de alcançar.
O Eleven v3 resolve essa lacuna. Ele foi criado do zero para oferecer vozes que suspiram, sussurram, riem e reagem — gerando uma fala que parece realmente responsiva e viva.
O que há de novo no Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Como usar tags de áudio
As tags de áudio ficam no próprio texto do seu roteiro e são formatadas entre colchetes em letras minúsculas. Saiba mais sobre tags de áudio em nosso guia de prompting para o v3 na documentação.
No momento, os Clones de Voz Profissionais (PVCs) não estão totalmente otimizados para o Eleven v3, o que pode resultar em uma qualidade de clone inferior à dos modelos anteriores. Durante esta fase de prévia de pesquisa, o ideal é encontrar um Clone de Voz Instantâneo (IVC) ou uma voz criada para o seu projeto caso você precise usar os recursos do v3. A otimização de PVCs para o v3 chegará em breve.
Por exemplo, você pode usar o prompt: “[whispers] Algo está vindo… [sighs] Eu consigo sentir.” Ou, para ter um controle mais expressivo, você pode combinar várias tags:
Como criar diálogos com vários falantes
O Eleven v3 é compatível com nosso endpoint atual de Text to Speech. Além disso, apresentamos um novo endpoint da API Text to Dialogue. Forneça uma matriz estruturada de objetos JSON — cada um representando a fala de um participante — e o modelo gera um arquivo de áudio coeso, com sobreposições:
O endpoint gerencia automaticamente as transições entre falantes, mudanças emocionais e interrupções.
Saiba mais aqui.
Preços e disponibilidade
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Para ativar o v3:
- Use o seletor de modelo e selecione Eleven v3 (alpha)
O acesso à API e o suporte no Estúdio chegarão em breve. Para obter acesso antecipado, fale com vendas.
Quando não usar o v3
O Eleven v3 (alpha) exige mais engenharia de prompt do que nossos modelos anteriores. Quando funciona, o resultado é impressionante, mas a confiabilidade e a maior latência fazem com que ele não seja adequado para casos de uso em tempo real e conversacionais. Para esses casos, recomendamos o Eleven v2.5 Turbo/Flash.
Para saber mais, consulte a documentação do v3 e as perguntas frequentes.
- Entre na interface do ElevenLabs
- Selecione o v3 (alpha) no menu suspenso de modelos
- Cole seu roteiro — use tags ou diálogos
- Gere o áudio
Estamos animados para ver como você dará vida ao v3 em novos casos de uso — de narrativas imersivas a fluxos de produção cinematográfica.




