Apresentando o Eleven v3 (alpha)
- Publicado
OuvirOuça este artigo
Temos o prazer de apresentar o Eleven v3 (alpha) — o modelo de Text to Speech mais expressivo.
Esta prévia de pesquisa traz um nível inédito de controle e realismo à geração de voz, com:
- Mais de 70 idiomas
- Diálogo com vários interlocutores
- Tags de áudio como [excited], [whispers] e [sighs]
Eleven v3 (alpha) exige mais prompt engineering do que os modelos anteriores — mas os resultados são impressionantes.
Se você trabalha com vídeos, audiolivros ou ferramentas de mídia, isso abre um novo nível de expressividade. Para casos de uso conversacionais e em tempo real, recomendamos continuar usando o v2.5 Turbo ou o Flash por enquanto. Uma versão do v3 em tempo real está em desenvolvimento.
O Eleven v3 já está disponível em nosso site e na API.
Por que criamos o v3
Desde o lançamento do Multilingual v2, vimos a IA de voz ser adotada em filmes profissionais, desenvolvimento de jogos, educação e acessibilidade. Mas a limitação constante não era a qualidade do som — era a expressividade. Emoções mais intensas, interrupções em conversas e diálogos naturais eram difíceis de alcançar.
O Eleven v3 resolve essa lacuna. Ele foi criado do zero para oferecer vozes que suspiram, sussurram, riem e reagem — gerando falas que parecem realmente responsivas e vivas.
Novidades do Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Como usar tags de áudio
As tags de áudio são inseridas diretamente no seu roteiro e usam colchetes em letras minúsculas. Veja mais sobre tags de áudio em nosso guia de prompting do v3 na documentação.
No momento, os Clones de Voz Profissionais (PVCs) não estão totalmente otimizados para o Eleven v3, o que pode resultar em qualidade de clonagem inferior à dos modelos anteriores. Nesta fase de prévia de pesquisa, o ideal é usar um Clone de Voz Instantâneo (IVC) ou uma voz criada para seu projeto, caso precise usar os recursos do v3. A otimização dos PVCs para o v3 chegará em breve.
Por exemplo, você pode usar o prompt: “[whispers] Algo está vindo… [sighs] Eu consigo sentir.” Ou, para ter mais controle expressivo, combinar várias tags:
Criando diálogos com vários interlocutores
O Eleven v3 é compatível com nosso endpoint atual de Text to Speech. Além disso, apresentamos um novo endpoint da API Text to Dialogue. Forneça um array estruturado de objetos JSON — cada um representando uma fala — e o modelo gera um arquivo de áudio coeso, com sobreposições:
O endpoint gerencia automaticamente as transições entre interlocutores, mudanças emocionais e interrupções.
Saiba mais aqui.
Preços e disponibilidade
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Para ativar o v3:
- Use o Seletor de modelos e selecione Eleven v3 (alpha)
O acesso pela API e a compatibilidade com o Estúdio estarão disponíveis em breve. Para ter acesso antecipado, fale com a equipe de vendas.
Quando não usar o v3
O Eleven v3 (alpha) exige mais prompt engineering do que nossos modelos anteriores. Quando funciona, o resultado é impressionante, mas sua confiabilidade e maior latência fazem com que ele não seja adequado para casos de uso conversacionais e em tempo real. Para esses casos, recomendamos o Eleven v2.5 Turbo/Flash.
Para saber mais, consulte a documentação completa do v3 e as perguntas frequentes.
- Faça login na interface da ElevenLabs
- Selecione o v3 (alpha) no menu suspenso de modelos
- Cole seu roteiro — use tags ou diálogos
- Gere o áudio
Estamos animados para ver como você dará vida ao v3 em novos casos de uso — de narrativas imersivas a fluxos de produção cinematográfica.






.jpg&w=3840&q=80)
.png&w=3840&q=80)


