Pular para o conteúdo

Apresentando o Eleven v3 (alpha)

Publicado

OuvirOuça este artigo

Eleven v3 is no longer in alpha, and is now generally available.


Temos o prazer de apresentar o Eleven v3 (alpha) — o modelo de Text to Speech mais expressivo.

Esta prévia de pesquisa traz um nível inédito de controle e realismo à geração de voz, com:

  • Mais de 70 idiomas
  • Diálogo com vários interlocutores
  • Tags de áudio como [excited], [whispers] e [sighs]

Eleven v3 (alpha) exige mais prompt engineering do que os modelos anteriores — mas os resultados são impressionantes.

Se você trabalha com vídeos, audiolivros ou ferramentas de mídia, isso abre um novo nível de expressividade. Para casos de uso conversacionais e em tempo real, recomendamos continuar usando o v2.5 Turbo ou o Flash por enquanto. Uma versão do v3 em tempo real está em desenvolvimento.

O Eleven v3 já está disponível em nosso site e na API.

Por que criamos o v3

Desde o lançamento do Multilingual v2, vimos a IA de voz ser adotada em filmes profissionais, desenvolvimento de jogos, educação e acessibilidade. Mas a limitação constante não era a qualidade do som — era a expressividade. Emoções mais intensas, interrupções em conversas e diálogos naturais eram difíceis de alcançar.

O Eleven v3 resolve essa lacuna. Ele foi criado do zero para oferecer vozes que suspiram, sussurram, riem e reagem — gerando falas que parecem realmente responsivas e vivas.

Novidades do Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Ouça o v3 por conta própria

Background
Background

Como usar tags de áudio

As tags de áudio são inseridas diretamente no seu roteiro e usam colchetes em letras minúsculas. Veja mais sobre tags de áudio em nosso guia de prompting do v3 na documentação.

No momento, os Clones de Voz Profissionais (PVCs) não estão totalmente otimizados para o Eleven v3, o que pode resultar em qualidade de clonagem inferior à dos modelos anteriores. Nesta fase de prévia de pesquisa, o ideal é usar um Clone de Voz Instantâneo (IVC) ou uma voz criada para seu projeto, caso precise usar os recursos do v3. A otimização dos PVCs para o v3 chegará em breve.

Por exemplo, você pode usar o prompt: “[whispers] Algo está vindo… [sighs] Eu consigo sentir.” Ou, para ter mais controle expressivo, combinar várias tags:

“[happily][shouts] We did it! [laughs].”

Criando diálogos com vários interlocutores

O Eleven v3 é compatível com nosso endpoint atual de Text to Speech. Além disso, apresentamos um novo endpoint da API Text to Dialogue. Forneça um array estruturado de objetos JSON — cada um representando uma fala — e o modelo gera um arquivo de áudio coeso, com sobreposições:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

O endpoint gerencia automaticamente as transições entre interlocutores, mudanças emocionais e interrupções.

Saiba mais aqui.

O v3 é nosso modelo mais expressivo

Background
Background

Preços e disponibilidade

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Para ativar o v3:

  • Use o Seletor de modelos e selecione Eleven v3 (alpha)

O acesso pela API e a compatibilidade com o Estúdio estarão disponíveis em breve. Para ter acesso antecipado, fale com a equipe de vendas.

Quando não usar o v3

O Eleven v3 (alpha) exige mais prompt engineering do que nossos modelos anteriores. Quando funciona, o resultado é impressionante, mas sua confiabilidade e maior latência fazem com que ele não seja adequado para casos de uso conversacionais e em tempo real. Para esses casos, recomendamos o Eleven v2.5 Turbo/Flash.

Para saber mais, consulte a documentação completa do v3 e as perguntas frequentes.

Experimente hoje

Background
Background
  1. Faça login na interface da ElevenLabs
  2. Selecione o v3 (alpha) no menu suspenso de modelos
  3. Cole seu roteiro — use tags ou diálogos 
  4. Gere o áudio

Estamos animados para ver como você dará vida ao v3 em novos casos de uso — de narrativas imersivas a fluxos de produção cinematográfica.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade