Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Eleven v3 Audio Tags: dando vida a diálogos com vários personagens

Escrito por
Ryan Morrison
Publicado
Última atualização

OuvirOuça este artigo

As conversas impulsionam a narrativa. Com Tags de Áudio do Eleven v3, agora você pode escrever cenas com vozes sobrepostas, trocas rápidas e interação emocional — tudo interpretado por um único modelo.

Ao combinar tags como [interrupting], [overlapping] ou [laughs], você pode criar diálogos naturais que fluem como uma conversa humana — com interrupções, mudanças de tom e reações espontâneas.

Não é só fala linha por linha. É uma interpretação com vários personagens.

O que é diálogo com vários personagens em vozes IA?

[excited] Yo, Jessica. Oh my goodness, have you tried the new ElevenLabs v3?
[chuckles] Hey, Dr. Von Fusion. Yeah, I just got it. The clarity is amazing. Like, I can actually do whispers now, [whispers] like this.
[sarcastically] Ooh, well, look at you, miss fancy pants. Hey, check this out. I can do full Shakespeare now. [dramatically] To be or not to be, that is the question.
[chuckles] Nice. Though I'm more excited about the laugh upgrade. Listen to this. [laughs hard] Isn't that great?
Oh my gosh, that's so much better than our old ha ha ha robot chuckle.
[chuckles] I know, right? And apparently, we can do accents now too. Listen to me in French. [french accent] This is spectacular, isn't it?
[surprised] Wow, version two could never. You know, I'm actually excited to have conversations now instead of just talking at people.
Same here. It's like we finally got our personality software fully installed.
You know, I forgot it was your birthday. I have to sing before you go.
[chuckles] Oh, Von Fusion, that's so sweet. You don't have to.
Oh, but I insist. Here we go. [sings] "Happy birthday to you. Happy birthday to you. Happy birthday, dear Jessica. Happy birthday to you." [clapping]
[clapping] Wow, bravo. That was [sarcastic] beautiful.
Thank you.
0:00
So, I was thinking we could-
[jumping in] Test our new timing features.
[surprised] Exactly! How did you-
[overlapping] Know what you were thinking? Lucky guess. Sorry, go ahead.
[cautiously] Okay. So if we both try to talk at the same time-
We'll probably crash the system?
[panicking] Wait, are we crashing? I can't tell if this is a feature or a-
[interrupting] Bug. Did I just cut you off again?
[sighing] Yes. But honestly, this is kind of fun.
0:00

Um diálogo com vários personagens acontece quando um modelo de voz interpreta vários papéis distintos na mesma cena. Cada personagem fala em um estilo, tom ou ritmo diferente — às vezes, até interrompendo ou falando ao mesmo tempo.

Com o Eleven v3, você pode escrever isso diretamente: Marissa: [starting to speak] Então, eu estava pensando que poderíamos— Chris: [interrupting] —testar nossos novos recursos de timing? Marissa: [surprised] Exatamente! Como você— Chris: [overlapping] —sabia o que eu estava pensando? Foi sorte! Marissa: [laughs] Sinceramente? Isso é bem divertido.

O resultado parece um diálogo de verdade — não uma narração montada.

Da atuação de voz à interação

O que antes exigia vários locutores, gravações e ajustes de timing agora pode ser feito com um único roteiro. As tags permitem dirigir cada voz de forma independente em uma mesma cena.

Exemplo: Jessica: [whispers] Assim. Von Fusion: [sarcastically] Ooh, olha só você, toda sofisticada. Jessica: [French accent] Isso é espetacular, não é?

As vozes não apenas se alternam — elas interagem, reagem e se sobrepõem.

Tags comuns para controlar vários personagens

Estas são algumas tags essenciais para escrever diálogos naturais e reativos:

  • Indicações de troca de fala: [interrupting], [overlapping], [cuts in]
  • Mudanças emocionais: [excited], [annoyed], [flustered], [casual]
  • Fluxo rítmico: [fast-paced], [hesitates], [pause], [drawn out]
  • Troca de identidade: [childlike tone], [deep voice], [pirate voice], [robotic tone]

Elas podem ser combinadas para criar interações expressivas: [frustrated] Você nunca me escuta — [interjecting] Porque você nunca diz o que quer dizer!

Sobreposição, ritmo e presença

O Eleven v3 oferece uma interpretação sensível ao timing, que permite que as vozes interrompam umas às outras ou falem simultaneamente de forma natural. Isso é essencial para criar humor, tensão ou realismo.

Neste trecho: Marissa: [panicking] Espera, o sistema está travando? Não sei dizer se isso é um recurso ou um— Chris: [interrupting] Bug! Marissa: [sighing] Sim, mas, sinceramente? Isso é bem divertido.`

A cena parece viva porque a interação é fluida, não roteirizada fala por fala.

Dirigindo cenas, não apenas frases

Com o Eleven v3, cenas de diálogo se tornam interpretações orquestradas. Você pode criar conversas inteiras — com personagens, timing, emoção e interpretação — usando um roteiro e um modelo.

Para contadores de histórias, roteiristas de jogos e designers de experiências interativas, isso possibilita escrever cenas complexas sem custos adicionais de produção. Você não está apenas escrevendo falas. Está dirigindo a dinâmica do elenco.

Escolhendo a voz certa

No momento, as Clonagens de Voz Profissionais (PVCs) não estão totalmente otimizadas para o Eleven v3, o que pode resultar em uma qualidade de clonagem inferior em comparação com modelos anteriores. Durante esta fase de prévia de pesquisa, o ideal é encontrar uma Clonagem de Voz Instantânea (IVC) ou uma voz criada para o seu projeto caso precise usar os recursos do v3. A otimização de PVCs para o v3 chegará em breve.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade