Eleven v3 Audio Tags: dando vida a diálogos com vários personagens
- Escrito por
- Ryan Morrison
- Publicado
- Última atualização
OuvirOuça este artigo
As conversas impulsionam a narrativa. Com Tags de Áudio do Eleven v3, agora você pode escrever cenas com vozes sobrepostas, trocas rápidas e interação emocional — tudo interpretado por um único modelo.
Ao combinar tags como [interrupting], [overlapping] ou [laughs], você pode criar diálogos naturais que fluem como uma conversa humana — com interrupções, mudanças de tom e reações espontâneas.
Não é só fala linha por linha. É uma interpretação com vários personagens.
O que é diálogo com vários personagens em vozes IA?
Um diálogo com vários personagens acontece quando um modelo de voz interpreta vários papéis distintos na mesma cena. Cada personagem fala em um estilo, tom ou ritmo diferente — às vezes, até interrompendo ou falando ao mesmo tempo.
Com o Eleven v3, você pode escrever isso diretamente: Marissa: [starting to speak] Então, eu estava pensando que poderíamos— Chris: [interrupting] —testar nossos novos recursos de timing? Marissa: [surprised] Exatamente! Como você— Chris: [overlapping] —sabia o que eu estava pensando? Foi sorte! Marissa: [laughs] Sinceramente? Isso é bem divertido.
O resultado parece um diálogo de verdade — não uma narração montada.
Da atuação de voz à interação
O que antes exigia vários locutores, gravações e ajustes de timing agora pode ser feito com um único roteiro. As tags permitem dirigir cada voz de forma independente em uma mesma cena.
Exemplo: Jessica: [whispers] Assim. Von Fusion: [sarcastically] Ooh, olha só você, toda sofisticada. Jessica: [French accent] Isso é espetacular, não é?
As vozes não apenas se alternam — elas interagem, reagem e se sobrepõem.
Tags comuns para controlar vários personagens
Estas são algumas tags essenciais para escrever diálogos naturais e reativos:
- Indicações de troca de fala: [interrupting], [overlapping], [cuts in]
- Mudanças emocionais: [excited], [annoyed], [flustered], [casual]
- Fluxo rítmico: [fast-paced], [hesitates], [pause], [drawn out]
- Troca de identidade: [childlike tone], [deep voice], [pirate voice], [robotic tone]
Elas podem ser combinadas para criar interações expressivas: [frustrated] Você nunca me escuta — [interjecting] Porque você nunca diz o que quer dizer!
Sobreposição, ritmo e presença
O Eleven v3 oferece uma interpretação sensível ao timing, que permite que as vozes interrompam umas às outras ou falem simultaneamente de forma natural. Isso é essencial para criar humor, tensão ou realismo.
Neste trecho: Marissa: [panicking] Espera, o sistema está travando? Não sei dizer se isso é um recurso ou um— Chris: [interrupting] Bug! Marissa: [sighing] Sim, mas, sinceramente? Isso é bem divertido.`
A cena parece viva porque a interação é fluida, não roteirizada fala por fala.
Dirigindo cenas, não apenas frases
Com o Eleven v3, cenas de diálogo se tornam interpretações orquestradas. Você pode criar conversas inteiras — com personagens, timing, emoção e interpretação — usando um roteiro e um modelo.
Para contadores de histórias, roteiristas de jogos e designers de experiências interativas, isso possibilita escrever cenas complexas sem custos adicionais de produção. Você não está apenas escrevendo falas. Está dirigindo a dinâmica do elenco.
Escolhendo a voz certa
No momento, as Clonagens de Voz Profissionais (PVCs) não estão totalmente otimizadas para o Eleven v3, o que pode resultar em uma qualidade de clonagem inferior em comparação com modelos anteriores. Durante esta fase de prévia de pesquisa, o ideal é encontrar uma Clonagem de Voz Instantânea (IVC) ou uma voz criada para o seu projeto caso precise usar os recursos do v3. A otimização de PVCs para o v3 chegará em breve.


