O que são Audio Tags? O guia completo para TTS emocional
- Escrito por
- Jack Limebear
- Publicado
- Última atualização
OuvirOuça este artigo
Audio Tags são instruções em linguagem natural entre colchetes, como [laughs], [gasps], [excited] e [worried], que o Eleven v3 interpreta como direções de interpretação, e não como palavras a serem faladas. Ao escrever um roteiro para um modelo de Text to Speech, inserir essas Audio Tags dá a você controle detalhado sobre a entrega emocional do texto.
Eleven v3 ficou disponível publicamente em março de 2026. Antes do v3, conseguir uma interpretação emocional específica de um modelo de Text to Speech era um processo de gerar o conteúdo novamente e torcer pelo melhor. As Audio Tags eliminam essa incerteza e dão a você controle total sobre uma interpretação emocional de texto em fala.
Este guia explica o que são Audio Tags, como elas funcionam, todas as categorias de tags disponíveis e como se comparam ao SSML (Speech Synthesis Markup Language). Também vamos abordar casos de uso comuns, cada um com um guia específico.
Resumo
- Audio Tags são instruções entre colchetes, como [shouts] ou [excited], que direcionam a emoção, o ritmo, a entrega e o tom no TTS do Eleven v3.
- O Eleven v3 não oferece suporte a SSML, mas o substitui por Audio Tags para uma experiência de escrita mais natural.
- As tags abrangem algumas categorias, como emoções, interpretação e ritmo, reações humanas, sotaques e efeitos sonoros.
- A pontuação e o uso de maiúsculas no texto permitem moldar o ritmo da interpretação de uma voz IA.
- Você pode acessar as Audio Tags na ElevenLabs pela interface ou pela API.
Como as Audio Tags funcionam?
As Audio Tags ficam inseridas no texto da sua transcrição e vêm entre colchetes. Sempre que quiser mudar a entrega, por exemplo, de normal para [worried], basta adicionar uma Audio Tag.
Você também pode usar mais de uma tag em uma frase e combiná-las para uma interpretação com mais camadas, como [tired] Foi um dia longo… [upset] Quantos dias mais eu vou aguentar?
A arquitetura do Eleven v3 permite que o modelo compreenda o contexto em um nível mais profundo que os modelos anteriores, seguindo instruções emocionais, mudanças de tom, transições entre falantes e pistas de contexto sem precisar de um parâmetro ou configuração separados. Basta dizer ao modelo o que o momento pede, e ele interpretará a fala exatamente como você planejou.
O Eleven v3 também lida com diálogos entre vários falantes de forma espontânea, incluindo interrupções, mudanças de humor e a troca natural de uma conversa real, tudo apenas com tags e a estrutura do roteiro.
Audio Tags vs. SSML
Se você já trabalhou com outros sistemas de TTS, provavelmente conhece o Speech Synthesis Markup Language. Plataformas como Amazon Polly e Microsoft Azure Speech usam tags SSML como <break> ou <emphasis> para adicionar algum contexto a um roteiro de TTS.
O Eleven v3 não oferece suporte às tags de pausa do SSML nem ao restante do conjunto de tags SSML. Em vez disso, Audio Tags, pontuação e a própria estrutura do texto assumem esse papel, oferecendo controle detalhado sobre a entrega.
Você pode usar a tabela abaixo para relacionar tags SSML comuns aos equivalentes do Eleven v3.
Para quem escreve, adicionar [whispers] a uma fala exige muito menos esforço do que configurar uma taxa de prosódia.
As categorias de Audio Tags no v3: direcionando a interpretação com Audio Tags
Você pode inserir Audio Tags em qualquer lugar do roteiro para moldar a entrega em tempo real. Também é possível combinar tags em um roteiro ou até em uma única frase.
As tags se dividem nas seguintes categorias principais.
Emoções
Essas tags ajudam a definir o tom emocional da voz, seja sombrio, intenso ou animado. Por exemplo, você pode usar uma ou uma combinação de [sad], [angry], [happily] e [sorrowful].
Interpretação e ritmo
Estas têm mais a ver com o tom e a performance. Você pode usar essas tags para ajustar o volume e a energia em cenas que exigem contenção ou intensidade. Alguns exemplos são [whispers], [shouts] e [softly].
Reações humanas
A fala realmente natural inclui reações. Você pode usá-las para adicionar realismo, inserindo momentos naturais e não roteirizados à fala. Tags como [laughs], [clears throat] e [sighs] ajudam a criar um modelo de TTS capaz de transmitir emoções humanas.
Outros exemplos de categorias de audio tags incluem:
- Sotaques e vozes de personagens: As tags de sotaque mudam a voz para uma região ou persona específica sem trocar de modelo, como [French accent], [British accent] ou [pirate voice]. Use-as para transformar uma única voz em um elenco versátil, em vez de uma performance fixa.
- Efeitos sonoros: As tags de efeitos sonoros adicionam áudio não verbal diretamente à geração, como [gunshot], [explosion] e [clapping]. Elas funcionam bem em áudios imersivos, jogos e narrações dramatizadas, quando a cena precisa de mais do que uma voz. Como alternativa, use o gerador de efeitos sonoros com IA ElevenCreative.
Embora as tags ofereçam alto grau de controle, você também pode usar a pontuação para moldar o ritmo e a ênfase. Por exemplo, adicione reticências para uma pausa natural ou use vírgulas para criar padrões naturais de respiração. Tente escrever uma palavra toda em maiúsculas para dar ênfase: “Eu quero isso AGORA.”
O que você pode fazer com Audio Tags?
As Audio Tags liberam a complexidade emocional dos roteiros de forma intuitiva. Escreva naturalmente e adicione tags conforme avança.
Veja alguns casos de uso de TTS emocional com Audio Tags.
Consciência situacional em áudio com IA
Tags como [whisper] ou [shouting] permitem que o Eleven v3 reaja ao momento. De suavizar um aviso a sustentar uma pausa prolongada para criar suspense, você pode incorporar consciência situacional dinâmica ao seu roteiro.
Para uma explicação completa, confira nosso guia sobre consciência situacional em áudio com IA.
Direcionando a interpretação de personagens na fala
Ao criar um roteiro com vários personagens, é importante demonstrar claramente como cada voz é diferente. Desde ajustar a personalidade com [sarcastically] até definir como a pessoa fala com [British accent], você pode transmitir toda uma gama de emoções com nosso mecanismo de TTS.
Saiba mais sobre como direcionar a interpretação de personagens em falas com IA.
Expressando contexto emocional na fala
As Audio Tags permitem moldar a entrega emocional de uma fala à medida que ela avança. Você pode desenvolver emoções ao longo de um discurso e chegar a um crescendo no momento em que imagina seu personagem atingindo todo o seu potencial. Tags como [awe], [booming] e [big laugh] ajudam a criar toda uma gama emocional na interpretação da sua voz IA.
Leia mais sobre como usar contexto emocional em falas com IA.
Dando vida a diálogos com vários personagens
Ao criar interpretações de diálogos com vários personagens, você pode iniciar cada fala com uma audio tag para desenvolver conversas ricas entre os personagens.
Veja este exemplo: Tom: [coughing] [beginning to speak] desculpe, estou um pouco doente hoje— Emma: [interrupting] —Doente? Você sabe como eu odeio tosse, Tom! Tom: [surprised] É só uma tossinha, não é nada sério. Como você se sentiria se— Emma: [overlapping] [annoyed] —Acho que você precisa ir para casa.
Veja o que mais você pode fazer com diálogos com vários personagens no Eleven v3.
Controle preciso da interpretação de fala com IA
Você pode controlar o ritmo da fala no Eleven v3 com Audio Tags ou pela pontuação. Tags como [pause], [rushed] ou [drawn out] permitem moldar a fala com precisão. Como alternativa, adicione reticências, pontos finais e pontos de exclamação para criar emoção naturalmente na sua interpretação de TTS.
Escrevemos um guia detalhado sobre controle preciso da interpretação no Eleven v3.
O TTS emocional está disponível na API
As Audio Tags funcionam da mesma forma pela API de Text to Speech e na interface da ElevenLabs. Escreva a tag diretamente no texto do roteiro, e a API retornará a interpretação indicada no áudio gerado, de fluxos de produção de audiolivros a locuções publicitárias.
Saiba mais sobre Eleven v3 ou fale com vendas para começar hoje.










