Pular para o conteúdo

O que são tags de áudio? Guia completo para TTS emocional

Escrito por
Jack Limebear
Publicado
Última atualização

OuvirOuça este artigo

Audio tags são comandos em linguagem natural entre colchetes, como [laughs], [gasps], [excited] e [worried], que o Eleven v3 interpreta como instruções de atuação, e não como palavras a serem faladas. Ao escrever um roteiro para um modelo de Text to Speech, inserir essas audio tags dá a você controle detalhado sobre a entrega emocional do texto.

Eleven v3 ficou disponível publicamente em março de 2026. Antes do v3, conseguir uma interpretação emocional específica de um modelo de Text to Speech envolvia gerar o conteúdo novamente e torcer pelo melhor. As audio tags eliminam essa tentativa e erro, dando a você controle total sobre uma interpretação emocional de Text to Speech.

Este guia explica o que são audio tags, como funcionam, todas as categorias disponíveis e como se comparam ao SSML (Speech Synthesis Markup Language). Também abordaremos casos de uso comuns, cada um com um guia específico.

Resumo:

  • Audio tags são comandos entre colchetes, como [shouts] ou [excited], que direcionam emoção, ritmo, entrega e tom no TTS do Eleven v3.
  • O Eleven v3 não oferece suporte a SSML, mas o substitui por audio tags para uma experiência de escrita mais natural.
  • As tags abrangem categorias como emoções, entrega e ritmo, reações humanas, sotaques e efeitos sonoros.
  • A pontuação e o uso de maiúsculas no texto permitem moldar o ritmo da interpretação de uma voz IA.
  • Você pode acessar audio tags na ElevenLabs pela interface ou pela API.

Como as audio tags funcionam?

As audio tags ficam no próprio texto da transcrição e são inseridas entre colchetes. Sempre que quiser mudar a entrega, por exemplo, de normal para [worried], basta adicionar uma audio tag.

Você também pode usar mais de uma tag em uma única frase e combiná-las para uma interpretação com mais camadas, como [tired] It’s been a long day… [upset] How many more days can I take?

A arquitetura por trás do Eleven v3 permite que o modelo compreenda o contexto em um nível mais profundo do que os modelos anteriores. Assim, ele consegue seguir comandos emocionais, mudanças de tom, transições entre falantes e pistas contextuais sem precisar de um parâmetro ou configuração separados. Basta dizer ao modelo o que a situação pede, e ele interpretará a fala exatamente como você planejou.

O Eleven v3 também lida com diálogos entre vários falantes de forma espontânea, incluindo interrupções, mudanças de humor e as trocas naturais de uma conversa real, tudo apenas com tags e a estrutura do roteiro.

Audio tags vs. SSML

Se você já trabalhou com outros sistemas de TTS, provavelmente conhece o Speech Synthesis Markup Language. Plataformas como Amazon Polly e Microsoft Azure Speech usam tags SSML, como <break> ou <emphasis>, para fornecer contexto adicional a um roteiro de TTS.

O Eleven v3 não oferece suporte a tags de pausa do SSML nem ao restante do conjunto de tags SSML. Em vez disso, audio tags, pontuação e a própria estrutura do texto assumem essa função, oferecendo controle detalhado sobre a entrega.

Você pode usar a tabela abaixo para relacionar tags SSML comuns aos equivalentes no Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Para quem escreve, adicionar [whispers] a uma fala exige bem menos esforço do que configurar uma taxa de prosódia.

As categorias de audio tags no v3: direcionando interpretações com audio tags

Você pode inserir audio tags em qualquer lugar do roteiro para moldar a entrega em tempo real. Também pode combinar tags em um roteiro ou até mesmo em uma frase.

As tags se dividem nas seguintes categorias principais.

Emoções

Essas tags ajudam a definir o tom emocional da voz, seja sombrio, intenso ou animado. Por exemplo, você pode usar uma ou uma combinação de [sad], [angry], [happily] e [sorrowful].

Background
Background

Entrega e ritmo

Essas tags estão mais relacionadas ao tom e à interpretação. Você pode usá-las para ajustar o volume e a energia em cenas que exigem contenção ou intensidade. Alguns exemplos são [whispers], [shouts] e [softly].

Background
Background

Reações humanas

A fala realmente natural inclui reações. Por exemplo, você pode usar essas tags para dar mais realismo à fala, inserindo momentos naturais e não roteirizados. Tags como [laughs], [clears throat] e [sighs] ajudam a criar um modelo de TTS capaz de transmitir emoção humana.

Outros exemplos de categorias de audio tags incluem:

  • Sotaques e vozes de personagens: Tags de sotaque mudam a voz para uma região ou persona específica sem trocar de modelo, como [French accent], [British accent] ou [pirate voice]. Use-as para transformar uma única voz em um elenco versátil, em vez de uma interpretação fixa.
  • Efeitos sonoros: Tags de efeitos sonoros adicionam áudio não falado diretamente à geração, como [gunshot], [explosion] e [clapping]. Elas funcionam bem para áudios imersivos, jogos e narrações dramatizadas em que a cena precisa de mais do que uma voz. Como alternativa, use o gerador de efeitos sonoros com IA ElevenCreative.

Embora as tags ofereçam bastante controle, você também pode usar a pontuação para moldar o ritmo e a ênfase. Por exemplo, adicione reticências para uma pausa natural ou use vírgulas para criar padrões naturais de respiração. Tente escrever uma palavra toda em maiúsculas para dar ênfase: “Eu quero isso AGORA.”

Background
Background

O que você pode fazer com audio tags?

As audio tags liberam a complexidade emocional dos roteiros de forma intuitiva. Escreva naturalmente e adicione tags ao longo do processo.

Confira alguns casos de uso de TTS emocional com audio tags.

Consciência situacional em áudio criado com IA

Tags como [whisper] ou [shouting] permitem que o Eleven v3 reaja ao momento. De suavizar um aviso a sustentar uma pausa prolongada para criar suspense, você pode incorporar consciência situacional dinâmica ao seu roteiro.

Para uma explicação completa, confira nosso guia sobre consciência situacional em áudio criado com IA.

Direcionando a interpretação de personagens na fala

Ao criar um roteiro com vários personagens, é importante demonstrar claramente como cada voz é diferente. Desde ajustar a personalidade com [sarcastically] até definir como falam com [British accent], você pode transmitir uma ampla gama de emoções com nosso mecanismo de TTS.

Saiba mais sobre como direcionar a interpretação de personagens em fala criada com IA.

Expressando contexto emocional na fala

As audio tags permitem moldar a entrega emocional de uma fala à medida que ela avança. Você pode desenvolver emoções ao longo de um discurso, chegando a um clímax no momento em que imagina seu personagem em todo o seu potencial. Tags como [awe], [booming] e [big laugh] ajudam a criar uma gama emocional completa na interpretação da sua voz IA.

Leia mais sobre como usar contexto emocional em fala criada com IA.

Dando vida a diálogos com vários personagens

Ao criar interpretações de diálogos com vários personagens, você pode começar cada fala com uma audio tag para construir conversas ricas entre os personagens.

Veja este exemplo: Tom: [coughing] [beginning to speak] desculpe, estou um pouco doente hoje— Emma: [interrupting] —Doente? Você sabe como eu odeio tosse, Tom! Tom: [surprised] É só uma tossinha, não é nada sério. Como você se sentiria se— Emma: [overlapping] [annoyed] —Acho que você precisa ir para casa.

Veja o que mais você pode fazer com diálogos com vários personagens no Eleven v3.

Controle preciso da entrega para fala criada com IA

Você pode controlar o ritmo da fala no Eleven v3 usando audio tags ou pontuação. Tags como [pause], [rushed] ou [drawn out] permitem moldar a fala com precisão. Como alternativa, adicione reticências, pontos finais e pontos de exclamação para inserir emoção naturalmente na sua interpretação de TTS.

Escrevemos um guia detalhado sobre controle preciso da entrega no Eleven v3.

TTS emocional está disponível na API

As audio tags funcionam da mesma forma pela API de Text to Speech e na interface da ElevenLabs. Escreva a tag junto ao texto do roteiro, e a API retornará a interpretação marcada no áudio gerado, desde fluxos de trabalho para audiolivros até locuções publicitárias.

Saiba mais sobre Eleven v3 ou fale com a equipe de vendas para começar hoje.

Perguntas frequentes sobre audio tags e TTS emocional

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade