Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Lista de Audio Tags do Eleven v4: teste e depois crie as suas

Escrito por
Jack Limebear
Publicado

OuvirOuça este artigo

O Eleven v4 é um modelo revolucionário de Text to Speech que transforma texto em interpretação. As Audio Tags permitem dirigir essa interpretação com controle detalhado sobre sua expressão emocional. Insira uma indicação em linguagem natural entre colchetes, como [whispers] ou [excited], e ouça o v4 ajustar a forma de falar.

Esta lista de Audio Tags da ElevenLabs reúne todas as emoções da gama emocional do Eleven v4, além de tags para interpretação, ritmo, reações, sotaques e efeitos sonoros. Depois de aprender o básico, também mostraremos como escrever suas próprias tags em linguagem simples.

Conheça as emoções do Eleven v4

Ouça a gama
ExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTired

Resumo

  • Audio Tags são sinais em linguagem natural, entre colchetes, que o Eleven v4 interpreta como instruções de performance, mudando como ele entrega as palavras seguintes.
  • O Eleven v4 é o modelo mais bem classificado na Artificial Analysis Speech Arena [setembro de 2026], e as Audio Tags permitem que você dirija essa interpretação linha por linha.
  • A roda de gama emocional do Eleven v4 permite ouvir emoções diferentes para ter uma visão rápida das capacidades do modelo.
  • As tags não se limitam a uma lista fixa. Você pode criar as suas combinando qualidades, como [whispering, fearful], ou descrevendo a situação ou o personagem por trás de uma fala.
  • As Audio Tags funcionam pela ElevenAPI no Eleven v4, Eleven v4 Turbo e Eleven v3.

O que são as Audio Tags da ElevenLabs?

Audio Tags são indicações em linguagem natural que você pode inserir no texto entre colchetes. O Eleven v4 as lê como marcadores de performance, usando-as como instruções que alteram como ele fala determinadas palavras ou frases. Você as escreve diretamente no roteiro, no app de Text to Speech da ElevenLabs, e vê nossos modelos ganharem vida.

O Eleven v4 é o modelo de TTS mais bem classificado na Artificial Analysis Speech Arena, onde ouvintes votam no texto em voz com som mais natural.1 As Audio Tags permitem levar essa interpretação ainda mais longe, dirigindo exatamente como cada linha é entregue.

Veja como usar Audio Tags em um roteiro:

  • Coloque uma tag antes das palavras que ela afeta: Quando você escreve “[shouts] I can’t believe you said that to me”, a linha inteira é gritada.
  • A emoção continua: Quando você adiciona uma tag, a emoção dela segue pela linha. Isso significa que você só precisa inserir outra tag quando quiser mudar a interpretação. Por exemplo, “[proud] I’ve been cooking for over a decade. I know how to boil an egg. [startled] What’s that burning smell?"
  • Combine tags para sobrepor instruções: Separe as Audio Tags com vírgula dentro do mesmo par de colchetes, como [whispering, playful], para adicionar nuances à sua interpretação de TTS.
  • Combine tags com pontuação: Embora as Audio Tags definam o clima e a interpretação, você pode controlar o ritmo naturalmente usando pontuação no roteiro. Adicione reticências, travessões ou letras maiúsculas para moldar a prosódia de uma linha.

Para uma explicação mais detalhada sobre como as tags funcionam e como substituem o SSML, escrevemos um guia completo de Audio Tags.

Text-to-speech leaderboard: Eleven v4 leads with 1319 Elo, ahead of Sonic 3.6. Take this further by selecting from the ElevenLabs Audio Tags list

Lista de Audio Tags de emoção

A roda de emoções do Eleven v4 tem dezenas de emoções, cada uma interpretada pelo v4 para que você ouça a diferença antes mesmo de escrever uma tag. 

Clique em qualquer emoção abaixo para ouvi-la na roda ou experimente diretamente com a frase e a emoção para ouvir o Eleven v4 dar vida às Audio Tags emocionais.

Embora tenhamos apresentado algumas emoções aqui, você pode usar linguagem natural para aplicar qualquer emoção que quiser. No exemplo abaixo, usamos várias Audio Tags que não aparecem acima para mostrar o que é possível fazer com prompts em linguagem natural.

[jittery] Okay, final question of the pub quiz, and we're tied for first. [intrigued] "Which planet has the most moons?" Hmm. [smug] Easy. It's Saturn, everyone knows that. [puzzled] Wait, why is Priya shaking her head? [disgusted] Jupiter? You want to write down Jupiter? [frazzled] We only have ten seconds, just pick one, pick one! [hopeful] [nervous] Fine. Saturn. Hand it in. [long pause] [triumphant] YES! Saturn! We won! [mischievous] [slightly pause] Priya, I believe you owe me a drink.
0:00

Esta amostra ganhou vida com Jonathan Livingston.

Lista de Audio Tags de interpretação e volume

As tags de interpretação e volume controlam o quão alta ou intensa uma fala soa, independentemente da emoção escolhida. Se quiser que o v4 siga uma visão mais específica, combine tags de interpretação e emoção para ter um controle mais detalhado.

Veja alguns exemplos:

  • [whispers] Não se mexa, está bem atrás de você.
  • [shouts] Todo mundo, evacue o prédio agora! 
  • [softly] Você fez tudo o que podia. 
  • [quietly] Acho que eles foram embora. 
  • [low, threatening] Você realmente não devia ter vindo aqui.

Vamos ver o controle de volume e interpretação em ação.

[hushed] Eighteenth hole. One putt to win the championship, and the crowd has gone completely silent. [barely audible] He's lining it up now. The ball is rolling... still rolling... [booming] IT'S IN! HE'S DONE IT! The championship is his, and this place has gone absolutely wild! [disbelief] Twenty years I've been calling golf, and I have never seen anything like that.
0:00

A amostra acima ganhou vida com Rod.

Lista de Audio Tags de ritmo

As Audio Tags de ritmo mudam a velocidade de uma fala. Adicione-as para criar suspense ou preparar o momento cômico perfeito. Quando o timing importa tanto quanto as palavras, use tags de ritmo.

Como dica extra, a pontuação ajuda naturalmente na interpretação de texto em voz, então combine os dois para ter controle total sobre a frase: 

  • [slowly] E o vencedor é... 
  • [rushed] Desculpe o atraso, o trem quebrou, corri o caminho todo. 
  • [pause] Então o telefone tocou. 
  • [drawn out] Nããão acredito.
[slowly] Ten... nine... eight... seven... [rushed] Wait, wait, wait, hold the countdown, someone left their coffee on the console! [snappy] Can you get that out of here? [long pause] [drawn out] Okaaay, thank you. It's been moved. [excited] Resume the count! [speedy] Three... two... one... LIFTOFF!
0:00

Adam foi a voz que deu vida a esta amostra.

Lista de Audio Tags de reações humanas

As tags de reação adicionam sons como risadas, suspiros, choro, tosses e arquejos às suas frases. Elas realmente dão vida ao texto e fazem uma amostra de áudio de TTS soar natural, como uma pessoa falando espontaneamente, e não lendo um roteiro.

Veja algumas Audio Tags de reação:

  • [laughs] Você realmente caiu nessa? 
  • [sighs] Tá bom. Eu lavo a louça. 
  • [gasps] Isso é um diamante de verdade? 
  • [clears throat] Se eu puder ter a atenção de todos. 
  • [crying] Eu não achei que você voltaria.

O Eleven v4 também adiciona pequenos toques humanos quando a emoção pede. Ouça a roda de emoções e você ouvirá falas como "V- você voltou?" e "Aff, isso é real?", em que o v4 adicionou uma gaguejada ou um gemido por conta própria.

[clears throat] Hi, everyone. For those who don't know me, I'm the best man. [laughs] Well, I'm the only man Tom could find at short notice. [sighs] When Tom first told me about Adam, I thought, there's no way he’s real. [gasps] Sorry, is that the cake? It's enormous. Anyway. [starts crying] I've never seen him this happy. [laughs] Okay, I'm fine. I'm fine. To Tom and Adam!
0:00

Para usar esta voz nas suas produções, procure por Jack John. 

Lista de Audio Tags de sotaque e personagem

Criar cenas ricas com diferentes sotaques ou vozes de personagens ficou mais fácil do que nunca com o Eleven v4. Com algumas Audio Tags, você pode transformar uma voz em uma nova persona sem perder suas características principais. Uma voz pode interpretar um elenco inteiro em uma única geração.

  • [British accent] Que tal uma xícara de chá?
  • [French accent] Bem-vindo ao meu pequeno café.
  • [Australian accent] Sem problema, cara, vamos resolver isso.
  • [pirate voice]Icem as velas e passem o rum.
Let's visit four stops in thirty seconds. First, London. [British accent] Mind the gap. Lovely weather we're having. [excited] Next, Dublin! [Irish accent] Grand day for it, isn't it? Sure, a bit of rain never hurt anyone. [rushed] No time, no time, on to Sydney! [Australian accent] G'day! Watch out for the seagulls, they'll nick your chips. [pirate voice] Arg, now the high seas, where the tour ends and the treasure begins!
0:00

Lauren ajudou a dar vida a esta amostra.

Lista de Audio Tags de efeitos sonoros

As Audio Tags de efeitos sonoros introduzem eventos não verbais diretamente nas suas gerações. Por exemplo, ao criar uma cena narrativa ou uma trilha para videogame, você pode usá-las para dramatizar sem precisar de uma faixa de efeitos sonoros separada. Ainda assim, você sempre pode usar o gerador de efeitos sonoros com IA se estiver procurando algo específico. 

  • [thunder rumbling] Está chegando mais perto.
  • [footsteps] Alguém está subindo as escadas.
  • [door creaking] Olá? Tem alguém em casa?
  • [clapping] Obrigado, obrigado, vocês são gentis demais.
[owl hooting] [nervous] Did you hear that? [gulp] It's just an owl, right? [twig snapping] [nervous] Okay, owls don't do that. [many footsteps] [scared] Something's walking around the tent. [zipper opening] [startled] Wait, who just opened the tent? [dog barking] [laughs] Biscuit! You scared me half to death. [sighs] Fine, you can sleep in here too.
0:00

A voz no clipe acima é Siren.

Crie suas próprias Audio Tags com linguagem natural

Qualquer uma das Audio Tags exibidas acima é um ótimo ponto de partida. Mas a magia do TTS da ElevenLabs é que você pode escrever qualquer nova Audio Tag em linguagem natural para dar ao modelo um contexto adicional que ele possa usar. 

Como alternativa, se nenhuma tag de uma palavra captar o que você busca, escreva uma instrução mais completa.

  • Combine emoções e qualidades: [tense, cautious] ou [whispering, fearful]
  • Descreva a maneira: [like a sports commentator, speeding up]
  • Descreva a situação: [out of breath after running up the stairs]
  • Descreva o personagem: [a tired detective who has heard it all before]
  • Descreva a mudança: [starting calm, then losing patience]
[hushed and reverent, like a nature documentary narrator] Here, in the quiet of the office kitchen, a rare creature emerges. [barely containing excitement] The intern. [slow and suspenseful] He approaches the last slice of birthday cake. He has been waiting for this moment all afternoon. [speeding up, like a sports commentator] He's going for it, he's reaching, he's almost there, he's- [sudden, crushed disappointment] Someone from accounts got there first. [hushed and reverent] Nature, as always, is cruel.
0:00

Dê vida à sua cena com Spuds Oxley. 

Dicas para escolher Audio Tags 

Escrever em linguagem natural oferece muita flexibilidade ao criar amostras de áudio de texto em voz, mas também significa que chegar ao resultado perfeito pode exigir alguns ajustes.

Para que sua experiência de TTS com o Eleven v4 seja a mais fluida possível, veja algumas dicas para trabalhar com Audio Tags:

  • Ouça antes de escrever: Reproduza algumas emoções na roda de emoções para ouvir como o v4 interpreta cada uma delas (ou para se inspirar) e escolha a mais próxima para sua fala.
  • Troque a tag antes de reescrever a linha: Se a interpretação não ficar boa, experimente uma emoção próxima, como [let down] em vez de [despair], e gere novamente.
  • Use uma tag por oração: Tags contrastantes nas mesmas palavras podem deixar a interpretação confusa. Adicione uma nova tag no ponto em que quiser mudar a emoção.
  • Dê ao modelo uma cena completa: O Eleven v4 tem um desempenho melhor com contexto. Com uma janela de até 10.000 caracteres por geração no app de Text to Speech, você tem espaço para criar instruções em camadas e dar vida à sua cena.
  • Comece com uma predefinição e depois seja específico. Se [nervous] estiver perto, mas não exatamente certo, escreva o que está faltando: [nervous, trying to sound confident].

Mas, acima de tudo, entrar no app de TTS da ElevenLabs e experimentar é a melhor forma de se familiarizar e começar a produzir áudio de TTS de alta qualidade.

Guide to six ElevenLabs audio tag list types and layering multiple cues with comma-separated tags.

Comece a criar áudio imersivo no Eleven v4

Não existe uma lista definitiva de Audio Tags da ElevenLabs porque você pode criar qualquer combinação que quiser escrevendo em linguagem natural. Todas as tags desta lista funcionam no Eleven v4, mas também funcionarão as tags que você imaginar enquanto escreve sua cena.

Escolha uma das mais de 17.500 vozes da Voice Library, cole seu roteiro e adicione sua primeira Audio Tag para começar. 

Saiba mais sobre o Eleven v4 ou crie sua conta para criar interpretações de áudio impressionantes.

Perguntas frequentes sobre as Audio Tags da ElevenLabs

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 de setembro de 2026

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade