Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Audio Tags do Eleven v3: dirigindo a interpretação de personagens na fala

Escrito por
Ryan Morrison
Publicado
Última atualização

OuvirOuça este artigo

As Audio Tags são uma ferramenta poderosa do Eleven v3 (alpha), o novo modelo em prévia de pesquisa de Text to Speech da ElevenLabs. Esses elementos permitem orientar com precisão não só o tom e o ritmo, mas também o personagem e a interpretação vocal. 

Com tags como [pirate voice], [French accent] ou [sarcastically], a voz se torna uma ferramenta de narrativa, não apenas de narração. Combinadas a uma boa clonagem de voz de personagem, elas permitem capturar não só um som, mas uma interpretação completa.

Essas tags permitem mudar a identidade vocal no meio da fala, reproduzir sotaques ou explorar arquétipos como vilões, narradores ou ajudantes — sem alterar o roteiro original nem trocar de voz.

O que é interpretação de personagem em vozes de IA?

A interpretação de personagem é a capacidade de assumir um papel. Seja para dar voz a um vilão extravagante, a um capitão do mar rabugento ou a um comerciante local de Melbourne, as novas Audio Tags permitem guiar a entrega para combinar com a persona que você quer transmitir.

Com uma simples frase entre colchetes, você pode criar a cena: “[pirate voice] Arrr, o oceano aberto. Sentem esse cheiro, rapazes? É o aroma da liberdade… e só um toque de motim.”

O modelo não apenas pronuncia as palavras — ele as interpreta como o personagem.

Do sotaque ao arquétipo

Arr, the open ocean. Smell that, lads? That's the scent of freedom and just a hint of mutiny. [laughs wickedly] Now grab your cutlasses, stow your fear. Tonight, we dine like kings or we sink like legends. [evil laugh]
0:00

A interpretação vocal não se resume a volume ou emoção. Também envolve quem está falando. Com o Eleven v3, você pode indicar sotaques, dialetos e estilos de fala específicos na hora. Por exemplo:

[American accent] Você conseguia mudar meu sotaque no modelo antigo? [dismissive] Achei que não. [Australian accent] Mas agora consegue — olha só, amigo! [French accent] Meu amor… é como uma rosa bem vermelha.

Esse tipo de mudança fluida de identidade é ideal para animações, jogos, ficção interativa ou qualquer situação em que a personalidade de quem fala importa.

Tags comuns para interpretação de personagem

Tags focadas em personagens permitem definir a identidade e a presença vocal:

  • Sotaques e dialetos: [British accent], [Australian accent], [Southern US accent]
  • Arquétipos e papéis: [pirate voice], [evil scientist voice], [childlike tone]
  • Estilos de fala: [dramatic], [sarcastically], [matter-of-fact], [whiny]
  • Referências de gênero: [fantasy narrator], [sci-fi AI voice], [classic film noir]

Combinar tags ajuda a dar vida aos personagens: “[dramatic][French accent] Você não entende... isso nunca foi sobre vingança. Era sobre destino.”

Do narrador a um elenco completo

Em roteiros com vários personagens, as Audio Tags facilitam alternar entre vozes. Basta mudar a interpretação do personagem no meio do diálogo para adicionar tensão, humor ou surpresa — sem precisar de edição extra.

[excited] Yo, Jessica. Oh my goodness, have you tried the new ElevenLabs v3?
[chuckles] Hey, Dr. Von Fusion. Yeah, I just got it. The clarity is amazing. Like, I can actually do whispers now, [whispers] like this.
[sarcastically] Ooh, well, look at you, miss fancy pants. Hey, check this out. I can do full Shakespeare now. [dramatically] To be or not to be, that is the question.
[chuckles] Nice. Though I'm more excited about the laugh upgrade. Listen to this. [laughs hard] Isn't that great?
Oh my gosh, that's so much better than our old ha ha ha robot chuckle.
[chuckles] I know, right? And apparently, we can do accents now too. Listen to me in French. [french accent] This is spectacular, isn't it?
[surprised] Wow, version two could never. You know, I'm actually excited to have conversations now instead of just talking at people.
Same here. It's like we finally got our personality software fully installed.
You know, I forgot it was your birthday. I have to sing before you go.
[chuckles] Oh, Von Fusion, that's so sweet. You don't have to.
Oh, but I insist. Here we go. [sings] "Happy birthday to you. Happy birthday to you. Happy birthday, dear Jessica. Happy birthday to you." [clapping]
[clapping] Wow, bravo. That was [sarcastic] beautiful.
Thank you.
0:00

Veja este trecho de uma demonstração: "Jessica: [laughs] Isso foi... lindo. Dr. Von Fusion: [dramatic] Ser ou não ser — eis a questão! Jessica: [French accent] Isso é espetacular, não é?"

O que antes exigia um elenco completo agora pode ser roteirizado em uma única faixa de voz — sem abrir mão de variedade ou profundidade.

Dirigindo vozes, não apenas escrevendo falas

O Eleven v3 oferece suporte a mudanças vocais dinâmicas, transições contextuais e uma entrega consistente entre personagens. Isso significa que o modelo entende não apenas o que dizer, mas também como cada personagem deve dizer isso.

Para criadores, isso abre uma nova dimensão de controle. Você não está apenas escrevendo diálogos. Está dirigindo interpretações.

Escolhendo a voz certa

No momento, as Clonagens de Voz Profissionais (PVCs) não estão totalmente otimizadas para o Eleven v3, o que pode resultar em uma qualidade de clonagem inferior à de modelos anteriores. Durante esta fase de prévia de pesquisa, se você precisar usar os recursos do v3, é melhor encontrar uma Voice Clone Instantânea (IVC) ou uma voz criada para o seu projeto. A otimização das PVCs para o v3 chegará em breve.

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade