Text to Speech emocional: como dirigir performances de voz IA com o Eleven v4
- Escrito por
- Jack Limebear
- Publicado
- Última atualização
OuvirOuça este artigo
O Text to Speech emocional (TTS) transforma um roteiro em uma performance. Em vez de uma leitura monótona, um modelo de TTS expressivo entrega cada palavra com emoção, dando vida a uma cena com raiva, alegria, tristeza, frustração e muito mais.
Ao incluir Audio Tags no seu roteiro, você molda a performance de Text to Speech como um diretor faria. Adicione [furious] para aumentar a intensidade de uma fala, [sarcastic] para dar um toque de humor seco ou qualquer outra tag para mostrar ao modelo como você gostaria que uma fala fosse interpretada.
Com o Eleven v4, você tem um TTS emocional que pode dirigir fala por fala. Veja como criar roteiros que dão vida à sua escrita.
O que é Text to Speech emocional?
Text to Speech emocional é fala gerada por IA que interpreta uma fala, em vez de apenas lê-la. Ela expressa emoção, entende o tempo e o ritmo, dá ênfase às palavras certas e adiciona sons não verbais, como suspiros e risadas.
O Eleven v4 é um modelo inovador que transforma texto em uma verdadeira performance. Com descrições inseridas no texto, a mesma frase pode ser sussurrada, gritada ou dita entre lágrimas, dependendo do que você imaginar.
Seja escrevendo uma campanha publicitária para seu próximo lançamento ou dando vida aos capítulos do seu romance, o Eleven v4 está aqui para apoiar sua jornada com o Text to Speech da mais alta qualidade.
Como o Eleven v4 interpreta direções emocionais
O Eleven v4 interpreta as direções emocionais das Audio Tags no seu roteiro e as transforma em uma performance de áudio natural.
Veja algumas formas de adicionar direção emocional a um texto com o Eleven v4 para melhorar seu resultado final:
- Audio Tags: Escreva Audio Tags nas suas instruções, como [whispers] ou [cries], para inserir direções no próprio roteiro. Você poderá criar cenas com profundidade emocional dirigindo o v4 como faria com qualquer artista de palco.
- Pontuação: Use a pontuação para moldar o ritmo e a interpretação junto das suas Audio Tags. Reticências desaceleram uma fala, travessões interrompem um personagem no meio da frase e pontos de exclamação adicionam intensidade, oferecendo outra camada de direção sem precisar adicionar uma tag.
- Continuidade emocional: Comece uma frase com uma emoção, e o Eleven v4 mantém esse tom ao longo da fala. Crie suas cenas de forma iterativa e desenvolva roteiros ricos e contextuais com Audio Tags no v4.
Para mostrar como as Audio Tags dão vida ao texto com o v4, vamos explorar como exemplo a diferença entre áudios com e sem tags.
Neste primeiro exemplo, estamos usando apenas uma frase padrão. Como referência, usamos a voz Siren nestes exemplos.
Parágrafo de história sem Audio Tags no Eleven v4
Agora, este segundo exemplo traz a mesma frase com Audio Tags adicionadas. Temos indicações emocionais, efeitos sonoros e até sons além do texto, como uma risada maligna.
Parágrafo de história com Audio Tags no Eleven v4

Cinco performances de Text to Speech emocional com o Eleven v4
A melhor forma de mostrar todo o potencial do Eleven v4 é experimentá-lo você mesmo. Ao criar uma conta, você poderá começar a usar o Eleven v4 em poucos minutos.
Para mostrar um pouco do que é possível com este modelo de Text to Speech expressivo, aqui está uma fala renderizada cinco vezes. Cada uma recebe uma direção de palco diferente, mostrando exatamente o que você pode fazer com o modelo.
Todos os cinco cards a seguir usam “I didn’t think you’d actually come back.” como texto, modificado com uma Audio Tag emocionalmente rica. Como referência, estes exemplos também usam a voz Siren.
Adicionando [furious]
As consoantes ficam mais marcadas e as oclusivas, mais pronunciadas. A fala soa raivosa e transmite uma acusação.
[furious]
Adicionando [excited]
O tom se eleva e o ritmo acelera, transformando a mesma frase em uma recepção alegre.
[excited]
Adicionando [sarcastic]
O tom fica mais plano e as vogais das palavras se alongam. O sarcasmo é um ótimo uso das Audio Tags, pois o tom das palavras faladas contradiz diretamente as palavras escritas.
[sarcastic]
Adicionando [crying]
Esta emociona. A interpretação desacelera e se quebra no meio da frase. Você vai perceber como a respiração tem um papel importante aqui.
[crying]
Adicionando [worried]
Mais baixa e levemente hesitante, [worried] tira a certeza da fala.
Dicas para escrever roteiros que a IA pode interpretar
Criamos o app de Text to Speech da ElevenLabs para ser o mais intuitivo possível. Basta abrir a página e começar a digitar, ou adicionar Audio Tags descritivas para incluir sons ou emoções específicos na sua cena
Confira outras dicas para obter os melhores resultados com o Text to Speech emocional do Eleven v4:
- Ajuste suas direções: Se uma fala não funcionar, troque a tag em vez de reescrever o texto. Experimente [worried] em vez de [sad], ou [sarcastic] em vez de [annoyed], e gere novamente até que a interpretação corresponda ao que você imaginou.
- Gere cenas completas de uma vez: Embora frases isoladas possam levar a uma interpretação cheia de nuances (como demonstramos acima), o Eleven v4 funciona melhor com parágrafos ou trechos de texto. Dar ao modelo texto suficiente para estabelecer o contexto de uma cena ajudará a melhorar a performance ao longo do trecho. Com o Eleven v4, você pode escrever até 10.000 caracteres por geração no app de TTS.
- Use uma emoção por frase: Embora você possa inserir várias Audio Tags em uma frase, o ideal é usar uma para cada segmento da frase para evitar confusões. Adicionar emoções contrastantes como direções pode gerar um resultado menos preciso. Como alternativa, adicione uma tag antes da oração exata que você quer alterar e uma nova tag depois dela se quiser mudar a emoção no meio da frase.
Com estas dicas, você transformará seu texto em uma performance em pouco tempo.

Comece a usar o Eleven v4 para Text to Speech emocional
Tudo o que você viu neste artigo foi gerado no app de Text to Speech da ElevenLabs com um roteiro, uma voz e algumas Audio Tags no Eleven v4.
Para criar suas próprias cenas, basta selecionar uma voz, colar uma fala que você escreveu e dirigir sua primeira performance.
Saiba mais sobre o Eleven v4 ou cadastre-se para começar sua primeira geração.



