Práticas recomendadas
Práticas recomendadas
Saiba como controlar a entonação, a pronúncia e a emoção, além de otimizar texto para fala.
Este guia apresenta técnicas para aprimorar os resultados de conversão de texto em fala usando os modelos da ElevenLabs. Experimente esses métodos para descobrir o que funciona melhor para suas necessidades.
Controles
Estamos trabalhando ativamente no Modo Diretor para dar a você ainda mais controle sobre os resultados.
Essas técnicas oferecem uma maneira prática de alcançar resultados mais sutis até que recursos avançados, como o Modo Diretor, sejam lançados.
Pausas
Eleven v4 e Eleven v3 não oferecem suporte a tags de pausa do SSML. Use as técnicas descritas na seção Como criar prompts para o Eleven v4 para controlar as pausas.
Use <break time="x.xs" /> para pausas naturais de até 3 segundos.
Usar muitas tags de pausa em uma única geração pode causar instabilidade. A IA pode acelerar ou introduzir ruídos adicionais ou artefatos de áudio. Estamos trabalhando para resolver isso.
- Consistência: use tags
<break>de forma consistente para manter um fluxo de fala natural. O uso excessivo pode causar instabilidade. - Comportamento específico da voz: vozes diferentes podem lidar com pausas de maneiras diferentes, especialmente as treinadas com sons de preenchimento, como “uh” ou “ah”.
Alternativas a <break> incluem travessões (- ou —) para pausas curtas ou reticências (…) para tons hesitantes. No entanto, elas são menos consistentes.
Pronúncia
IPA com o Eleven v4
O Eleven v4 (eleven_v4) inclui suporte nativo aprimorado ao Alfabeto Fonético Internacional, ou IPA, dando a você um controle mais preciso sobre a pronúncia de nomes, termos técnicos e outras palavras que exigem tratamento especial. A pronúncia com IPA é mais consistente do que em modelos anteriores, mas os resultados ainda podem variar conforme a voz e a frase. Recomendamos testar pronúncias importantes com a voz escolhida antes de usá-las em produção.
Ao contrário de modelos mais antigos que exigem tags de fonemas no estilo XML, o Eleven v4 entende símbolos IPA quando eles são colocados entre barras no texto:
A transcrição IPA deve:
- Estar entre barras (
/) no início e no fim - Ser escrita usando símbolos IPA padrão
- Estar entre aspas duplas quando for passada como parâmetro de string
Exemplos de código
Você pode incluir várias transcrições IPA em uma única string de texto:
Boas práticas
- Use símbolos IPA padrão da tabela do Alfabeto Fonético Internacional
- Inclua marcadores de tonicidade: acento primário (ˈ) e secundário (ˌ) para palavras com várias sílabas
- Aplique de forma seletiva: envolva apenas palavras ou frases específicas que precisem de controle de pronúncia
- Teste com sua voz: vozes diferentes podem interpretar o IPA de maneiras ligeiramente distintas
Solução de problemas
A pronúncia ainda está incorreta
Verifique se sua transcrição IPA está correta usando um dicionário de IPA. Inclua marcadores de tonicidade (ˈ para acento primário e ˌ para acento secundário) em palavras com várias sílabas. Teste com vozes diferentes, pois algumas podem interpretar o IPA com mais precisão do que outras.
Resultados inconsistentes com o mesmo IPA
A pronúncia IPA é mais consistente do que em modelos anteriores, mas os resultados ainda podem variar conforme a voz e a frase. Recomendamos testar pronúncias importantes com a voz escolhida antes de usá-las em produção. Se precisar de um resultado consistente, gere mais de uma vez e selecione o melhor resultado.
Tags de fonemas para modelos v2
Especifique a pronúncia usando tags de fonemas SSML com modelos v2. Os alfabetos compatíveis incluem o Arpabet CMU e o Alfabeto Fonético Internacional (IPA).
As tags de fonemas são compatíveis apenas com o modelo eleven_flash_v2.
Recomendamos usar CMU Arpabet para obter resultados consistentes e previsíveis com modelos v2. Embora o IPA possa ser eficaz, o CMU Arpabet geralmente oferece um desempenho mais confiável.
As tags de fonemas funcionam apenas para palavras individuais. Se você tiver um nome com nome e sobrenome cuja pronúncia queira definir de uma determinada maneira, será necessário criar uma tag de fonema para cada palavra.
Garanta a marcação de tonicidade correta para palavras com várias sílabas e mantenha uma pronúncia precisa:
Tags de alias
Para modelos que não oferecem suporte a tags de fonemas, você pode tentar escrever as palavras de forma mais fonética. Também é possível usar vários recursos, como letras maiúsculas, hífens, apóstrofos ou até aspas simples em torno de uma ou mais letras.
Por exemplo, uma palavra como “trapezii” poderia ser escrita como “trapezIi” para dar mais ênfase ao “ii” da palavra.
Você pode substituir a palavra diretamente no texto ou, se quiser especificar a pronúncia usando outras palavras ou frases ao usar um dicionário de pronúncia, pode usar tags de alias. Isso pode ser útil se você estiver gerando conteúdo com o Multilingual v2, que não oferece suporte a tags de fonemas. Você pode usar dicionários de pronúncia com o ElevenCreative Studio, o Dubbing Studio e a Síntese de fala pela API.
Por exemplo, se o texto incluir um nome com uma pronúncia incomum que a IA possa ter dificuldade em interpretar, use uma tag de alias para especificar como ele deve ser pronunciado:
Se quiser garantir que uma sigla seja sempre pronunciada de determinada forma quando aparecer no texto, use uma tag de alias para especificar isso:
Dicionários de pronúncia
Algumas de nossas ferramentas, como o ElevenCreative Studio e o Dubbing Studio, permitem criar e enviar um dicionário de pronúncia. Com eles, você pode especificar a pronúncia de determinadas palavras, como nomes de personagens ou marcas, ou definir como siglas devem ser lidas.
Os dicionários de pronúncia oferecem essa funcionalidade permitindo o envio de um arquivo de léxico ou dicionário que especifica pares de palavras e como elas devem ser pronunciadas, usando um alfabeto fonético ou substituições de palavras.
Sempre que uma dessas palavras for encontrada em um projeto, o modelo de IA pronunciará a palavra usando a substituição especificada.
Para fornecer um arquivo de dicionário de pronúncia, abra as configurações de um projeto e envie um arquivo em formato TXT ou .PLS. Quando um dicionário é adicionado a um projeto, ele recalcula automaticamente quais partes do projeto precisarão ser reconvertidas usando o novo arquivo de dicionário e as marca como não convertidas.
No momento, oferecemos suporte apenas a dicionários de pronúncia que especificam substituições usando tags de fonemas ou alias.
Tanto fonemas quanto aliases são conjuntos de regras que especificam uma palavra ou frase que procuram, chamada de grafema, e pelo que ela será substituída. Observe que as buscas diferenciam maiúsculas de minúsculas. Ao verificar uma palavra de substituição em um dicionário de pronúncia, o dicionário é verificado do início ao fim, e apenas a primeira substituição é usada.
Exemplos de dicionários de pronúncia
Veja exemplos de dicionários de pronúncia em CMU Arpabet e IPA, incluindo um fonema para especificar a pronúncia de “Apple” e um alias para substituir “UN” por “United Nations”:
Para gerar um arquivo de dicionário de pronúncia .pls, há algumas ferramentas de código aberto disponíveis:
- Sequitur G2P - Ferramenta de código aberto que aprende regras de pronúncia a partir de dados e pode gerar transcrições fonéticas.
- Phonetisaurus - Sistema G2P de código aberto treinado com dicionários existentes, como o CMUdict.
- eSpeak - Sintetizador de fala que pode gerar transcrições de fonemas a partir de texto.
- CMU Pronouncing Dictionary - Dicionário de inglês pronto com transcrições fonéticas.
Emoção
Transmita emoções por meio do contexto narrativo ou de tags explícitas de diálogo. Essa abordagem ajuda a IA a entender o tom e a emoção que deve reproduzir.
Tags explícitas de diálogo geram resultados mais previsíveis do que depender apenas do contexto, mas o modelo ainda falará as orientações de entrega emocional. Elas podem ser removidas na pós-produção usando um editor de áudio, se não forem desejadas.
Ritmo
O ritmo do áudio é altamente influenciado pelo áudio usado para criar a voz. Ao criar sua voz, recomendamos usar amostras mais longas e contínuas para evitar problemas de ritmo, como uma fala artificialmente rápida.
Para controlar a velocidade do áudio gerado, você pode usar a configuração de velocidade. Ela permite acelerar ou desacelerar a fala gerada. A configuração de velocidade está disponível no Text to Speech pelo site e pela API, bem como no ElevenCreative Studio e na Plataforma de Agentes. Ela pode ser encontrada nas configurações de voz.
O valor padrão é 1.0, o que significa que a velocidade não é ajustada. Valores abaixo de 1.0 desaceleram a voz, até o mínimo de 0.7. Valores acima de 1.0 aceleram a voz, até o máximo de 1.2. Valores extremos podem afetar a qualidade da fala gerada.
O ritmo também pode ser controlado escrevendo em um estilo natural e narrativo.
Dicas
Problemas comuns
Pausas inconsistentes: certifique-se de que a sintaxe
<break time=“x.xs” />seja usada para pausas.- Erros de pronúncia: use tags de fonemas CMU Arpabet ou IPA para uma pronúncia precisa.
Emoção inadequada: adicione contexto narrativo ou tags explícitas para orientar a emoção. Lembre-se de remover qualquer texto de orientação emocional na pós-produção.
Dicas para melhorar o resultado
Experimente formas alternativas de escrever para alcançar o ritmo ou a emoção desejados. Para efeitos sonoros complexos, divida os prompts em elementos menores e sequenciais e combine os resultados manualmente.
Controle criativo
Embora estejamos desenvolvendo ativamente um “Modo Diretor” para dar aos usuários ainda mais controle sobre os resultados, estas são algumas técnicas provisórias para maximizar a criatividade e a precisão:
Estilo narrativo
Escreva prompts em estilo narrativo, semelhante à escrita de roteiros, para orientar o tom e o ritmo com eficiência.
Resultados em camadas
Gere efeitos sonoros ou fala em segmentos e sobreponha-os usando um software de edição de áudio para criar composições mais complexas.
Experimentação fonética
Se a pronúncia não estiver perfeita, experimente grafias alternativas ou aproximações fonéticas para alcançar os resultados desejados.
Normalização de texto
Ao usar Text to Speech com itens complexos, como números de telefone, CEPs e e-mails, eles podem ser pronunciados incorretamente. Isso costuma acontecer porque esses itens específicos não estão no conjunto de treinamento e modelos menores não conseguem generalizar como devem ser pronunciados. Este guia esclarece quando essas diferenças ocorrem e como fazer com que sejam pronunciados corretamente.
A normalização é ativada por padrão em todos os modelos de TTS para ajudar a melhorar a pronúncia de números, datas e outros elementos de texto complexos.
Por que os modelos leem as entradas de formas diferentes?
Alguns modelos são treinados para ler números e frases de uma maneira mais humana. Por exemplo, a expressão “$1,000,000” é lida corretamente como “um milhão de dólares” pelo modelo Eleven Multilingual v2. No entanto, a mesma expressão é lida como “mil mil dólares” pelo modelo Eleven Flash v2.5.
Isso acontece porque o modelo Multilingual v2 é maior e consegue generalizar melhor a leitura de números de uma forma mais natural para ouvintes humanos, enquanto o modelo Flash v2.5 é muito menor e, por isso, não consegue.
Exemplos comuns
Os modelos de Text to Speech podem ter dificuldade com os seguintes itens:
- Números de telefone (“123-456-7890”)
- Moedas (“$47,345.67”)
- Eventos de calendário (“2024-01-01”)
- Horários (“9:23 AM”)
- Endereços (“123 Main St, Anytown, USA”)
- URLs (“example.com/link/to/resource”)
- Abreviações de unidades (“TB” em vez de “Terabyte”)
- Atalhos (“Ctrl + Z”)
Como mitigar
Use modelos treinados
A maneira mais simples de mitigar isso é usar um modelo de TTS treinado para ler números e frases de uma forma mais humana, como o modelo Eleven Multilingual v2. No entanto, isso nem sempre é possível, por exemplo, se você tiver um caso de uso em que a baixa latência seja essencial (como agentes conversacionais).
Aplique normalização em prompts de LLM
Ao usar um LLM para gerar o texto para TTS, você pode adicionar instruções de normalização ao prompt.
Use prompts claros e explícitos
LLMs respondem melhor a instruções estruturadas e explícitas. Seu prompt deve especificar claramente que você quer que o texto seja convertido em um formato legível para fala.
Lide com diferentes formatos de números
Nem todos os números são lidos da mesma forma. Considere como diferentes tipos de números devem ser falados:
- Números cardinais: 123 → “cento e vinte e três”
- Números ordinais: 2nd → “segundo”
- Valores monetários: $45.67 → “quarenta e cinco dólares e sessenta e sete centavos”
- Números de telefone: “123-456-7890” → “um dois três, quatro cinco seis, sete oito nove zero”
- Decimais e frações: “3.5” → “três vírgula cinco”, “⅔” → “dois terços”
- Algarismos romanos: “XIV” → “quatorze” (ou “o décimo quarto” se for um título)
Remova ou expanda abreviações
Abreviações comuns devem ser expandidas para maior clareza:
- “Dr.” → “Doutor”
- “Ave.” → “Avenida”
- “St.” → “Rua” (mas “St. Patrick” deve permanecer)
Você pode solicitar uma expansão explícita no seu prompt:
Expanda todas as abreviações para suas formas completas faladas.
Normalização alfanumérica
Nem toda normalização envolve números; algumas expressões alfanuméricas também devem ser normalizadas para maior clareza:
- Atalhos: “Ctrl + Z” → “control z”
- Abreviações de unidades: “100km” → “cem quilômetros”
- Símbolos: “100%” → “cem por cento”
- URLs: “elevenlabs.io/docs” → “eleven labs ponto io barra docs”
- Eventos de calendário: “2024-01-01” → “primeiro de janeiro de dois mil e vinte e quatro”
Considere casos extremos
Contextos diferentes podem exigir conversões diferentes:
- Datas: “01/02/2023” → “dois de janeiro de dois mil e vinte e três” ou “primeiro de fevereiro de dois mil e vinte e três” (dependendo da localidade)
- Horário: “14:30” → “duas e trinta da tarde”
Se precisar de um formato específico, informe-o explicitamente no prompt.
Juntando tudo
Este prompt é um bom ponto de partida para a maioria dos casos de uso:
Use expressões regulares para pré-processamento
Se você usa código para criar um prompt para um LLM, pode usar expressões regulares para normalizar o texto antes de fornecê-lo ao modelo. Essa é uma técnica mais avançada e exige algum conhecimento de expressões regulares. Veja alguns exemplos simples:
Como criar prompts no Eleven v4
Esta seção foi escrita para o Eleven v4. Muitas das técnicas abaixo também se aplicam ao Eleven v3. Em geral, o Eleven v4 representa uma evolução em relação ao Eleven v3, oferecendo resultados melhores em quase todos os casos. Recomendamos fortemente migrar para o v4 e testá-lo com suas próprias vozes e conteúdos para ver a diferença. Embora alguns casos específicos possam exigir outra opção, a maioria dos usuários deve considerar o v4 a melhor escolha.
Para saber o que muda no modelo — clonagem de voz, tratamento de sotaques, variantes e comparações — consulte Eleven v4.
O Eleven v4 e o Eleven v3 não oferecem suporte a tags de pausa SSML. Use tags de áudio, pontuação (reticências) e estrutura do texto para controlar pausas e ritmo.
Seleção de voz
A voz ainda importa. Uma interpretação que já está nos dados de treinamento — sussurros, gritos ou uma forma específica de falar — é mais fácil de o modelo reproduzir. Pedir algo que está fora desses dados é mais difícil. O Eleven v4 segue tags de áudio com mais confiabilidade do que os modelos anteriores, inclusive quando a voz não foi treinada com aquela interpretação. Uma voz que nunca sussurrou ainda deve conseguir seguir [whispering], e uma voz que nunca gritou ainda deve conseguir seguir [shouting]. No entanto, isso pode ser menos confiável, e o resultado pode não ser ideal. Nos testes iniciais, parece funcionar muito bem. Recomendamos fortemente que você teste com a voz desejada e no seu caso de uso específico.
Tags de áudio
As tags de áudio (por exemplo, [whispering], [shouting], [laughing]) permitem direcionar a interpretação com controle preciso, e o Eleven v4 as processa com um nível de nuance superior ao dos modelos anteriores. Elas ainda não são perfeitas, e continuamos aprimorando a confiabilidade com que o modelo segue as instruções das tags — esta é uma área de investimento contínuo e seguirá melhorando.
Ser explícito sobre o que você quer ajuda bastante. Como o Eleven v4 é treinado para gerar estilos de interpretação vocal e efeitos sonoros, uma tag pode ocasionalmente ser interpretada como um pedido de efeito sonoro em vez de uma instrução de interpretação (ou vice-versa). Escrever tags que descrevam claramente a qualidade vocal desejada (por exemplo, [low, gravelly voice] em vez de algo que possa ser entendido como uma indicação sonora) ajuda o modelo a entregar o que você pretendia. Recomendamos testar suas tags e formulações específicas para o seu caso de uso, e esperamos que isso continue melhorando.
As tags funcionam mais facilmente quando a interpretação já está nos dados de treinamento da voz. O Eleven v4 ainda pode
seguir uma tag para a qual a voz não foi treinada, como [whispering] ou [shouting], embora
o resultado possa não ser ideal.
Relacionadas à voz
Estas tags controlam a interpretação vocal e a expressão emocional:
[laughs],[laughs harder],[starts laughing],[wheezing][whispers][sighs],[exhales][sarcastic],[curious],[excited],[crying],[snorts],[mischievously]
Efeitos sonoros
Adicione sons ambientes e efeitos:
[gunshot],[applause],[clapping],[explosion][swallows],[gulps]
Únicas e especiais
Tags experimentais para aplicações criativas:
[strong X accent](substitua X pelo sotaque desejado)[sings],[woo],[fart]
Algumas tags experimentais podem ser menos consistentes entre vozes diferentes. Teste-as completamente antes de usá-las em produção.
Pontuação
A pontuação afeta significativamente a interpretação no v4:
- Reticências (…) adicionam pausas e intensidade
- Uso de maiúsculas aumenta a ênfase
- Pontuação padrão proporciona um ritmo de fala natural
Exemplos com um único locutor
Use tags intencionalmente e combine-as com o perfil da voz. Uma voz meditativa não deveria gritar; uma voz muito animada não vai sussurrar de forma convincente.
Monólogo expressivo
Dinâmico e bem-humorado
Simulação de atendimento ao cliente
Diálogo com vários locutores
O v4 consegue lidar bem com prompts de múltiplas vozes. Atribua vozes distintas da sua Voice Library a cada locutor para criar conversas realistas.
Demonstração de diálogo
Comédia de falhas
Tempo sobreposto
Aprimoramento de entrada
Na interface da ElevenLabs, você pode gerar automaticamente tags de áudio relevantes para seu texto de entrada clicando no botão “Aprimorar”. Nos bastidores, isso usa um LLM para aprimorar seu texto de entrada com o seguinte prompt:
Dicas
Combinações de tags
Você pode combinar várias tags de áudio para criar interpretações emocionais complexas. Experimente diferentes combinações para descobrir o que funciona melhor para sua voz.
Combinação com a voz
Combine as tags com o perfil e os dados de treinamento da sua voz. Uma voz séria e profissional pode não
responder bem a tags descontraídas como [giggles] ou [mischievously].
Estrutura do texto
A estrutura do texto influencia fortemente o resultado com o v4. Use padrões naturais de fala, pontuação adequada e contexto emocional claro para obter os melhores resultados.
Experimentação
Provavelmente há muitas outras tags eficazes além desta lista. Experimente estados emocionais e ações descritivos para descobrir o que funciona no seu caso de uso específico.
Exemplos
Interpretação de voz
Narração longa
Como criar prompts no Eleven v3
As técnicas de prompt em Como criar prompts no Eleven v4 também se aplicam ao Eleven v3, incluindo seleção de voz, tags de áudio, pontuação e diálogo com vários locutores.
As Clonagens Profissionais de Voz (PVCs) não são totalmente otimizadas para o Eleven v3, o que pode resultar em uma qualidade de clonagem inferior em comparação com modelos anteriores. As PVCs são compatíveis com o v4, portanto, se você quiser usar uma Clonagem Profissional de Voz ou uma voz da Voice Library, recomendamos testar o Eleven v4.