Solução de problemas

Explore problemas comuns e suas soluções.

Nossos modelos não são determinísticos, ou seja, os resultados podem variar conforme as entradas. Embora busquemos aumentar a previsibilidade, alguma variação é inerente. Este guia apresenta problemas comuns e medidas preventivas.

Geral

Se a voz gerada variar em volume ou tom, isso geralmente ocorre devido a inconsistências no áudio de treinamento do clone de voz.

  • Aplique compressão: Comprima o áudio de treinamento para reduzir a faixa dinâmica e garantir um áudio consistente. Procure manter o RMS entre -23 dB e -18 dB e o pico verdadeiro abaixo de -3 dB.
  • Ruído de fundo: Garanta que o áudio de treinamento contenha apenas a voz que você quer clonar — sem música, ruídos ou estalos. Ruídos de fundo, picos repentinos de energia ou energia constante em baixas frequências podem tornar a IA menos estável.
  • Consistência do locutor: Garanta que o locutor mantenha uma distância consistente do microfone e evite sussurrar ou gritar. Variações podem causar inconsistências no volume ou na tonalidade.
  • Duração do áudio:
    • Clonagem Instantânea de Voz: Use de 1 a 2 minutos de áudio consistente. A consistência na tonalidade, interpretação, sotaque e qualidade é essencial.
    • Clonagem Profissional de Voz: Use pelo menos 30 minutos, idealmente mais de 2 horas, de áudio consistente para obter os melhores resultados.

Para minimizar problemas, considere dividir o texto em segmentos menores. Essa abordagem ajuda a manter um volume consistente e reduz a degradação em gerações de áudio mais longas. Use o recurso Estúdio do ElevenCreative para gerar vários segmentos de áudio menores simultaneamente, garantindo mais qualidade e consistência.

Consulte nossos guias de otimização de Clones de Voz Instantâneos e Profissionais para conhecer as melhores práticas e recomendações.

Os modelos multilíngues podem, raramente, pronunciar incorretamente determinadas palavras, até mesmo em inglês. Esse problema parece ser um tanto arbitrário, mas depende da voz e do texto. Ele ocorre com mais frequência em determinadas vozes e textos, especialmente ao usar palavras que também existem em outros idiomas.

  • Use o Estúdio do ElevenCreative: Esse recurso ajuda a minimizar problemas de pronúncia incorreta, que são mais frequentes em trechos de texto mais longos ao usar a Síntese de Voz. Embora não elimine totalmente o problema, ele pode ajudar a evitá-lo e facilitar a regeneração de seções específicas sem refazer o texto inteiro.
  • Vozes clonadas corretamente: Assim como ao lidar com problemas de inconsistência, usar uma voz devidamente clonada nos idiomas desejados pode ajudar a reduzir pronúncias incorretas.
  • Especifique a pronúncia: Ao usar o recurso Estúdio do ElevenCreative, considere especificar a pronúncia de certas palavras, como nomes de personagens e marcas, ou como siglas devem ser lidas. Para mais informações, consulte a seção Dicionário de Pronúncia do nosso guia do Estúdio do ElevenCreative.

Às vezes, a IA pode alternar entre idiomas ou sotaques durante uma única geração, especialmente se ela for mais longa. Esse problema é semelhante ao de pronúncia incorreta e estamos trabalhando ativamente para melhorá-lo.

  • Use vozes clonadas corretamente: Usar um Clone de Voz Instantâneo ou um Clone de Voz Profissional treinado com áudio consistente e de alta qualidade no idioma desejado pode ajudar a mitigar esse problema. Combinar isso com o recurso Estúdio do ElevenCreative pode aumentar ainda mais a estabilidade.
  • Entenda as limitações das vozes: As vozes padrão e geradas são principalmente em inglês e podem ter sotaque inglês quando usadas em outros idiomas. Clonar uma voz que fale o idioma de destino com o sotaque desejado fornece mais contexto à IA, reduzindo a probabilidade de alternância de idioma.
  • Seleção de idioma: Atualmente, a IA determina o idioma com base no texto de entrada. Escrever no idioma desejado é essencial, especialmente ao usar vozes prontas baseadas em inglês, pois elas podem introduzir um sotaque inglês.
  • Tamanho ideal do texto: A IA tende a manter um sotaque consistente em segmentos de texto mais curtos. Para obter os melhores resultados, mantenha as gerações de texto com menos de 800 a 900 caracteres ao usar Text to Speech. O workflow do Estúdio do ElevenCreative pode ajudar a gerenciar textos mais longos dividindo-os em segmentos menores e mais fáceis de administrar.

Os modelos podem pronunciar incorretamente determinados números, símbolos e siglas. Por exemplo, os números “1, 2, 3” podem ser pronunciados como “one”, “two”, “three” em inglês. Para garantir a pronúncia correta em outro idioma, escreva-os foneticamente ou por extenso, da forma como você quer que sejam falados.

  • Exemplo: Para que o número “1” seja pronunciado em francês, escreva “un”.
  • Símbolos: Especifique como os símbolos devem ser lidos, por exemplo, ”$” como “dólar” ou “euro”.
  • Siglas: Escreva as siglas foneticamente.

A fala corrompida é um problema raro em que o modelo gera áudio abafado ou distorcido. Isso ocorre de forma imprevisível, e não identificamos uma causa. Se acontecer, gere a seção novamente para resolver o problema.

A qualidade do áudio pode piorar durante conversões extensas de texto em voz. Para mitigar isso, divida o texto em seções com menos de 800 caracteres.

  • Seleção de voz: Algumas vozes são mais suscetíveis à degradação. Use amostras de alta qualidade em vozes clonadas para minimizar artefatos.
  • Estabilidade e Similaridade: Ajuste essas configurações para influenciar o comportamento da voz e a intensidade dos artefatos. Passe o cursor sobre cada configuração para ver mais detalhes.

Em algumas vozes, essa configuração pode causar instabilidade, incluindo velocidade inconsistente, pronúncia incorreta e a adição de sons extras. Recomendamos manter essa configuração em 0, especialmente se você estiver enfrentando esses problemas no áudio gerado.

Estúdio do ElevenCreative (anteriormente Projetos)

A função de importação tenta importar o arquivo que você fornece para o site. Como as estruturas dos sites e a formatação de livros variam, inclusive com imagens, sempre verifique se a importação está correta.

  • Imagens no início dos capítulos: Se os capítulos de um livro começarem com uma imagem como primeira letra, a IA pode não reconhecer a letra. Adicione manualmente a letra a cada capítulo.
  • Estrutura de parágrafos: Se o texto for importado como um único parágrafo longo em vez de seguir a estrutura original do livro, talvez ele não funcione corretamente. Garanta que o texto mantenha as quebras de linha originais. Se o problema persistir, tente copiar e colar. Se isso não funcionar, talvez seja necessário converter ou reescrever o formato do texto.
  • Formato preferencial: EPUB é o formato de arquivo recomendado para criar um projeto no Estúdio do ElevenCreative. Um EPUB bem estruturado dividirá automaticamente cada capítulo no Estúdio do ElevenCreative, facilitando a navegação. Garanta que o título de cada capítulo esteja formatado como “Título 1” para o reconhecimento correto.
Sempre confira o conteúdo importado para garantir sua precisão e estrutura.

Ocasionalmente, podem ocorrer falhas ou respirações bruscas entre os parágrafos. Isso é raro e difere dos problemas padrão de Text to Speech. Se acontecer, gere novamente o parágrafo anterior, pois o problema geralmente se origina nele.

Se o problema persistir após seguir este guia de solução de problemas, envie um e-mail para o Suporte em support@elevenlabs.io.