Por que números, datas, símbolos e siglas não são pronunciados corretamente ou no idioma certo?

Números, datas, símbolos e siglas podem ser um desafio para a IA, pois muitas vezes há várias formas de pronunciá-los corretamente. Isso também pode depender do idioma usado; por exemplo, “11” pode ser lido como “Eleven”, mas também pode ser “Once” em espanhol ou “Elf” em alemão.

Há várias formas de garantir a pronúncia correta de números, datas, siglas e símbolos.

Escreva por extenso, em palavras

Para obter os melhores resultados, recomendamos escrever números, siglas, datas e símbolos por extenso, em palavras, da forma como você gostaria que a IA os pronunciasse. Isso garante que a IA tenha o máximo de contexto para fornecer a saída correta. Por exemplo, para “$100”, recomendamos escrever “cem dólares” ou “cento de dólares” para garantir o resultado desejado.

Usando um LLM

Se você usa um modelo de linguagem grande para gerar seus prompts de texto, por exemplo, ao usar ElevenAgents, pode instruir o modelo a sempre escrever números, datas, símbolos e siglas por extenso, da forma que preferir que a IA os pronuncie.

Normalização

Se você estiver gerando pela API, poderá especificar se deseja aplicar a normalização de texto usando o parâmetro apply_text_normalization. A normalização de texto escreve números e datas por extenso para garantir uma pronúncia melhor. Essa opção adiciona latência, pois o processo de normalização exige tempo adicional de processamento.

O parâmetro apply_text_normalization tem três modos:

  • on, o que significa que ele é sempre aplicado
  • off, o que significa que ele nunca é aplicado
  • auto, o que significa que a IA decidirá automaticamente quando aplicar a normalização de texto

Você também pode especificar o idioma do seu prompt usando o parâmetro language_code. Esse é um parâmetro opcional que aceita códigos de idioma ISO 639-1. 

Isso pode ser útil para prompts curtos ou ambíguos, como quando o texto inclui apenas números ou símbolos. Especificar o idioma garante que o normalizador aplique as regras corretas para esse idioma.

Para mais informações, consulte nossa referência da API.

A normalização é ativada por padrão ao gerar usando Text to Speech pelo site.  

No Estúdio, o padrão é que a normalização seja aplicada automaticamente, o que significa que a IA decidirá quando aplicar a normalização de texto. Você também pode configurar a normalização para ser sempre aplicada — essa opção fica em Configurações do projeto, na aba Avançado.