Como usar dicionários de pronúncia

Este guia mostra como gerenciar dicionários de pronúncia programaticamente.

Guia prático · Pressupõe que você tenha concluído o guia de início rápido da ElevenAPI.

Visão geral

Os dicionários de pronúncia permitem personalizar como seu agente de IA pronuncia palavras ou frases específicas. Isso é especialmente útil para:

  • Corrigir a pronúncia de nomes, lugares ou termos técnicos
  • Garantir uma pronúncia consistente em todas as conversas
  • Personalizar variações regionais de pronúncia

A ElevenLabs oferece suporte aos alfabetos IPA e CMU.

As tags de fonemas de dicionários de pronúncia funcionam apenas com os modelos eleven_v4, eleven_flash_v2 e eleven_v3.

Outros modelos ignoram as tags de fonemas do dicionário e usam a pronúncia padrão. Para outros modelos, use as tags de alias para substituir grafias ou frases que gerem a pronúncia necessária.

Se quiser usar pronúncias IPA e CMU em idiomas que não sejam inglês, será necessário mudar para o modelo eleven_v4.

Início rápido

Este guia pressupõe que você já configurou sua chave de API e o SDK. Conclua primeiro o início rápido, caso ainda não tenha feito isso.

1

Crie um arquivo de dicionário de pronúncia

Neste exemplo, criaremos um arquivo de dicionário de pronúncia para a palavra tomato.

Esta regra usará o alfabeto “IPA” e atualizará a pronúncia de tomato e Tomato com uma pronúncia diferente. Os arquivos PLS diferenciam maiúsculas de minúsculas, por isso incluímos as duas versões, com e sem “T” maiúsculo.

Você pode usar ferramentas de IA, como Claude ou ChatGPT, para ajudar a gerar notações IPA ou CMU para palavras específicas.

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

Crie um dicionário de pronúncia a partir de um arquivo usando o SDK

Crie um novo arquivo chamado example.py ou example.mts, dependendo da linguagem que você escolher, e adicione o código a seguir:

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

Execute o código

python example.py

Você deverá ouvir duas versões do áudio sendo reproduzidas nos seus alto-falantes: uma com o dicionário de pronúncia e outra sem ele.

Próximas etapas