数字、日付、記号、頭字語が正しく発音されない、または正しい言語で読み上げられないのはなぜですか?

数字、日付、記号、頭字語は、正しく読み上げる方法が複数あることが多いため、AIにとって難しい場合があります。これは使用されている言語にも依存します。たとえば「11」は「Eleven」と読めますが、スペイン語では「Once」、ドイツ語では「Elf」と読むこともできます。  

数字、日付、頭字語、記号を正しく読み上げるための方法はいくつかあります。

単語で完全に書く

最良の結果を得るには、数字、頭字語、日付、記号を、AIに読み上げてほしい形式で完全に単語として書くことをおすすめします。これによりAIは十分な文脈を得られ、正しい出力を提供できます。たとえば「$100」の場合、期待どおりの結果を得るために、「a hundred dollars」または「one hundred dollars」と書くことをおすすめします。  

LLMの使用

たとえばElevenAgentsを使用する際など、大規模言語モデルでテキストプロンプトを生成している場合は、AIに読み上げてほしい形式で、数字、日付、記号、頭字語を常に単語として書くようモデルにプロンプトで指示できます。

正規化

API経由で生成する場合は、apply_text_normalizationパラメーターを使用してテキスト正規化を適用するかどうかを指定できます。テキスト正規化では、より正確に発音できるよう数字や日付を単語に展開します。このオプションでは、正規化処理に追加の処理時間が必要になるため、レイテンシーが増加します。

apply_text_normalizationパラメーターには3つのモードがあります。

  • on:常に適用されます
  • off:適用されません
  • auto:AIがテキスト正規化を適用するタイミングを自動的に判断します

language_codeパラメーターを使用して、プロンプトの言語を指定することもできます。これはISO 639-1言語コードを受け付けるオプションのパラメーターです。 

これは、テキストに数字や記号のみが含まれる場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定すると、正規化機能がその言語に適したルールを適用できます。

詳細は、APIリファレンスをご覧ください。

ウェブサイトのテキスト読み上げで生成する場合、正規化はデフォルトで有効になっています。  

Studioでは、デフォルトで正規化が自動適用されます。つまり、AIがテキスト正規化を適用するタイミングを判断します。正規化を常に適用する設定も可能です。このオプションは、詳細設定タブのプロジェクト設定にあります。