マルチボイス対応

AIエージェントが異なる音声を切り替えられるようにし、複数キャラクターの会話やストーリーテリングを強化します。

概要

マルチボイス対応により、ElevenLabsエージェントは1回の会話中に異なるElevenLabs音声を動的に切り替えられます。この強力な機能により、次のことが可能になります。

  • 複数キャラクターによるストーリーテリング:物語内のキャラクターごとに異なる音声を使用
  • 語学学習:言語ごとにネイティブスピーカーの音声を使用
  • 感情を表現するエージェント:感情的な文脈に応じて音声を変更
  • ロールプレイのシナリオ:ペルソナごとに異なる音声を使用
マルチボイス設定インターフェース

仕組み

マルチボイス対応を有効にすると、エージェントはテキスト生成中にXML形式のマークアップを使用して、設定済みの音声を切り替えられます。特定の音声が指定されていない場合、エージェントは自動的にデフォルト音声に戻ります。

The teacher said, <spanish>¡Hola estudiantes!</spanish>
Then the student replied, <student>Hello! How are you today?</student>

設定

対応音声の追加

対応音声には、次のプロパティがあります。

  • 音声ラベル:一意の識別子(例:「Joe」、「Spanish」、「Happy」)
  • 音声:利用可能なElevenLabs音声から選択
  • モデルファミリー:Turbo、Flash、またはMultilingualを選択(任意)
  • 言語:この音声のデフォルト言語を上書き(任意)
  • 説明:エージェントがこの音声を使用するタイミング

ダッシュボードでエージェントを開き、Voiceタブに移動して、Multi-voice supportセクションを見つけます。Add voiceをクリックして、新しい対応音声を設定します。

マルチボイス設定インターフェース

音声プロパティ

LLMがこの音声を参照するために使用する一意の識別子です。次のような説明的なラベルを選択してください。- キャラクター名:「Alice」、「Bob」、「Narrator」- 言語:「Spanish」、「French」、「German」- 感情:「Happy」、「Sad」、「Excited」- 役割:「Teacher」、「Student」、「Guide」

この特定の音声に対して、エージェントのデフォルトモデルファミリーを上書きします。- Flash:最も高速な生成で、 リアルタイム用途に最適化 - Turbo:速度と品質のバランス - Multilingual:最高品質で、英語以外の言語に最適

  • エージェントと同じ:エージェントのデフォルト設定を使用

この音声に別の言語を指定します。次の用途に便利です。- 多言語会話 - 語学学習アプリケーション - 地域固有の発音

エージェントがこの音声を使用するタイミングのコンテキストを指定します。 例:

  • 「スペイン語の単語またはフレーズすべてに使用」
  • 「メッセージの内容が楽しい、または興奮している場合」
  • 「キャラクターのJoeが話すときはいつでも」

実装

XMLマークアップ構文

エージェントは、XML形式のタグを使用して音声を切り替えます。

<VOICE_LABEL>text to be spoken</VOICE_LABEL>

重要なポイント:

  • VOICE_LABELは設定したラベルと完全に一致するものに置き換えます
  • タグの外側のテキストにはデフォルト音声が使用されます
  • タグは大文字と小文字を区別します
  • ネストされたタグはサポートされていません

システムプロンプトへの統合

対応音声を設定すると、システムはエージェントのプロンプトに自動的に指示を追加します。

When a message should be spoken by a particular person, use markup: "<CHARACTER>message</CHARACTER>" where CHARACTER is the character label.
Available voices are as follows:
- default: any text outside of the CHARACTER tags
- Joe: Whenever Joe is speaking
- Spanish: For any Spanish words or phrases
- Narrator: For narrative descriptions

使用例

Teacher: Let's practice greetings. In Spanish, we say <Spanish>¡Hola! ¿Cómo estás?</Spanish>
Student: How do I respond?
Teacher: You can say <Spanish>¡Hola! Estoy bien, gracias.</Spanish> which means Hello! I'm fine, thank you.

ベストプラクティス

  • キャラクターやコンテキストを明確に区別できる音声を選択します
  • 音声の組み合わせが適切に機能するかテストします
  • 各音声の感情的なトーンと個性を考慮します
  • 言語を切り替える場合は、音声が言語とアクセントに合っていることを確認します
  • LLMが理解できる、説明的で直感的なラベルを使用します
  • ラベルは短く覚えやすいものにします
  • ラベルには特殊文字やスペースを使用しないでください
  • 対応音声の数は実際に必要な数に制限します
  • 切り替えのオーバーヘッドを減らすため、可能な場合は同じモデルファミリーを使用します
  • 想定される会話パターンでテストします
  • 複数回の音声切り替え時の応答時間を監視します
  • 各音声を使用するタイミングについて明確な説明を提供します
  • 音声切り替えが不明確になる可能性があるエッジケースをテストします
  • 音声ラベルが曖昧な場合のフォールバック動作を検討します
  • 音声切り替えが会話の妨げではなく、会話を強化することを確認します

制限事項

  • エージェントあたり最大10個の対応音声(デフォルトを含む)
  • 音声切り替えにより、生成時にわずかなレイテンシが追加されます
  • XMLタグは適切な形式で閉じる必要があります
  • マークアップ内の音声ラベルでは大文字と小文字が区別されます
  • ネストされた音声タグはサポートされていません

よくある質問

エージェントが設定されていない音声ラベルを使用した場合、テキストはデフォルト音声で読み上げられます。 XMLタグは無視されます。

はい、1つの応答内で音声を切り替えられます。タグ付けされた各セクションでは指定した 音声が使用され、タグのないテキストにはデフォルト音声が使用されます。

音声切り替えによるオーバーヘッドはわずかです。会話中に各音声を初めて使用する際は、 音声が初期化されるため、レイテンシが少し高くなる場合があります。

はい、同じElevenLabs音声を使用しつつ、異なるモデル ファミリー、言語、またはコンテキストを持つ複数のラベルを設定できます。

システムプロンプトで明確な例を提示し、十分にテストしてください。音声切り替えを行うべき具体的な シナリオや、XMLマークアップ形式の例を含めることができます。