表現力モード
表現力モード
会話のコンテキストに応じて、トーン、タイミング、感情表現を調整する音声エージェントを構築します。
概要
表現力モードを使うと、意図、感情、強調を反映した発話をエージェントが行えるようになり、ユーザーの声や発言に応じてリアルタイムで調整します。これは、会話スタックにおける2つのシステムレベルの改善に基づいています。
- Eleven v3 Conversational — ElevenAgentsで利用できる、感情理解とコンテキスト認識に最も優れたテキスト読み上げモデル。
- 新しいターンテイキングシステム — 割り込みを減らし、より正確なタイミングで応答。
エージェントのTTSモデルとしてEleven v3 Conversationalを選択すると、表現力モードはデフォルトで有効になります。
Eleven v3 Conversational
Eleven v3 Conversationalは、ライブでの双方向対話に最適化された、超低レイテンシー版のEleven v3です。ターンをまたいで会話のコンテキストを維持し、各やり取りのトーンや意図に合わせて話し方を調整します。
- コンテキストに応じた話し方:会話のコンテキストに基づいてトーンを調整します。たとえば、ユーザーが不安そうな場合はより落ち着いて応答し、明確さが重要な場合はより直接的に応答します。
- 明示的な感情制御:具体的なトリガーから幅広い状況まで、システムプロンプトのルールで話し方を導き、ブランドボイスやコンプライアンス要件に合わせます。
- 70以上の言語をサポート:Flashモデルの約32言語から拡張し、これまでニュアンス表現が弱かった日本語などの言語でも表現力を向上させています。
- 表現タグ:LLMは
[laughs]、[whispers]、[sighs]などのタグを出力し、特定の場面での話し方を制御できます。
Eleven v3 Conversationalの料金は、Agents内の他のElevenLabs TTSモデルと同じで、 1分あたり$0.08からです。
ターンテイキングシステム
新しいターンテイキングシステムは、感情的な手がかりや発話パターンを含むScribe v2 Realtimeからのリアルタイムシグナルを使用し、エージェントが発話、停止、待機すべきタイミングを判断します。これにより、特に感情が高ぶる状況で、より自然な応答が可能になります。
たとえば、「はい」は完全な相づちの場合もあれば、続けて話す前置きの場合もあります。システムは、文字起こしに加えて、どのように発話されたか(韻律などの発話の手がかり)を分析し、エージェントの応答タイミングをより自然に調整します。
ターンテイキングの動作は、応答の積極性設定でさらに調整できます。
設定
表現力モードを有効にする
システムプロンプトの例
システムプロンプト内の自然言語による指示で、エージェントの感情表現を導きます。モデルはこれをコンテキストに応じて解釈するため、すべての状況で明示的なタグは必要ありません。
幅広いガイダンス
具体的なトリガー
表現タグを使う
コンテキストに応じた話し方に加え、LLMは特定の場面を制御するための明示的なタグを出力できます。一般的なタグには次のものがあります。
[laughs]— 発話に笑いを加えます[whispers]— ささやき声のために音量を下げます[sighs]— ため息のような表現を加えます[slow]— 発話速度を遅くします[excited]— 話し方に興奮した表現を加えます
各タグは、通常の話し方に戻る前の約4~5語の発話に影響します。
ベストプラクティス
話し方をコンテキストに合わせる
エージェントが状況に合った感情表現をできるように導いてください。いらだっている顧客には、落ち着いた共感的な応答が必要です。良い知らせを伝えるユーザーには、本物の温かさが伝わる応答が必要です。トーンが合わないと信頼を損ないます。
一貫性のためにシステムプロンプトのルールを使う
モデルの判断だけに頼るのではなく、システムプロンプトで明確なトーンガイドラインを定義します。これにより、ブランドボイスやコンプライアンス要件に沿った一貫性のある話し方を実現できます。
言語ごとにテストする
表現力のある話し方は言語によって異なる場合があります。特に会話の慣習が異なる言語では、感情的なニュアンスが意図どおりに伝わるよう、対象となる各言語でエージェントをテストしてください。
応答の積極性設定と組み合わせる
表現力モードは、適切な応答の積極性設定と組み合わせてください。忍耐モードでは感情的に繊細な会話でユーザーにより多くの間を与え、積極モードはテンポの速いやり取りに適しています。
モニタリングと改善を行う
会話分析を使用して、ユーザーが表現力のある話し方にどのように反応するかを追跡します。会話の結果とユーザーフィードバックに基づいて、トーンガイドラインを改善してください。
制限事項
- Eleven v3 Conversationalは、プロフェッショナルボイスクローン(PVC)の特性を保持しません。出力が元のPVC音声のように聞こえない場合があります。
- 表現タグの効果は、通常の話し方に戻るまで約4~5語続きます。
- 表現力は音声や言語によって異なる場合があります。
よくある質問
表現力モードの料金は高くなりますか?
いいえ。Eleven v3 Conversationalの料金は、Agents内の他のElevenLabs TTSモデルと同じで、1分あたり$0.08からです。
表現力モードを有効にするにはどうすればよいですか?
エージェントのTTSモデルとしてV3 Conversationalを選択します。このモデルでは表現力モードがデフォルトで有効になります。
ターンテイキングシステムはどのように機能しますか?
このシステムは、感情的な手がかりや発話パターンを含むScribe v2 Realtimeからのリアルタイムシグナルを使用して、エージェントがいつ応答すべきかを予測します。文字起こしと、単語がどのように発話されたか(韻律)の両方を分析し、自然なタイミングで応答します。
プロフェッショナルボイスクローンで表現力モードを使えますか?
Eleven v3 Conversationalは現在、PVCの特性を十分に保持できません。PVC音声のアイデンティティを維持することが重要な場合は、代わりにFlash v2の使用を検討してください。
Eleven v3 Conversationalは何言語をサポートしていますか?
Eleven v3 Conversationalは70以上の言語をサポートしており、Flashモデルの約32言語から拡張されています。これには、これまでニュアンス表現が弱かった日本語などの言語での表現力向上も含まれます。
ElevenAgentsの他のTTSモデルと比べてどうですか?
Eleven v3 Conversationalは、FlashやMultilingual v2よりも広い感情表現の幅を持ち、会話のコンテキストに応じて話し方を調整できます。Flashの約32言語に対して70以上の言語をサポートします。料金は他のモデルと同じです。
