会話をシミュレーション
会話をシミュレーション
シミュレーション会話でElevenLabsエージェントをテスト・評価する方法
このガイドと、ここで使用するエンドポイントは非推奨です。代わりに、 シミュレーションのエージェントテストタイプを 使用してください。
概要
ElevenLabs Agents APIでは、AIエージェントとのテキストベースの会話をシミュレーションして評価できます。このガイドでは、会話シミュレーションエンドポイント(バッチおよびストリーミング)を使用して、エンドツーエンドのシミュレーションテストワークフローを実装する方法を紹介します。エージェントのパフォーマンスを詳細にテスト・改善し、インタラクションの目標を満たしていることを確認できます。
前提条件
- ElevenLabs Agentsで設定済みのエージェント(こちらで作成)
- ElevenLabs APIキー(ダッシュボードで作成できます)
シミュレーションテストワークフローの実装
初期評価パラメータを特定する
エージェントの会話履歴を確認し、期待どおりに機能しなかったケースを見つけます。それらの会話をもとに、エージェントとやり取りするシミュレーションユーザー向けのさまざまなプロンプトを作成します。さらに、特定のシミュレーションユーザーで確認したい結果に応じて、エージェント設定にまだ指定されていない追加の評価基準を定義します。
SDKで会話をシミュレーションする
ElevenLabs SDKを使用して、シミュレーションエンドポイントへのリクエストを作成します。
これは基本的な例です。入力パラメータの一覧については、 会話をシミュレーションおよび 会話シミュレーションをストリーミングエンドポイントのAPI リファレンスを参照してください。
レスポンスを分析する
SDKは、会話の完全なトランスクリプトと詳細な分析を含む包括的なJSONオブジェクトを提供します。
シミュレーション会話:シミュレーションユーザーとエージェントの各ターンを、メッセージとツール使用状況の詳細とともに記録します。
分析:評価基準の結果、データ収集メトリクス、会話トランスクリプトの要約に関するインサイトを提供します。
評価基準を改善する
シミュレーション会話を十分に確認し、評価基準の有効性を評価します。評価基準がエージェントの パフォーマンスを十分に評価できていないギャップや領域を特定します。望ましい結果に沿い、 エージェントの能力を正確に測定できるよう、評価基準を適宜見直して調整してください。
プロのヒント
詳細なプロンプトと基準
詳細で具体的なシミュレーションユーザープロンプトと評価基準を作成すると、シミュレーションテストの効果を高められます。より多くのコンテキストと具体性を提供するほど、エージェントは複雑なやり取りをより適切に理解し、応答できます。
モックツール設定
モックツール設定を活用して、エージェントの意思決定プロセスをテストします。これにより、エージェントがツール呼び出しを行うかどうかをどのように判断し、異なるツール呼び出し結果にどう反応するかを確認できます。詳細は、APIリファレンスのtool_mock_config入力パラメータを参照してください。
部分的な会話履歴
部分的な会話履歴を使用して、特定の時点からエージェントがどのようにやり取りを処理するかを評価します。これは、ユーザーがすでに特定の方法で質問を設定している会話や、特定のツール呼び出しが成功または失敗している会話を、エージェントが管理する能力を評価する場合に特に役立ちます。詳細は、APIリファレンスのpartial_conversation_history入力パラメータを参照してください。