ElevenAgents
-
エージェントワークフローでのMCPツールのスコープ設定:エージェントワークフローノードで、サブエージェントが呼び出せるMCPツールを制限できるようになりました。ノードでツール継承を無効にすると、明示的に選択したMCPツールのみがそのサブエージェントに読み込まれ、チームはワークフローの各ステップごとにツールへのアクセスを細かく制御できます。
-
会話でのファイルアップロード:エージェントを作成およびエージェントを更新エンドポイントで、
ConversationConfigのfile_inputフィールドをサポートするようになりました。有効にすると、エンドユーザーはチャットで画像やPDFを添付できます(マルチモーダル入力に対応したLLMが必要です)。enabled(boolean)とmax_files_per_conversation(integer)で設定できます。 -
会話分析を再実行:新しい会話分析を実行エンドポイント(
POST /v1/convai/conversations/{conversation_id}/analysis/run)は、新しい通話を行わずに、エージェントの現在の評価基準とデータ収集設定を使用して完了済みの会話を再評価します。 -
テスト用ツールレスポンスのモック:エージェントシミュレーションテストとテストスイートの呼び出しで、テスト中のツール呼び出しの処理方法を制御する
tool_mock_configフィールドをサポートするようになりました。MockingStrategy(all、selected、none)でモックするツールを選択し、MockNoMatchBehavior(call_real_tool、raise_error)で一致するモックがない場合のフォールバックを設定できます。 -
テキスト検索の並び順:会話をテキスト検索エンドポイントで、
search_score(デフォルト)またはcreated_atの値を持つsort_byクエリパラメータを受け付けるようになりました。これにより、関連性または新しさで結果を並べ替えられます。 -
mTLS認証接続:エージェント認証接続で、既存のオプションに加えて相互TLS(
mtls)をauth_typeとしてサポートするようになりました。mTLS認証接続の作成と取得には、新しいCreateMTLSAuthRequestおよびMTLSAuthResponseスキーマを使用できます。 -
最大時間到達時のメッセージ:エージェント設定に
max_conversation_duration_messageフィールドを追加しました。空でない文字列に設定すると、最大会話時間に達した際にエージェントがこのメッセージをユーザーに送信します。 -
会話開始時のブランチと環境:会話開始クライアントデータ(
ConversationInitiationClientDataRequest)およびバッチ通話を送信リクエストボディに、任意のbranch_idフィールドとenvironmentフィールドを追加しました。これにより、特定のエージェントブランチと環境にルーティングできます。
音楽
- ビデオから音楽を生成:新しい
POST /v1/music/video-to-musicエンドポイントは、1つ以上のビデオファイルからバックグラウンドミュージックを生成します。ビデオは順番に結合されます。任意のdescription(最大1,000文字)とtags(upbeatやcinematicなど、最大10個のスタイルタグ)を指定して、生成されるトラックに影響を与えられます。
スピーチtoテキスト
- URLから文字起こし:音声をテキストに変換エンドポイントで、ホストされたURLからオーディオまたはビデオを文字起こしするための
source_urlパラメータ(string、任意)を受け付けるようになりました。YouTube動画、TikTok動画、その他の動画ホスティングサービスに対応しています。ファイルを直接アップロードする代わりに使用できます。
ボイス
- 共有ボイスリストの総数:共有ボイスを一覧表示レスポンスに
total_countフィールドが含まれるようになり、ページネーションの実装や結果数の表示が容易になりました。
SDKリリース
JavaScript SDK
- v2.41.0 - ElevenAgentsのリアルタイム会話で
multimodal_messageWebSocketイベントタイプのサポートを追加しました。最新のAPIスキーマ更新に対応するFern再生成を含みます。 - v2.41.1 - 2026年4月1日のAPIスキーマに合わせたFern再生成。
Python SDK
- v2.41.0 - テキストのみの会話モードで
audio_interfaceを任意にし、オーディオなしでセッションを開始した場合のランタイムエラーを解決しました。最新のAPIスキーマに対応するFern再生成を含みます。
パッケージ
このリリースには、クライアント側Agent SDKの新しいv1.0.0が含まれます。@elevenlabs/client、@elevenlabs/react、@elevenlabs/react-nativeには大きな破壊的変更があります。アップグレード前に、以下の移行ガイドを確認してください。
アップグレードを支援するため、エージェントが代わりにアップグレードできるSkillをリリースしました。次のコマンドでインストールしてください。
v1リリースとその改善点については、デベロッパーブログで詳しくご覧いただけます。
-
@elevenlabs/client@1.0.0 — 破壊的変更:
InputクラスとOutputクラスはエクスポートされなくなりました。代わりに、@elevenlabs/clientのInputControllerおよびOutputControllerインターフェースを使用してください。Conversationはクラスではなくなり、現在は名前空間オブジェクトおよびTextConversation | VoiceConversationの型エイリアスです。instanceof Conversationチェックとサブクラスをすべて削除してください。- デフォルトの
connectionTypeは会話モードから推論されるようになりました。音声会話ではデフォルトで"webrtc"、テキストのみの会話では"websocket"を使用します。音声で以前の動作を維持するには、connectionType: "websocket"を明示的に渡してください。 VoiceConversation.wakeLockは非公開になりました。ウェイクロック管理を無効にするには、セッションオプションでuseWakeLock: falseを渡してください。changeInputDevice()およびchangeOutputDevice()は、Promise<Input>またはPromise<Output>ではなくPromise<void>を返すようになりました。conversation.input.analyser.getByteFrequencyData(data)をconversation.getInputByteFrequencyData()に置き換えてください。conversation.input.setMuted(v)をconversation.setMicMuted(v)に置き換えてください。conversation.output.gain.gain.value = vをconversation.setVolume({ volume: v })に置き換えてください。getInputVolume()、getOutputVolume()、getInputByteFrequencyData()、getOutputByteFrequencyData()は、アクティブな会話がない場合に例外をスローする代わりに、0または空のUint8Arrayを返すようになりました。
-
@elevenlabs/react@1.0.0 — 破壊的変更:
useConversationにはConversationProviderの祖先が必要になりました。コンポーネントツリーを<ConversationProvider>でラップし、オプションをプロバイダーまたはフックに移動してください。DeviceFormatConfigおよびDeviceInputConfigのエクスポートは削除されました。代わりに、@elevenlabs/clientのFormatConfigおよびInputDeviceConfigを使用してください。- レンダリングパフォーマンスを向上させるため、モノリシックな
useConversationを新しい詳細なフックに置き換えました:useConversationControls()、useConversationStatus()、useConversationInput()、useConversationMode()、useConversationFeedback()、useRawConversation()。各フックは必要な状態のみを購読するため、不要な再レンダリングを防ぎます。 - エージェントが呼び出せるクライアントツールを登録するための新しい
useConversationClientTool(name, handler)フックを追加しました。アンマウント時に自動でクリーンアップされます。 ConversationProviderのisMutedおよびonMutedChangepropsにより、制御可能なミュートサポートを追加しました。
-
@elevenlabs/react-native@1.0.0 — 破壊的変更:
- 以前の
ElevenLabsProviderおよびuseConversationAPIは削除され、@elevenlabs/reactからの再エクスポートに置き換えられました。ElevenLabsProviderをConversationProviderに、useConversationを詳細なフック(useConversationControls、useConversationStatusなど)に置き換えてください。 - React Nativeでは、パッケージのインポート時にWebRTCグローバルをポリフィルし、ネイティブの
AudioSessionを設定して、プラットフォーム固有の音声セッション戦略を登録するようになりました。
- 以前の
-
@elevenlabs/types@0.8.0 -
Callbacksインターフェースのすべてのキーを含むCALLBACK_KEYSランタイム配列をエクスポートします。React SDKがコールバック構成に内部的に使用します。 -
@elevenlabs/client@0.16.0 -
guardrail_triggeredサーバー・クライアント間WebSocketイベントと、会話中にサーバーがガードレール違反を検出した際に発火するonGuardrailTriggeredコールバックを追加しました。また、判別可能なユニオンの絞り込みを可能にするTextConversationおよびVoiceConversationの型判別子と、textOnlyオプションに基づいて戻り値の型を絞り込むstartSessionオーバーロードも追加しました。 -
@elevenlabs/react-native@0.6.0 -
@elevenlabs/client@0.16.0と一貫して、guardrail_triggeredWebSocketイベントとonGuardrailTriggeredコールバックを追加しました。 -
@elevenlabs/client@1.1.0 - エージェント会話でツールレスポンスをモックするクライアント側サポートを追加し、実際のツールを呼び出さずにツール呼び出しの結果をシミュレートするテストシナリオを実現しました。
-
@elevenlabs/types@0.9.0 - エージェント会話におけるツールレスポンスモックの型定義を追加しました。
-
@elevenlabs/react@1.0.1 -
@elevenlabs/client@1.1.0に依存するよう更新しました。 -
@elevenlabs/react-native@1.0.1 -
@elevenlabs/client@1.1.0および@elevenlabs/react@1.0.1に依存するよう更新しました。
API
APIの変更を表示
新しいエンドポイント
-
会話分析を実行 -
POST /v1/convai/conversations/{conversation_id}/analysis/run- エージェントの現在の評価基準とデータ収集設定を使用して、完了済みの会話の分析を再実行します。 -
POST /v1/music/video-to-music- multipartフォームデータとして提供された1つ以上のビデオファイルからバックグラウンドミュージックを生成します。
更新されたエンドポイント
ElevenAgents
-
ConversationConfigにfile_inputフィールド(FileInputConfig、任意)を追加し、LLMがマルチモーダル入力をサポートする場合に、チャット会話でのファイルアップロード(画像、PDF)を有効化- エージェント設定に
max_conversation_duration_messageフィールド(string、任意)を追加。セッションの時間制限に達すると、エージェントがこのメッセージを送信します
-
tool_mock_configフィールド(object、任意)を追加。シミュレーション中のツールモック動作を制御するための、ツール名からToolResponseMockConfigエントリへのマップ
-
sort_byクエリパラメータ(string、任意)を追加。search_score(デフォルト)またはcreated_atを受け付けます
-
- 特定のエージェントブランチを対象にする
branch_idフィールド(string、任意)を追加 - 対象環境を指定する
environmentフィールド(string、任意)を追加
- 特定のエージェントブランチを対象にする
-
- 会話開始クライアントデータで、任意の
branch_idフィールドとenvironmentフィールドを受け付けるようになりました
- 会話開始クライアントデータで、任意の
スピーチtoテキスト
-
source_urlパラメータ(string、任意)を追加。ファイルアップロードの代わりに、オーディオまたはビデオファイル、YouTube動画、TikTok動画、その他のホストされたメディアのURLを受け付けます
ボイス
-
- レスポンスモデルに
total_countフィールド(integer)を追加
- レスポンスモデルに
強制アラインメント
-
- multipartフォームデータのリクエストボディから
enabled_spooled_fileパラメータを削除
- multipartフォームデータのリクエストボディから