ElevenAgents

  • エージェントワークフローでのMCPツールのスコープ設定:エージェントワークフローノードで、サブエージェントが呼び出せるMCPツールを制限できるようになりました。ノードでツール継承を無効にすると、明示的に選択したMCPツールのみがそのサブエージェントに読み込まれ、チームはワークフローの各ステップごとにツールへのアクセスを細かく制御できます。

  • 会話でのファイルアップロード:エージェントを作成およびエージェントを更新エンドポイントで、ConversationConfigのfile_inputフィールドをサポートするようになりました。有効にすると、エンドユーザーはチャットで画像やPDFを添付できます(マルチモーダル入力に対応したLLMが必要です)。enabled(boolean)とmax_files_per_conversation(integer)で設定できます。

  • 会話分析を再実行:新しい会話分析を実行エンドポイント(POST /v1/convai/conversations/{conversation_id}/analysis/run)は、新しい通話を行わずに、エージェントの現在の評価基準とデータ収集設定を使用して完了済みの会話を再評価します。

  • テスト用ツールレスポンスのモック:エージェントシミュレーションテストとテストスイートの呼び出しで、テスト中のツール呼び出しの処理方法を制御するtool_mock_configフィールドをサポートするようになりました。MockingStrategy(all、selected、none)でモックするツールを選択し、MockNoMatchBehavior(call_real_tool、raise_error)で一致するモックがない場合のフォールバックを設定できます。

  • テキスト検索の並び順:会話をテキスト検索エンドポイントで、search_score(デフォルト)またはcreated_atの値を持つsort_byクエリパラメータを受け付けるようになりました。これにより、関連性または新しさで結果を並べ替えられます。

  • mTLS認証接続:エージェント認証接続で、既存のオプションに加えて相互TLS(mtls)をauth_typeとしてサポートするようになりました。mTLS認証接続の作成と取得には、新しいCreateMTLSAuthRequestおよびMTLSAuthResponseスキーマを使用できます。

  • 最大時間到達時のメッセージ:エージェント設定にmax_conversation_duration_messageフィールドを追加しました。空でない文字列に設定すると、最大会話時間に達した際にエージェントがこのメッセージをユーザーに送信します。

  • 会話開始時のブランチと環境:会話開始クライアントデータ(ConversationInitiationClientDataRequest)およびバッチ通話を送信リクエストボディに、任意のbranch_idフィールドとenvironmentフィールドを追加しました。これにより、特定のエージェントブランチと環境にルーティングできます。

音楽

  • ビデオから音楽を生成:新しいPOST /v1/music/video-to-musicエンドポイントは、1つ以上のビデオファイルからバックグラウンドミュージックを生成します。ビデオは順番に結合されます。任意のdescription(最大1,000文字)とtags(upbeatやcinematicなど、最大10個のスタイルタグ)を指定して、生成されるトラックに影響を与えられます。

スピーチtoテキスト

  • URLから文字起こし:音声をテキストに変換エンドポイントで、ホストされたURLからオーディオまたはビデオを文字起こしするためのsource_urlパラメータ(string、任意)を受け付けるようになりました。YouTube動画、TikTok動画、その他の動画ホスティングサービスに対応しています。ファイルを直接アップロードする代わりに使用できます。

ボイス

  • 共有ボイスリストの総数:共有ボイスを一覧表示レスポンスにtotal_countフィールドが含まれるようになり、ページネーションの実装や結果数の表示が容易になりました。

SDKリリース

JavaScript SDK

  • v2.41.0 - ElevenAgentsのリアルタイム会話でmultimodal_messageWebSocketイベントタイプのサポートを追加しました。最新のAPIスキーマ更新に対応するFern再生成を含みます。
  • v2.41.1 - 2026年4月1日のAPIスキーマに合わせたFern再生成。

Python SDK

  • v2.41.0 - テキストのみの会話モードでaudio_interfaceを任意にし、オーディオなしでセッションを開始した場合のランタイムエラーを解決しました。最新のAPIスキーマに対応するFern再生成を含みます。

パッケージ

このリリースには、クライアント側Agent SDKの新しいv1.0.0が含まれます。@elevenlabs/client、@elevenlabs/react、@elevenlabs/react-nativeには大きな破壊的変更があります。アップグレード前に、以下の移行ガイドを確認してください。

アップグレードを支援するため、エージェントが代わりにアップグレードできるSkillをリリースしました。次のコマンドでインストールしてください。

npx skills add elevenlabs/packages

v1リリースとその改善点については、デベロッパーブログで詳しくご覧いただけます。

  • @elevenlabs/client@1.0.0 — 破壊的変更:

    • InputクラスとOutputクラスはエクスポートされなくなりました。代わりに、@elevenlabs/clientのInputControllerおよびOutputControllerインターフェースを使用してください。
    • Conversationはクラスではなくなり、現在は名前空間オブジェクトおよびTextConversation | VoiceConversationの型エイリアスです。instanceof Conversationチェックとサブクラスをすべて削除してください。
    • デフォルトのconnectionTypeは会話モードから推論されるようになりました。音声会話ではデフォルトで"webrtc"、テキストのみの会話では"websocket"を使用します。音声で以前の動作を維持するには、connectionType: "websocket"を明示的に渡してください。
    • VoiceConversation.wakeLockは非公開になりました。ウェイクロック管理を無効にするには、セッションオプションでuseWakeLock: falseを渡してください。
    • changeInputDevice()およびchangeOutputDevice()は、Promise<Input>またはPromise<Output>ではなくPromise<void>を返すようになりました。
    • conversation.input.analyser.getByteFrequencyData(data)をconversation.getInputByteFrequencyData()に置き換えてください。
    • conversation.input.setMuted(v)をconversation.setMicMuted(v)に置き換えてください。
    • conversation.output.gain.gain.value = vをconversation.setVolume({ volume: v })に置き換えてください。
    • getInputVolume()、getOutputVolume()、getInputByteFrequencyData()、getOutputByteFrequencyData()は、アクティブな会話がない場合に例外をスローする代わりに、0または空のUint8Arrayを返すようになりました。
  • @elevenlabs/react@1.0.0 — 破壊的変更:

    • useConversationにはConversationProviderの祖先が必要になりました。コンポーネントツリーを<ConversationProvider>でラップし、オプションをプロバイダーまたはフックに移動してください。
    • DeviceFormatConfigおよびDeviceInputConfigのエクスポートは削除されました。代わりに、@elevenlabs/clientのFormatConfigおよびInputDeviceConfigを使用してください。
    • レンダリングパフォーマンスを向上させるため、モノリシックなuseConversationを新しい詳細なフックに置き換えました:useConversationControls()、useConversationStatus()、useConversationInput()、useConversationMode()、useConversationFeedback()、useRawConversation()。各フックは必要な状態のみを購読するため、不要な再レンダリングを防ぎます。
    • エージェントが呼び出せるクライアントツールを登録するための新しいuseConversationClientTool(name, handler)フックを追加しました。アンマウント時に自動でクリーンアップされます。
    • ConversationProviderのisMutedおよびonMutedChangepropsにより、制御可能なミュートサポートを追加しました。
  • @elevenlabs/react-native@1.0.0 — 破壊的変更:

    • 以前のElevenLabsProviderおよびuseConversationAPIは削除され、@elevenlabs/reactからの再エクスポートに置き換えられました。ElevenLabsProviderをConversationProviderに、useConversationを詳細なフック(useConversationControls、useConversationStatusなど)に置き換えてください。
    • React Nativeでは、パッケージのインポート時にWebRTCグローバルをポリフィルし、ネイティブのAudioSessionを設定して、プラットフォーム固有の音声セッション戦略を登録するようになりました。
  • @elevenlabs/types@0.8.0 - Callbacksインターフェースのすべてのキーを含むCALLBACK_KEYSランタイム配列をエクスポートします。React SDKがコールバック構成に内部的に使用します。

  • @elevenlabs/client@0.16.0 - guardrail_triggeredサーバー・クライアント間WebSocketイベントと、会話中にサーバーがガードレール違反を検出した際に発火するonGuardrailTriggeredコールバックを追加しました。また、判別可能なユニオンの絞り込みを可能にするTextConversationおよびVoiceConversationの型判別子と、textOnlyオプションに基づいて戻り値の型を絞り込むstartSessionオーバーロードも追加しました。

  • @elevenlabs/react-native@0.6.0 - @elevenlabs/client@0.16.0と一貫して、guardrail_triggeredWebSocketイベントとonGuardrailTriggeredコールバックを追加しました。

  • @elevenlabs/client@1.1.0 - エージェント会話でツールレスポンスをモックするクライアント側サポートを追加し、実際のツールを呼び出さずにツール呼び出しの結果をシミュレートするテストシナリオを実現しました。

  • @elevenlabs/types@0.9.0 - エージェント会話におけるツールレスポンスモックの型定義を追加しました。

  • @elevenlabs/react@1.0.1 - @elevenlabs/client@1.1.0に依存するよう更新しました。

  • @elevenlabs/react-native@1.0.1 - @elevenlabs/client@1.1.0および@elevenlabs/react@1.0.1に依存するよう更新しました。

API

新しいエンドポイント

  • 会話分析を実行 - POST /v1/convai/conversations/{conversation_id}/analysis/run - エージェントの現在の評価基準とデータ収集設定を使用して、完了済みの会話の分析を再実行します。

  • POST /v1/music/video-to-music - multipartフォームデータとして提供された1つ以上のビデオファイルからバックグラウンドミュージックを生成します。

更新されたエンドポイント

ElevenAgents

  • エージェントを作成、エージェントを更新

    • ConversationConfigにfile_inputフィールド(FileInputConfig、任意)を追加し、LLMがマルチモーダル入力をサポートする場合に、チャット会話でのファイルアップロード(画像、PDF)を有効化
    • エージェント設定にmax_conversation_duration_messageフィールド(string、任意)を追加。セッションの時間制限に達すると、エージェントがこのメッセージを送信します
  • テストを作成、テストを更新

    • tool_mock_configフィールド(object、任意)を追加。シミュレーション中のツールモック動作を制御するための、ツール名からToolResponseMockConfigエントリへのマップ
  • 会話をテキスト検索

    • sort_byクエリパラメータ(string、任意)を追加。search_score(デフォルト)またはcreated_atを受け付けます
  • バッチ通話を送信

    • 特定のエージェントブランチを対象にするbranch_idフィールド(string、任意)を追加
    • 対象環境を指定するenvironmentフィールド(string、任意)を追加
  • Twilio発信通話、SIPトランク発信通話

    • 会話開始クライアントデータで、任意のbranch_idフィールドとenvironmentフィールドを受け付けるようになりました

スピーチtoテキスト

  • 音声をテキストに変換

    • source_urlパラメータ(string、任意)を追加。ファイルアップロードの代わりに、オーディオまたはビデオファイル、YouTube動画、TikTok動画、その他のホストされたメディアのURLを受け付けます

ボイス

強制アラインメント