ElevenAgents

  • MCP-Tool-Scoping in Agent-Workflows: Agent-Workflow-Knoten können jetzt einschränken, welche MCP-Tools ein Sub-Agent aufrufen darf. Wenn die Tool-Vererbung für einen Knoten deaktiviert ist, werden für diesen Sub-Agenten nur die ausdrücklich ausgewählten MCP-Tools geladen. So erhalten Teams präzise Kontrolle über den Tool-Zugriff für jeden Workflow-Schritt.

  • Datei-Uploads in Gesprächen: Die Endpunkte Agent erstellen und Agent aktualisieren unterstützen jetzt ein file_input-Feld in ConversationConfig. Wenn es aktiviert ist, können Endnutzer Bilder oder PDFs im Chat anhängen (erfordert ein LLM mit Unterstützung für multimodale Eingaben). Konfigurierbar mit enabled (boolesch) und max_files_per_conversation (Ganzzahl).

  • Gesprächsanalyse erneut ausführen: Der neue Endpunkt Gesprächsanalyse ausführen (POST /v1/convai/conversations/{conversation_id}/analysis/run) bewertet ein abgeschlossenes Gespräch anhand der aktuellen Bewertungskriterien und Einstellungen zur Datenerfassung des Agenten erneut, ohne dass ein neuer Anruf erforderlich ist.

  • Mocking von Tool-Antworten für Tests: Agent-Simulationstests und Test-Suite-Aufrufe unterstützen jetzt ein tool_mock_config-Feld, um zu steuern, wie Tool-Aufrufe während des Tests verarbeitet werden. Verwenden Sie MockingStrategy (all, selected, none), um auszuwählen, welche Tools gemockt werden, und MockNoMatchBehavior (call_real_tool, raise_error), um das Fallback festzulegen, wenn kein Mock übereinstimmt.

  • Sortierreihenfolge der Textsuche: Der Endpunkt Textsuche in Gesprächen akzeptiert jetzt den Abfrageparameter sort_by mit den Werten search_score (Standard) oder created_at. So können Sie festlegen, ob Ergebnisse nach Relevanz oder Aktualität sortiert werden.

  • mTLS-Authentifizierungsverbindungen: Agent-Authentifizierungsverbindungen unterstützen jetzt zusätzlich zu den bestehenden Optionen Mutual TLS (mtls) als auth_type. Die neuen Schemas CreateMTLSAuthRequest und MTLSAuthResponse stehen zum Erstellen und Abrufen mTLS-authentifizierter Verbindungen zur Verfügung.

  • Nachricht bei maximaler Dauer: Das Feld max_conversation_duration_message wurde zur Agent-Konfiguration hinzugefügt. Wenn es auf einen nicht leeren String gesetzt ist, sendet der Agent diese Nachricht an den Nutzer, sobald die maximale Gesprächsdauer erreicht ist.

  • Branch und Umgebung bei der Gesprächsinitiierung: Die optionalen Felder branch_id und environment wurden zu den Clientdaten für die Gesprächsinitiierung (ConversationInitiationClientDataRequest) und zum Request-Body für Batch-Anruf übermitteln hinzugefügt. Damit ist Routing zu bestimmten Agent-Branches und Umgebungen möglich.

Musik

  • Video zu Musik: Der neue Endpunkt POST /v1/music/video-to-music erzeugt Hintergrundmusik aus einer oder mehreren Videodateien. Videos werden nacheinander kombiniert. Akzeptiert optional description (bis zu 1.000 Zeichen) und tags (bis zu 10 Stil-Tags wie upbeat oder cinematic), um den erzeugten Track zu beeinflussen.

Speech to Text

  • Transkribieren per URL: Der Endpunkt Sprache in Text umwandeln akzeptiert jetzt den optionalen String-Parameter source_url, um Audio- oder Videodateien von einer gehosteten URL zu transkribieren, einschließlich YouTube-Videos, TikTok-Videos und anderer Video-Hosting-Dienste. Dies kann als Alternative zum direkten Hochladen einer Datei verwendet werden.

Stimmen

  • Gesamtzahl in der Liste geteilter Stimmen: Die Antwort von Geteilte Stimmen auflisten enthält jetzt ein Feld total_count. Das erleichtert die Implementierung der Paginierung und die Anzeige der Ergebnisanzahl.

SDK-Releases

JavaScript SDK

  • v2.41.0 - Unterstützung für den WebSocket-Ereignistyp multimodal_message in Echtzeit-Gesprächen mit ElevenAgents hinzugefügt. Enthält eine Fern-Regenerierung für die neuesten API-Schema-Updates.
  • v2.41.1 - Fern-Regenerierung zur Anpassung an das API-Schema vom 1. April 2026.

Python SDK

  • v2.41.0 - audio_interface im reinen Textgesprächsmodus als optional korrigiert. Dadurch wird ein Laufzeitfehler beim Starten einer Sitzung ohne Audio behoben. Enthält eine Fern-Regenerierung für das neueste API-Schema.

Pakete

Dieses Release enthält die neuen v1.0.0 der clientseitigen Agent-SDKs. Es umfasst umfangreiche Breaking Changes für @elevenlabs/client, @elevenlabs/react und @elevenlabs/react-native. Lesen Sie vor dem Upgrade die folgenden Migrationshinweise.

Um das Upgrade zu erleichtern, haben wir einen Skill veröffentlicht, mit dem Ihre Agenten das Upgrade für Sie durchführen können. Installieren Sie ihn mit

npx skills add elevenlabs/packages

Weitere Informationen zum v1-Release und seinen Verbesserungen finden Sie in unserem Developer-Blog.

  • @elevenlabs/client@1.0.0 — Breaking Changes:

    • Die Klassen Input und Output werden nicht mehr exportiert. Verwenden Sie stattdessen die Interfaces InputController und OutputController aus @elevenlabs/client.
    • Conversation ist keine Klasse mehr — es ist jetzt ein Namespace-Objekt und ein Typalias für TextConversation | VoiceConversation. Entfernen Sie alle instanceof Conversation-Prüfungen und Unterklassen.
    • Der Standardwert für connectionType wird jetzt aus dem Gesprächsmodus abgeleitet: Sprachgespräche verwenden standardmäßig "webrtc", reine Textgespräche "websocket". Um das bisherige Verhalten für Sprache beizubehalten, übergeben Sie explizit connectionType: "websocket".
    • VoiceConversation.wakeLock ist jetzt privat. Übergeben Sie in den Sitzungsoptionen useWakeLock: false, um die Wake-Lock-Verwaltung zu unterdrücken.
    • changeInputDevice() und changeOutputDevice() geben jetzt Promise<void> statt Promise<Input> oder Promise<Output> zurück.
    • Ersetzen Sie conversation.input.analyser.getByteFrequencyData(data) durch conversation.getInputByteFrequencyData().
    • Ersetzen Sie conversation.input.setMuted(v) durch conversation.setMicMuted(v).
    • Ersetzen Sie conversation.output.gain.gain.value = v durch conversation.setVolume({ volume: v }).
    • getInputVolume(), getOutputVolume(), getInputByteFrequencyData() und getOutputByteFrequencyData() geben jetzt 0 oder ein leeres Uint8Array zurück, statt einen Fehler auszulösen, wenn kein Gespräch aktiv ist.
  • @elevenlabs/react@1.0.0 — Breaking Changes:

    • useConversation erfordert jetzt einen übergeordneten ConversationProvider. Umschließen Sie Ihren Komponentenbaum mit <ConversationProvider> und verschieben Sie Optionen zum Provider oder zum Hook.
    • Die Exporte DeviceFormatConfig und DeviceInputConfig wurden entfernt. Verwenden Sie stattdessen FormatConfig und InputDeviceConfig aus @elevenlabs/client.
    • Neue granulare Hooks ersetzen das monolithische useConversation für bessere Render-Performance: useConversationControls(), useConversationStatus(), useConversationInput(), useConversationMode(), useConversationFeedback() und useRawConversation(). Jeder Hook abonniert nur den benötigten Status und verhindert so unnötige Re-Renders.
    • Neuer Hook useConversationClientTool(name, handler) zum Registrieren von Client-Tools, die Agenten aufrufen können, mit automatischer Bereinigung beim Unmount.
    • Unterstützung für gesteuertes Stummschalten über die Props isMuted und onMutedChange von ConversationProvider hinzugefügt.
  • @elevenlabs/react-native@1.0.0 — Breaking Changes:

    • Die bisherige API ElevenLabsProvider und useConversation wurde entfernt und durch Re-Exports aus @elevenlabs/react ersetzt. Ersetzen Sie ElevenLabsProvider durch ConversationProvider und useConversation durch die granularen Hooks (useConversationControls, useConversationStatus usw.).
    • Unter React Native ergänzt das Paket jetzt WebRTC-Globals per Polyfill, konfiguriert die native AudioSession und registriert beim Import eine plattformspezifische Sprachsitzungsstrategie.
  • @elevenlabs/types@0.8.0 - Exportiert das Laufzeit-Array CALLBACK_KEYS, das alle Schlüssel des Interfaces Callbacks enthält und vom React SDK intern für die Callback-Komposition verwendet wird.

  • @elevenlabs/client@0.16.0 - Das Server-zu-Client-WebSocket-Ereignis guardrail_triggered und der Callback onGuardrailTriggered wurden hinzugefügt. Dieser wird ausgelöst, wenn der Server während eines Gesprächs eine Guardrail-Verletzung erkennt. Außerdem wurden Typdiskriminatoren zu TextConversation und VoiceConversation hinzugefügt, um die Einschränkung diskriminierter Unions zu ermöglichen, sowie startSession-Overloads, die den Rückgabetyp basierend auf der Option textOnly einschränken.

  • @elevenlabs/react-native@0.6.0 - Das WebSocket-Ereignis guardrail_triggered und der Callback onGuardrailTriggered wurden hinzugefügt, konsistent mit @elevenlabs/client@0.16.0.

  • @elevenlabs/client@1.1.0 - Clientseitige Unterstützung für das Mocking von Tool-Antworten in Agent-Gesprächen hinzugefügt. Dadurch sind Testszenarien möglich, die Ergebnisse von Tool-Aufrufen simulieren, ohne echte Tools aufzurufen.

  • @elevenlabs/types@0.9.0 - Typdefinitionen für das Mocking von Tool-Antworten in Agent-Gesprächen hinzugefügt.

  • @elevenlabs/react@1.0.1 - Abhängigkeit von @elevenlabs/client@1.1.0 aktualisiert.

  • @elevenlabs/react-native@1.0.1 - Abhängigkeiten von @elevenlabs/client@1.1.0 und @elevenlabs/react@1.0.1 aktualisiert.

API

Neue Endpunkte

  • Gesprächsanalyse ausführen - POST /v1/convai/conversations/{conversation_id}/analysis/run - Führt die Analyse eines abgeschlossenen Gesprächs anhand der aktuellen Bewertungskriterien und Einstellungen zur Datenerfassung des Agenten erneut aus.

  • POST /v1/music/video-to-music - Erzeugt Hintergrundmusik aus einer oder mehreren Videodateien, die als Multipart-Formulardaten bereitgestellt werden.

Aktualisierte Endpunkte

ElevenAgents

  • Agent erstellen, Agent abrufen

    • Feld file_input (FileInputConfig, optional) zu ConversationConfig hinzugefügt. Es ermöglicht Datei-Uploads (Bilder, PDFs) in Chat-Gesprächen, wenn das LLM multimodale Eingaben unterstützt.
    • Feld max_conversation_duration_message (String, optional) zur Agent-Konfiguration hinzugefügt — der Agent sendet diese Nachricht, wenn das Zeitlimit der Sitzung erreicht ist.
  • Test erstellen, Test aktualisieren

    • Feld tool_mock_config (Objekt, optional) hinzugefügt — eine Zuordnung von Tool-Namen zu ToolResponseMockConfig-Einträgen zur Steuerung des Tool-Mocking-Verhaltens während der Simulation.
  • Textsuche in Gesprächen

    • Abfrageparameter sort_by (String, optional) hinzugefügt — akzeptiert search_score (Standard) oder created_at.
  • Batch-Anruf übermitteln

    • Feld branch_id (String, optional) hinzugefügt, um einen bestimmten Agent-Branch anzusprechen.
    • Feld environment (String, optional) hinzugefügt, um die Zielumgebung anzugeben.
  • Ausgehender Twilio-Anruf, Ausgehender SIP-Trunk-Anruf

    • Clientdaten für die Gesprächsinitiierung akzeptieren jetzt die optionalen Felder branch_id und environment.

Speech to Text

  • Sprache in Text umwandeln

    • Parameter source_url (String, optional) hinzugefügt — akzeptiert eine URL zu einer Audio- oder Videodatei, einem YouTube-Video, TikTok-Video oder anderen gehosteten Medien als Alternative zum Datei-Upload.

Stimmen

Forced Alignment