Einführung von Music v2

Music v2 ist jetzt über die ElevenLabs API verfügbar. Setzen Sie bei Musik generieren, Musik streamen, Musik detailliert generieren und Musik hochladen model_id auf music_v2, um das neue Modell zu verwenden. Music v2 führt chunkbasierte Kompositionspläne ein, die aus Segmenten von GenerationChunk und AudioRefChunk bestehen. Sie erhalten damit mehr Kontrolle über Struktur, Tempo und Arrangement als mit dem promptbasierten Ablauf von music_v1.

Verwenden Sie music_v2-Kompositionspläne für Generierungs- und Upload-Anfragen oder generieren Sie zuerst einen Plan über den Endpunkt für Kompositionspläne. Anfrage- und Antworttexte akzeptieren entweder v1- oder v2-Planformate, sodass Sie Endpunkt für Endpunkt migrieren können. MusicPrompt bleibt nur für music_v1 verfügbar.

  • Upload-Zeitstempel: Musik hochladen akzeptiert optional with_timestamps; Antworten können words_timestamps enthalten.

ElevenAgents

  • Unterhaltungsevaluierung ausführen: Endpunkt Unterhaltungsevaluierung ausführen (POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run) hinzugefügt, um mit RunConversationEvaluationsRequest ein einzelnes Evaluierungskriterium für eine abgeschlossene Unterhaltung erneut auszuführen.
  • Verhalten beim Workflow-Einstieg: Workflow-Knoten zum Überschreiben von Agenten ergänzen optional entry_behavior (generate_immediately, wait_for_user, auto), um zu steuern, ob der Unteragent zuerst spricht oder auf Benutzereingaben wartet.
  • System-Tool zum Beenden von Prozeduren: System-Tool-Konfiguration end_procedure mit passenden Fehlerstatus hinzugefügt. Das Tool start_procedure ergänzt already_active zu seinen Fehlerstatus.
  • TTS-Overrides bei Transfers: AgentTransfer, eigenständige Agentenknoten in Workflows und erfolgreiche Tool-Ergebnisse von transfer_to_agent ergänzen optional preserve_client_tts_overrides (Boolean), um clientseitige TTS-Overrides nach einem Transfer beizubehalten.
  • Enum für Interaktionsbudget: InteractionBudget entfernt async und ergänzt 5_minutes, 10_minutes und 1_hour. Aktualisieren Sie alle Konfigurationen oder SDK-Enums, die noch auf async verweisen.
  • Auswahl benutzerdefinierter Leitplankenmodelle: Die Konfiguration benutzerdefinierter Leitplanken ergänzt optional model mit Gemini-, Claude- und GPT-Varianten. Die Leitplankenkonfiguration ergänzt außerdem optional history_message_count (Ganzzahl).
  • Filter für Telefonnummernlisten: Telefonnummern auflisten ergänzt die optionalen Abfrageparameter provider, agent_id und branch_id, um importierte Nummern zu filtern.
  • Filterung von WhatsApp-Konten: WhatsApp-Konten auflisten ergänzt den optionalen Abfrageparameter agent_id, um Konten nach zugewiesenem Agenten zu filtern.
  • Filter für Themen-Zeiträume: Unterhaltungsthemen des Agenten abrufen ergänzt die optionalen Abfrageparameter from_unix_secs und to_unix_secs, um Ergebnisse der Themenerkennung einzugrenzen.
  • SIP-Codec-Konfiguration: Anfrage- und Antwortmodelle für ausgehende SIP-Trunks ergänzen optional enabled_codecs (Enum MediaCodec).
  • Typen für Memory-Tools: Schemas für LoadableMemoryEntry und LoadMemoryEntryToolErrorStatus zur Fehlerbehandlung von Memory-Tools hinzugefügt.
  • Batch-Limits für Agententests: Anfrage-Schemas zum Anhängen, Ausführen und erneuten Senden von Agententests erhöhen die maximale Anzahl angehängter Tests von 1000 auf 5000.
  • Unterstützung für Phonem-Tags: TTS-Einstellungen für Agenten ergänzen optional enable_phoneme_tags (Boolean) für die optionale Verarbeitung von V3-SSML-Phonemen.
  • Array-Schema-Overrides zum Auslassen: JSON-Schema-Eigenschaften für Arrays ergänzen optional is_omitted (schließt andere Wertquellen gegenseitig aus). ConstantSchemaOverride kann konstante Array-Werte verwenden.
  • Fehlerkontext bei Transfers: Fehler-Payloads für Transfers zu Nummern können optional agent_message (String) enthalten.

Arbeitsbereiche

  • Aktualisierungen von API-Keys für Servicekonten: API-Key für Servicekonto aktualisieren erfordert keinen Anfrageinhalt mehr. Bearbeitungsfelder unterstützen Teilaktualisierungen über no_update und nullable name, einschließlich permissions und character_limit.
  • Zeitzonen-Bucketung für Nutzung: Anfragen zur Arbeitsbereichsnutzung nach Produkt im Zeitverlauf ergänzen optional time_zone (IANA-Zeitzonen-String) mit präzisierten Regeln für interval_seconds-Buckets.
  • Filter für Verlaufsquellen: Die Filter source für Verlaufsliste und -details ergänzen Flows.

ElevenCreative Studio

  • Projekt-Stimmreferenzen: Projektmodelle, Kapitel-TTS-Knoten, Stimmenlisten und Stimmstatistiken verwenden nun project_voice_ref_id als kanonisches Stimmenfeld. Die bisherigen Felder voice_id bleiben aus Kompatibilitätsgründen als veraltete, schreibgeschützte Spiegelungen in Antworten erhalten.

Speech to Text

  • Diarisierung mit Stimmbibliothek: Sprache in Text umwandeln ergänzt optional use_speaker_library (Boolean, Standard false) für die Diarisierung bei Batch-Transkriptionen.

Stimmen

  • Sortierung geteilter Stimmen: Der Abfrageparameter sort von Geteilte Stimmen auflisten erhält eine explizite Enum, den Standard created_date und eine aktualisierte Beschreibung.

SDK-Veröffentlichungen

JavaScript SDK

  • v2.53.0 - Aus dem neuesten OpenAPI-Schema neu generiert, mit Unterstützung für die erneute Ausführung von Unterhaltungsevaluierungen, Unions für Music-v2-Kompositionspläne, Workflow-entry_behavior, Listenfiltern für Telefonnummern und WhatsApp, Parametern für Themenzeiträume, Aktualisierungen des Alerting-Schemas, Studio-Feldern für project_voice_ref_id und erweiterten Batch-Limits für Agententests.

Python SDK

  • v2.53.0 - Aus dem neuesten OpenAPI-Schema neu generiert, mit Unterstützung für die erneute Ausführung von Unterhaltungsevaluierungen, Music-v2-Kompositionsplänen, Workflow-Einstiegsverhalten und Tools zum Beenden von Prozeduren, Filterparametern für Telefonie, Modellen für Alerting und Teilaktualisierungen von Servicekonten sowie Studio-Stimmreferenzfeldern.

Pakete

iOS SDK

  • v3.2.1 - Unterstützung für Datenresidenz in Singapur hinzugefügt und singlePeerConnection für WebRTC-Sitzungen aktiviert.

API

Neue Endpunkte

ElevenAgents

  • Unterhaltungsevaluierung ausführen - POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run
    • Anfrageinhalt verwendet RunConversationEvaluationsRequest, um ein einzelnes Evaluierungskriterium erneut auszuführen

Aktualisierte Endpunkte

ElevenAgents

Musik

Speech to Text

  • Sprache in Text umwandeln - POST /v1/speech-to-text
    • Optionalen Abfrageparameter use_speaker_library hinzugefügt (Boolean, Standard false)

Stimmen

  • Geteilte Stimmen auflisten - GET /v1/shared-voices
    • Der Abfrageparameter sort verwendet jetzt eine explizite Enum mit dem Standard created_date

Schema-Änderungen

ElevenAgents

  • Workflow-Knoten zum Überschreiben von Agenten
    • Optionale Enum entry_behavior hinzugefügt (generate_immediately, wait_for_user, auto)
  • System-Tools
    • Tool-Konfiguration und Fehlerstatus für end_procedure hinzugefügt
  • Transfer- und Interaktionsschemas
    • Optionales preserve_client_tts_overrides für Transfers und Ergebnisse von Transfer-Tools hinzugefügt
    • InteractionBudget entfernt async; ergänzt 5_minutes, 10_minutes, 1_hour
  • Leitplanken und TTS
    • Benutzerdefinierte Leitplanken ergänzen optional model und history_message_count
    • TTS-Einstellungen für Agenten ergänzen optional enable_phoneme_tags
  • Telefonie
    • SIP-Trunk-Modelle ergänzen optional enabled_codecs (Enum MediaCodec)
  • Memory- und Code-Tools
    • LoadableMemoryEntry und LoadMemoryEntryToolErrorStatus hinzugefügt
  • Agententests
    • Limits für angehängte Tests bei Anfragen zum Ausführen und erneuten Senden von 1000 auf 5000 erhöht
  • JSON-Schema-Eigenschaften für Tools
    • Array-Eigenschaften ergänzen optional is_omitted

Arbeitsbereiche

  • Servicekonten
    • API-Key-PATCH unterstützt Teilaktualisierungen mit no_update-Sentinels
  • Nutzung und Verlauf
    • Nutzung nach Produkt im Zeitverlauf ergänzt optional time_zone
    • Filter source für den Verlauf ergänzen Flows

Musik

  • Kompositionspläne
    • Chunkbasierte CompositionPlan, GenerationChunk und AudioRefChunk für music_v2 hinzugefügt
    • Anfrage- und Antworttexte akzeptieren anyOf-Planformate von v1 oder v2

ElevenCreative Studio

  • Projekt-Stimmenmodelle
    • project_voice_ref_id als kanonische Stimmreferenz hinzugefügt
    • Veraltete, schreibgeschützte Spiegelungen von voice_id bleiben in Antworten erhalten