Vai alla navigazione

ElevenAgents

  • Ambito degli strumenti MCP nei workflow degli agenti: I nodi dei workflow degli agenti ora possono limitare gli strumenti MCP che un sub-agente è autorizzato a chiamare. Quando l’ereditarietà degli strumenti è disabilitata su un nodo, per quel sub-agente vengono caricati solo gli strumenti MCP selezionati esplicitamente, offrendo ai team un controllo preciso dell’accesso agli strumenti per ogni passaggio del workflow.

  • Caricamento di file nelle conversazioni: Gli endpoint create agent e update agent ora supportano un campo file_input in ConversationConfig. Quando è abilitato, gli utenti finali possono allegare immagini o PDF nella chat (richiede un LLM con supporto per input multimodale). Configurabile con enabled (booleano) e max_files_per_conversation (intero).

  • Riesecuzione dell’analisi della conversazione: Il nuovo endpoint run conversation analysis (POST /v1/convai/conversations/{conversation_id}/analysis/run) rivaluta una conversazione completata usando i criteri di valutazione e le impostazioni di raccolta dati correnti dell’agente, senza richiedere una nuova chiamata.

  • Simulazione delle risposte degli strumenti per i test: I test di simulazione degli agenti e le esecuzioni delle suite di test ora supportano un campo tool_mock_config per controllare come vengono gestite le chiamate agli strumenti durante i test. Usa MockingStrategy (all, selected, none) per scegliere quali strumenti simulare e MockNoMatchBehavior (call_real_tool, raise_error) per impostare il comportamento di fallback quando nessuna simulazione corrisponde.

  • Ordinamento della ricerca testuale: L’endpoint text search conversations ora accetta un parametro query sort_by con valori search_score (predefinito) o created_at, consentendoti di controllare se i risultati sono ordinati per rilevanza o data più recente.

  • Connessioni di autenticazione mTLS: Le connessioni di autenticazione degli agenti ora supportano TLS reciproco (mtls) come auth_type, oltre alle opzioni esistenti. I nuovi schemi CreateMTLSAuthRequest e MTLSAuthResponse sono disponibili per creare e recuperare connessioni autenticate tramite mTLS.

  • Messaggio di durata massima: Aggiunto il campo max_conversation_duration_message alla configurazione dell’agente. Se impostato su una stringa non vuota, l’agente invierà questo messaggio all’utente quando viene raggiunta la durata massima della conversazione.

  • Branch e ambiente nell’avvio della conversazione: Aggiunti i campi facoltativi branch_id e environment ai dati client di avvio della conversazione (ConversationInitiationClientDataRequest) e al body della richiesta submit batch call, consentendo l’instradamento a branch e ambienti specifici dell’agente.

Musica

  • Da video a musica: Il nuovo endpoint POST /v1/music/video-to-music genera musica di sottofondo da uno o più file video. I video vengono combinati in sequenza. Accetta description facoltativo (fino a 1.000 caratteri) e tags facoltativi (fino a 10 tag di stile come upbeat o cinematic) per influenzare la traccia generata.

Speech to Text

  • Trascrizione da URL: L’endpoint convert speech to text ora accetta un parametro source_url (stringa, facoltativo) per trascrivere audio o video da un URL ospitato, inclusi video YouTube, video TikTok e altri servizi di hosting video. Può essere usato come alternativa al caricamento diretto di un file.

Voci

  • Conteggio totale nell’elenco delle voci condivise: La risposta di list shared voices ora include un campo total_count, semplificando l’implementazione della paginazione e la visualizzazione del numero di risultati.

Rilasci SDK

SDK JavaScript

  • v2.41.0 - Aggiunto il supporto per il tipo di evento WebSocket multimodal_message nelle conversazioni in tempo reale di ElevenAgents. Include la rigenerazione di Fern per gli ultimi aggiornamenti dello schema API.
  • v2.41.1 - Rigenerazione di Fern per corrispondere allo schema API del 1° aprile 2026.

SDK Python

  • v2.41.0 - Corretto audio_interface, che ora è facoltativo nella modalità di conversazione solo testo, risolvendo un errore di runtime all’avvio di una sessione senza audio. Include la rigenerazione di Fern per l’ultimo schema API.

Pacchetti

Questa release include la nuova versione v1.0.0 degli SDK Agent lato client. Include importanti modifiche incompatibili per @elevenlabs/client, @elevenlabs/react e @elevenlabs/react-native. Consulta la guida alla migrazione qui sotto prima dell’aggiornamento.

Per aiutarti ad aggiornare, abbiamo rilasciato una Skill che consente ai tuoi agenti di eseguire l’aggiornamento per te. Installala con

npx skills add elevenlabs/packages

Puoi leggere di più sulla release v1 e sui suoi miglioramenti nel nostro blog per sviluppatori.

  • @elevenlabs/client@1.0.0 — Modifiche incompatibili:

    • Le classi Input e Output non vengono più esportate. Usa invece le interfacce InputController e OutputController da @elevenlabs/client.
    • Conversation non è più una classe: ora è un oggetto namespace e un alias di tipo per TextConversation | VoiceConversation. Rimuovi eventuali controlli instanceof Conversation e sottoclassi.
    • Il valore predefinito di connectionType viene ora dedotto dalla modalità della conversazione: le conversazioni vocali usano "webrtc" per impostazione predefinita e quelle solo testo usano "websocket". Per mantenere il comportamento precedente per le conversazioni vocali, passa esplicitamente connectionType: "websocket".
    • VoiceConversation.wakeLock ora è privato. Passa useWakeLock: false nelle opzioni di sessione per disattivare la gestione del wake lock.
    • changeInputDevice() e changeOutputDevice() ora restituiscono Promise<void> anziché Promise<Input> o Promise<Output>.
    • Sostituisci conversation.input.analyser.getByteFrequencyData(data) con conversation.getInputByteFrequencyData().
    • Sostituisci conversation.input.setMuted(v) con conversation.setMicMuted(v).
    • Sostituisci conversation.output.gain.gain.value = v con conversation.setVolume({ volume: v }).
    • getInputVolume(), getOutputVolume(), getInputByteFrequencyData() e getOutputByteFrequencyData() ora restituiscono 0 o un Uint8Array vuoto anziché generare un errore quando non è attiva alcuna conversazione.
  • @elevenlabs/react@1.0.0 — Modifiche incompatibili:

    • useConversation ora richiede un antenato ConversationProvider. Avvolgi il tuo albero di componenti in <ConversationProvider> e sposta le opzioni nel provider o nell’hook.
    • Le esportazioni DeviceFormatConfig e DeviceInputConfig sono state rimosse. Usa invece FormatConfig e InputDeviceConfig da @elevenlabs/client.
    • Nuovi hook granulari sostituiscono il monolitico useConversation per migliorare le prestazioni di rendering: useConversationControls(), useConversationStatus(), useConversationInput(), useConversationMode(), useConversationFeedback() e useRawConversation(). Ogni hook si iscrive solo allo stato di cui ha bisogno, evitando re-render non necessari.
    • Nuovo hook useConversationClientTool(name, handler) per registrare strumenti client che gli agenti possono invocare, con pulizia automatica durante l’unmount.
    • Aggiunto il supporto per il mute controllato tramite le props isMuted e onMutedChange su ConversationProvider.
  • @elevenlabs/react-native@1.0.0 — Modifiche incompatibili:

    • Le precedenti API ElevenLabsProvider e useConversation sono state rimosse e sostituite con riesportazioni da @elevenlabs/react. Sostituisci ElevenLabsProvider con ConversationProvider e useConversation con gli hook granulari (useConversationControls, useConversationStatus, ecc.).
    • In React Native, il pacchetto ora fornisce polyfill per le globali WebRTC, configura l’AudioSession nativa e registra una strategia di sessione vocale specifica per la piattaforma al momento dell’importazione.
  • @elevenlabs/types@0.8.0 - Esporta l’array runtime CALLBACK_KEYS, contenente tutte le chiavi dell’interfaccia Callbacks, usato internamente dall’SDK React per la composizione dei callback.

  • @elevenlabs/client@0.16.0 - Aggiunti l’evento WebSocket server-client guardrail_triggered e il callback onGuardrailTriggered, che viene attivato quando il server rileva una violazione dei guardrail durante una conversazione. Aggiunti anche discriminanti di tipo a TextConversation e VoiceConversation per consentire il narrowing delle unioni discriminate, oltre a overload di startSession che restringono il tipo di ritorno in base all’opzione textOnly.

  • @elevenlabs/react-native@0.6.0 - Aggiunti l’evento WebSocket guardrail_triggered e il callback onGuardrailTriggered, in linea con @elevenlabs/client@0.16.0.

  • @elevenlabs/client@1.1.0 - Aggiunto il supporto lato client per simulare le risposte degli strumenti nelle conversazioni degli agenti, consentendo scenari di test che simulano gli esiti delle chiamate agli strumenti senza invocare strumenti reali.

  • @elevenlabs/types@0.9.0 - Aggiunte definizioni di tipo per la simulazione delle risposte degli strumenti nelle conversazioni degli agenti.

  • @elevenlabs/react@1.0.1 - Aggiornato per dipendere da @elevenlabs/client@1.1.0.

  • @elevenlabs/react-native@1.0.1 - Aggiornato per dipendere da @elevenlabs/client@1.1.0 e @elevenlabs/react@1.0.1.

API

Nuovi endpoint

  • Run conversation analysis - POST /v1/convai/conversations/{conversation_id}/analysis/run - Riesegue l’analisi di una conversazione completata usando i criteri di valutazione e le impostazioni di raccolta dati correnti dell’agente.

  • POST /v1/music/video-to-music - Genera musica di sottofondo da uno o più file video forniti come dati di form multipart.

Endpoint aggiornati

ElevenAgents

  • Create agent, Update agent

    • Aggiunto il campo file_input (FileInputConfig, facoltativo) a ConversationConfig, abilitando il supporto al caricamento di file (immagini, PDF) nelle conversazioni in chat quando l’LLM supporta input multimodale
    • Aggiunto il campo max_conversation_duration_message (stringa, facoltativo) alla configurazione dell’agente: l’agente invia questo messaggio quando viene raggiunto il limite di tempo della sessione
  • Create test, Update test

    • Aggiunto il campo tool_mock_config (oggetto, facoltativo): una mappa di nomi di strumenti in voci ToolResponseMockConfig per controllare il comportamento di simulazione degli strumenti durante la simulazione
  • Text search conversations

    • Aggiunto il parametro query sort_by (stringa, facoltativo): accetta search_score (predefinito) o created_at
  • Submit batch call

    • Aggiunto il campo branch_id (stringa, facoltativo) per indirizzare un branch specifico dell’agente
    • Aggiunto il campo environment (stringa, facoltativo) per specificare l’ambiente di destinazione
  • Twilio outbound call, SIP trunk outbound call

    • I dati client di avvio della conversazione ora accettano i campi facoltativi branch_id e environment

Speech to Text

  • Convert speech to text

    • Aggiunto il parametro source_url (stringa, facoltativo): accetta un URL di un file audio o video, di un video YouTube, di un video TikTok o di altri contenuti multimediali ospitati come alternativa al caricamento di un file

Voci

Allineamento forzato

  • Create forced alignment

    • Rimosso il parametro enabled_spooled_file dal body della richiesta con dati di form multipart