ElevenAgents
-
Ambito degli strumenti MCP nei workflow degli agenti: I nodi dei workflow degli agenti ora possono limitare gli strumenti MCP che un sub-agente è autorizzato a chiamare. Quando l’ereditarietà degli strumenti è disabilitata su un nodo, per quel sub-agente vengono caricati solo gli strumenti MCP selezionati esplicitamente, offrendo ai team un controllo preciso dell’accesso agli strumenti per ogni passaggio del workflow.
-
Caricamento di file nelle conversazioni: Gli endpoint create agent e update agent ora supportano un campo
file_inputinConversationConfig. Quando è abilitato, gli utenti finali possono allegare immagini o PDF nella chat (richiede un LLM con supporto per input multimodale). Configurabile conenabled(booleano) emax_files_per_conversation(intero). -
Riesecuzione dell’analisi della conversazione: Il nuovo endpoint run conversation analysis (
POST /v1/convai/conversations/{conversation_id}/analysis/run) rivaluta una conversazione completata usando i criteri di valutazione e le impostazioni di raccolta dati correnti dell’agente, senza richiedere una nuova chiamata. -
Simulazione delle risposte degli strumenti per i test: I test di simulazione degli agenti e le esecuzioni delle suite di test ora supportano un campo
tool_mock_configper controllare come vengono gestite le chiamate agli strumenti durante i test. UsaMockingStrategy(all,selected,none) per scegliere quali strumenti simulare eMockNoMatchBehavior(call_real_tool,raise_error) per impostare il comportamento di fallback quando nessuna simulazione corrisponde. -
Ordinamento della ricerca testuale: L’endpoint text search conversations ora accetta un parametro query
sort_bycon valorisearch_score(predefinito) ocreated_at, consentendoti di controllare se i risultati sono ordinati per rilevanza o data più recente. -
Connessioni di autenticazione mTLS: Le connessioni di autenticazione degli agenti ora supportano TLS reciproco (
mtls) comeauth_type, oltre alle opzioni esistenti. I nuovi schemiCreateMTLSAuthRequesteMTLSAuthResponsesono disponibili per creare e recuperare connessioni autenticate tramite mTLS. -
Messaggio di durata massima: Aggiunto il campo
max_conversation_duration_messagealla configurazione dell’agente. Se impostato su una stringa non vuota, l’agente invierà questo messaggio all’utente quando viene raggiunta la durata massima della conversazione. -
Branch e ambiente nell’avvio della conversazione: Aggiunti i campi facoltativi
branch_ideenvironmentai dati client di avvio della conversazione (ConversationInitiationClientDataRequest) e al body della richiesta submit batch call, consentendo l’instradamento a branch e ambienti specifici dell’agente.
Musica
- Da video a musica: Il nuovo endpoint
POST /v1/music/video-to-musicgenera musica di sottofondo da uno o più file video. I video vengono combinati in sequenza. Accettadescriptionfacoltativo (fino a 1.000 caratteri) etagsfacoltativi (fino a 10 tag di stile comeupbeatocinematic) per influenzare la traccia generata.
Speech to Text
- Trascrizione da URL: L’endpoint convert speech to text ora accetta un parametro
source_url(stringa, facoltativo) per trascrivere audio o video da un URL ospitato, inclusi video YouTube, video TikTok e altri servizi di hosting video. Può essere usato come alternativa al caricamento diretto di un file.
Voci
- Conteggio totale nell’elenco delle voci condivise: La risposta di list shared voices ora include un campo
total_count, semplificando l’implementazione della paginazione e la visualizzazione del numero di risultati.
Rilasci SDK
SDK JavaScript
- v2.41.0 - Aggiunto il supporto per il tipo di evento WebSocket
multimodal_messagenelle conversazioni in tempo reale di ElevenAgents. Include la rigenerazione di Fern per gli ultimi aggiornamenti dello schema API. - v2.41.1 - Rigenerazione di Fern per corrispondere allo schema API del 1° aprile 2026.
SDK Python
- v2.41.0 - Corretto
audio_interface, che ora è facoltativo nella modalità di conversazione solo testo, risolvendo un errore di runtime all’avvio di una sessione senza audio. Include la rigenerazione di Fern per l’ultimo schema API.
Pacchetti
Questa release include la nuova versione v1.0.0 degli SDK Agent lato client. Include importanti modifiche incompatibili per @elevenlabs/client, @elevenlabs/react e @elevenlabs/react-native. Consulta la guida alla migrazione qui sotto prima dell’aggiornamento.
Per aiutarti ad aggiornare, abbiamo rilasciato una Skill che consente ai tuoi agenti di eseguire l’aggiornamento per te. Installala con
Puoi leggere di più sulla release v1 e sui suoi miglioramenti nel nostro blog per sviluppatori.
-
@elevenlabs/client@1.0.0 — Modifiche incompatibili:
- Le classi
InputeOutputnon vengono più esportate. Usa invece le interfacceInputControllereOutputControllerda@elevenlabs/client. Conversationnon è più una classe: ora è un oggetto namespace e un alias di tipo perTextConversation | VoiceConversation. Rimuovi eventuali controlliinstanceof Conversatione sottoclassi.- Il valore predefinito di
connectionTypeviene ora dedotto dalla modalità della conversazione: le conversazioni vocali usano"webrtc"per impostazione predefinita e quelle solo testo usano"websocket". Per mantenere il comportamento precedente per le conversazioni vocali, passa esplicitamenteconnectionType: "websocket". VoiceConversation.wakeLockora è privato. PassauseWakeLock: falsenelle opzioni di sessione per disattivare la gestione del wake lock.changeInputDevice()echangeOutputDevice()ora restituisconoPromise<void>anzichéPromise<Input>oPromise<Output>.- Sostituisci
conversation.input.analyser.getByteFrequencyData(data)conconversation.getInputByteFrequencyData(). - Sostituisci
conversation.input.setMuted(v)conconversation.setMicMuted(v). - Sostituisci
conversation.output.gain.gain.value = vconconversation.setVolume({ volume: v }). getInputVolume(),getOutputVolume(),getInputByteFrequencyData()egetOutputByteFrequencyData()ora restituiscono0o unUint8Arrayvuoto anziché generare un errore quando non è attiva alcuna conversazione.
- Le classi
-
@elevenlabs/react@1.0.0 — Modifiche incompatibili:
useConversationora richiede un antenatoConversationProvider. Avvolgi il tuo albero di componenti in<ConversationProvider>e sposta le opzioni nel provider o nell’hook.- Le esportazioni
DeviceFormatConfigeDeviceInputConfigsono state rimosse. Usa inveceFormatConfigeInputDeviceConfigda@elevenlabs/client. - Nuovi hook granulari sostituiscono il monolitico
useConversationper migliorare le prestazioni di rendering:useConversationControls(),useConversationStatus(),useConversationInput(),useConversationMode(),useConversationFeedback()euseRawConversation(). Ogni hook si iscrive solo allo stato di cui ha bisogno, evitando re-render non necessari. - Nuovo hook
useConversationClientTool(name, handler)per registrare strumenti client che gli agenti possono invocare, con pulizia automatica durante l’unmount. - Aggiunto il supporto per il mute controllato tramite le props
isMutedeonMutedChangesuConversationProvider.
-
@elevenlabs/react-native@1.0.0 — Modifiche incompatibili:
- Le precedenti API
ElevenLabsProvidereuseConversationsono state rimosse e sostituite con riesportazioni da@elevenlabs/react. SostituisciElevenLabsProviderconConversationProvidereuseConversationcon gli hook granulari (useConversationControls,useConversationStatus, ecc.). - In React Native, il pacchetto ora fornisce polyfill per le globali WebRTC, configura l’
AudioSessionnativa e registra una strategia di sessione vocale specifica per la piattaforma al momento dell’importazione.
- Le precedenti API
-
@elevenlabs/types@0.8.0 - Esporta l’array runtime
CALLBACK_KEYS, contenente tutte le chiavi dell’interfacciaCallbacks, usato internamente dall’SDK React per la composizione dei callback. -
@elevenlabs/client@0.16.0 - Aggiunti l’evento WebSocket server-client
guardrail_triggerede il callbackonGuardrailTriggered, che viene attivato quando il server rileva una violazione dei guardrail durante una conversazione. Aggiunti anche discriminanti di tipo aTextConversationeVoiceConversationper consentire il narrowing delle unioni discriminate, oltre a overload distartSessionche restringono il tipo di ritorno in base all’opzionetextOnly. -
@elevenlabs/react-native@0.6.0 - Aggiunti l’evento WebSocket
guardrail_triggerede il callbackonGuardrailTriggered, in linea con@elevenlabs/client@0.16.0. -
@elevenlabs/client@1.1.0 - Aggiunto il supporto lato client per simulare le risposte degli strumenti nelle conversazioni degli agenti, consentendo scenari di test che simulano gli esiti delle chiamate agli strumenti senza invocare strumenti reali.
-
@elevenlabs/types@0.9.0 - Aggiunte definizioni di tipo per la simulazione delle risposte degli strumenti nelle conversazioni degli agenti.
-
@elevenlabs/react@1.0.1 - Aggiornato per dipendere da
@elevenlabs/client@1.1.0. -
@elevenlabs/react-native@1.0.1 - Aggiornato per dipendere da
@elevenlabs/client@1.1.0e@elevenlabs/react@1.0.1.
API
Visualizza le modifiche API
Nuovi endpoint
-
Run conversation analysis -
POST /v1/convai/conversations/{conversation_id}/analysis/run- Riesegue l’analisi di una conversazione completata usando i criteri di valutazione e le impostazioni di raccolta dati correnti dell’agente. -
POST /v1/music/video-to-music- Genera musica di sottofondo da uno o più file video forniti come dati di form multipart.
Endpoint aggiornati
ElevenAgents
-
- Aggiunto il campo
file_input(FileInputConfig, facoltativo) aConversationConfig, abilitando il supporto al caricamento di file (immagini, PDF) nelle conversazioni in chat quando l’LLM supporta input multimodale - Aggiunto il campo
max_conversation_duration_message(stringa, facoltativo) alla configurazione dell’agente: l’agente invia questo messaggio quando viene raggiunto il limite di tempo della sessione
- Aggiunto il campo
-
- Aggiunto il campo
tool_mock_config(oggetto, facoltativo): una mappa di nomi di strumenti in vociToolResponseMockConfigper controllare il comportamento di simulazione degli strumenti durante la simulazione
- Aggiunto il campo
-
- Aggiunto il parametro query
sort_by(stringa, facoltativo): accettasearch_score(predefinito) ocreated_at
- Aggiunto il parametro query
-
- Aggiunto il campo
branch_id(stringa, facoltativo) per indirizzare un branch specifico dell’agente - Aggiunto il campo
environment(stringa, facoltativo) per specificare l’ambiente di destinazione
- Aggiunto il campo
-
Twilio outbound call, SIP trunk outbound call
- I dati client di avvio della conversazione ora accettano i campi facoltativi
branch_ideenvironment
- I dati client di avvio della conversazione ora accettano i campi facoltativi
Speech to Text
-
- Aggiunto il parametro
source_url(stringa, facoltativo): accetta un URL di un file audio o video, di un video YouTube, di un video TikTok o di altri contenuti multimediali ospitati come alternativa al caricamento di un file
- Aggiunto il parametro
Voci
-
- Aggiunto il campo
total_count(intero) al modello di risposta
- Aggiunto il campo
Allineamento forzato
-
- Rimosso il parametro
enabled_spooled_filedal body della richiesta con dati di form multipart
- Rimosso il parametro