Eleven v4 i Eleven v4 Turbo

Eleven v4 i Eleven v4 Turbo są już dostępne. Eleven v4 zapewnia wyższą jakość, bardziej ekspresyjną mowę i lepsze klonowanie głosu w ponad 90 językach. Eleven v4 Turbo oferuje tę samą rodzinę modeli do aplikacji działających w czasie rzeczywistym, ze średnim opóźnieniem inferencji około 100 ms.

Używaj eleven_v4 przez API Text to Dialogue do tworzenia treści i długich nagrań audio. Używaj eleven_v4_turbo przez WebSocket Text to Dialogue dla agentów i aplikacji interaktywnych.

Speech to Text

  • Edycja transkrypcji: Transkrypcja wsadowa i w czasie rzeczywistym obsługuje teraz instrukcję edycji w języku naturalnym o długości do 2000 znaków. Odpowiedzi wsadowe zwracają wynik w edited_transcript, a sesje w czasie rzeczywistym wysyłają zdarzenie edited_transcript. Zobacz przewodniki dla trybu wsadowego i w czasie rzeczywistym, aby poznać niezgodności, obsługę odpowiedzi i ceny.

ElevenAgents

  • Modele agentów: Dodano gpt-6-sol, gpt-6-luna, glm-52, deepseek-v41-flash, claude-opus-5 i claude-opus-5-5 do obsługiwanych opcji LLM agentów.
  • Zużycie w testach agentów: Podsumowania wywołań testowych mogą zawierać łączną liczbę kredytów i cenę w USD. Poszczególne uruchomienia testów mogą zawierać liczbę kredytów i rozbicie opłat.

Flows

  • API szablonów: Dodano endpointy do wyświetlania i pobierania opublikowanych szablonów Flows, uruchamiania szablonów i pobierania wyników. Uruchomienia mogą wskazywać opublikowaną wersję i wysyłać końcowy wynik do skonfigurowanego webhooka.

Text to Dialogue

  • Ciągłość generowania: Żądania Text to Dialogue mogą używać poprzedzającego lub następnego tekstu oraz identyfikatorów żądań, by zachować ciągłość między generowaniami.
  • Tryb głosu Professional: Żądania Text to Dialogue mogą używać wersji Instant Voice Clone głosu Professional Voice Clone, aby zmniejszyć opóźnienie lub zwiększyć ekspresję.

Wydania SDK

JavaScript SDK

  • v2.70.0 - Dodano typy edycji transkrypcji Speech to Text dla trybu wsadowego i czasu rzeczywistego, filtrowanie branchId oraz pola kosztów dla podsumowań wywołań testowych, automatyczne wykrywanie bazy wiedzy, usePvcAsIvc dla Text to Dialogue i model agenta deepseek-v41-flash.

Python SDK

  • v2.70.0 - Dodano typy edycji transkrypcji Speech to Text dla trybu wsadowego i czasu rzeczywistego, filtrowanie branch_id oraz pola kosztów dla podsumowań wywołań testowych, automatyczne wykrywanie bazy wiedzy, use_pvc_as_ivc dla Text to Dialogue i model agenta deepseek-v41-flash.

ElevenLabs CLI

  • v1.4.0 - Naprawiono żądania z podanym kluczem API, aby nie wysyłały też zapisanych danych OAuth, co powodowało błędy uwierzytelniania. Dodano opisy grupy poleceń opinii oraz instrukcje zgłaszania brakujących funkcji do wygenerowanych umiejętności agentów. Wygenerowano ponownie klienta API z endpointami szablonów Flows i aktualnymi typami schematów.

API

Nowe endpointy

Flows

  • Lista szablonów - GET /v1/flows/templates - Wyświetl opublikowane szablony i ich uruchamialne wersje.
  • Pobierz szablon - GET /v1/flows/templates/{template_id} - Pobierz szablon i jego uruchamialne wersje.
  • Utwórz uruchomienie szablonu - POST /v1/flows/templates/{template_id}/runs - Uruchom szablon z wartościami wejściowymi, opcjonalną wersją i opcjonalnym webhookiem.
  • Lista uruchomień szablonu - GET /v1/flows/templates/{template_id}/runs - Wyświetl uruchomienia szablonu z paginacją kursora i opcjonalnym filtrowaniem wersji.
  • Pobierz uruchomienie szablonu - GET /v1/flows/templates/{template_id}/runs/{run_id} - Pobierz uruchomienie szablonu i stan jego danych wyjściowych.

Zaktualizowane endpointy

Speech to Text

  • Konwertuj mowę na tekst - POST /v1/speech-to-text
    • Dodano opcjonalne dopuszczające null transcript_edit (ciąg znaków), które przyjmuje instrukcję edycji w języku naturalnym o długości do 2000 znaków.
    • Odpowiedzi dodają opcjonalne dopuszczające null edited_transcript. Udana edycja zawiera wymagane pola kind: "transcript" i text. Nieudana edycja zawiera wymagane pola kind: "error", error_type: "edit_failed" i message.
  • Speech to Text w czasie rzeczywistym przyjmuje transcript_edit (ciąg znaków) i wysyła zdarzenia edited_transcript z wymaganymi polami text i edited_text.

ElevenAgents

  • Utwórz agenta, Pobierz agenta i Zaktualizuj agenta
    • Dodano gpt-6-sol, gpt-6-luna, glm-52, deepseek-v41-flash, claude-opus-5 i claude-opus-5-5 do enuma LLM.
    • Monitory alertów dodają opcjonalne dopuszczające null enabled (wartość logiczna), aby określić, czy monitor może wysyłać powiadomienia.
  • Lista rozmów i Wyszukiwanie tekstowe
    • data_collection_params i dynamic_variable_params dodają operatory neq i in. Wartości dla in używają separatora pionowej kreski.
    • evaluation_params przyjmuje success, failure lub unknown jako wartość wyniku.
  • Inteligentne wyszukiwanie - GET /v1/convai/conversations/messages/smart-search
    • Dodano opcjonalne dopuszczające null branch_id (ciąg znaków).
  • Lista wywołań testowych - GET /v1/convai/test-invocations
    • Dodano opcjonalne dopuszczające null branch_id (ciąg znaków).
    • Podsumowania wywołań testowych dodają opcjonalne dopuszczające null credits_used (liczba całkowita) i total_price (liczba).
  • Pobierz wywołanie testowe - GET /v1/convai/test-invocations/{test_invocation_id}
    • Poszczególne uruchomienia testów dodają opcjonalne dopuszczające null credits_used (liczba całkowita) i charging (ConversationChargingCommonModel).
  • Symuluj rozmowę i Streamuj symulację rozmowy
    • Zmieniono domyślną wartość opcjonalnego new_turns_limit z 10,000 na 100 i ustawiono maksymalną wartość na 100.
  • Utwórz zadanie crawlowania i Pobierz zadanie crawlowania
    • Dodano opcjonalne auto_discover (wartość logiczna, domyślnie false), aby podążać za linkami i dodawać nowo wykryte strony podczas automatycznej synchronizacji. Wymaga to enable_auto_sync: true.
  • Odśwież dokument bazy wiedzy - POST /v1/convai/knowledge-base/{documentation_id}/refresh
    • AutoSyncInfo dodaje opcjonalne auto_discover (wartość logiczna, domyślnie false), które wskazuje, czy odświeżanie crawluje i dodaje nowo wykryte strony.
  • Lista narzędzi serwera MCP - GET /v1/convai/mcp-servers/{mcp_server_id}/tools
    • Odpowiedzi dodają opcjonalne tool_approval_statuses (tablica). Każdy element zawiera wymagane tool_id (ciąg znaków) i state (up_to_date, needs_review lub not_approved) oraz opcjonalne pola zasad zatwierdzania i zatwierdzonej definicji.

Text to Dialogue

  • Konwertuj tekst na dialog, Streamuj tekst na dialog, Konwertuj ze znacznikami czasu i Streamuj ze znacznikami czasu
    • Dodano opcjonalne use_pvc_as_ivc (wartość logiczna, domyślnie false), aby używać wersji Instant Voice Clone głosu Professional Voice Clone.
    • Dodano opcjonalne dopuszczające null previous_text i future_text (ciągi znaków, maksymalnie 100 znaków) oraz previous_request_ids i next_request_ids (tablice ciągów znaków, maksymalnie 3 identyfikatory) dla ciągłości generowania.
    • Opcjonalny obiekt settings dodaje dopuszczające null similarity (liczba, 0–1, domyślnie 0.75).

Text to Speech

Flows

Voice Design

Obszary robocze

  • Utwórz klucz API konta usługi - POST /v1/service-accounts/{service_account_user_id}/api-keys
    • Dodano opcjonalne dopuszczające null tts_concurrency_limit, music_concurrency_limit i dubbing_concurrency_limit (liczby całkowite) dla kluczy API kont usług Enterprise.
  • Zaktualizuj klucz API konta usługi - PATCH /v1/service-accounts/{service_account_user_id}/api-keys/{api_key_id}
    • Dodano opcjonalne tts_concurrency_limit, music_concurrency_limit i dubbing_concurrency_limit. Każde pole przyjmuje liczbę całkowitą, clear, no_update lub null, a domyślnie ma wartość no_update.

Modele

  • Lista modeli - GET /v1/models
    • Wycofano wymagane max_characters_request_free_user i max_characters_request_subscribed_user. Te pola nie są egzekwowane; zamiast nich użyj maximum_text_length_per_request.