Scribe v2 Realtime

Scribe v2 Realtime, nasz najszybszy i najdokładniejszy model rozpoznawania mowy na żywo, jest już oficjalnie dostępny. Zapewnia najwyższą w branży dokładność w ponad 92 językach przy bardzo niskim opóźnieniu 150 ms. Dowiedz się więcej.

Platforma Agents

  • Opinie po zakończeniu rozmowy w widżecie: Widżety obsługują teraz konfigurowalne zbieranie opinii po zakończeniu rozmowy z opcjonalnymi polami oceny i komentarza, dzięki czemu możesz zbierać opinie użytkowników bezpośrednio w rozmowach z agentem.
  • Konfiguracja miękkiego limitu czasu: Dodaliśmy rozbudowane ustawienia miękkiego limitu czasu, które pozwalają określić, jak agenci reagują na pauzy w rozmowie, z konfigurowalnymi promptami i zachowaniem na poziomie tury i rozmowy.
  • Zaawansowane filtrowanie rozmów: Endpoint rozmów obsługuje teraz filtrowanie według zakresu czasu trwania połączenia, parametrów oceny, parametrów zbierania danych i konkretnych nazw narzędzi.
  • Ulepszone opinie o rozmowach: Zaktualizowaliśmy system opinii o rozmowach o ustrukturyzowane typy opinii, w tym oceny i komentarze, aby lepiej śledzić doświadczenia użytkowników.

ElevenCreative Studio

  • Rozszerzone metadane projektu: Projects zawierają teraz pełne śledzenie zasobów z miniaturami wideo, referencjami do zewnętrznego audio i rozszerzonymi informacjami o migawkach, w tym czasem trwania audio.

Rozliczenia

  • Ulepszone szczegóły faktur: Odpowiedzi dotyczące faktur zawierają teraz szczegółowe informacje o rabatach w nowej tablicy discounts, zastępującej wycofane pola discount_percent_off i discount_amount_off. Pola subtotal_cents i tax_cents zapewniają czytelniejszy podział faktury.

Music API

  • Krótsze opóźnienia przy rozdzielaniu ścieżek: Endpoint rozdzielania ścieżek został zaktualizowany, aby lepiej obsługiwać pliki audio i zapewniać bardziej przewidywalne opóźnienia przetwarzania żądań.

Wydania SDK

JavaScript SDK

  • v2.23.0 - Zaktualizowano endpoint Speech to Text (Scribe) do scribe_realtime i wyeksportowano dodatkowe typy TypeScript, by ułatwić pracę deweloperom.
  • v2.22.0 - Zaktualizowano o najnowsze zmiany schematu API, w tym filtrowanie rozmów, konfigurację miękkiego limitu czasu i funkcje opinii w widżetach.

Python SDK

  • v2.22.1 - Zaktualizowano endpoint Speech to Text (Scribe) do scribe_realtime i naprawiono problemy z cyklicznymi importami dla większej stabilności.
  • v2.22.0 - Zaktualizowano o najnowsze zmiany schematu API, w tym filtrowanie rozmów, konfigurację miękkiego limitu czasu i funkcje opinii w widżetach.

Pakiety Agents

Android SDK

  • v0.5.0 - Dodano funkcje setVolume i getVolume do programowego sterowania audio oraz przykładową implementację z paskiem regulacji głośności w aplikacji demonstracyjnej.

API

Zaktualizowane endpointy

Platforma Agents

Zarządzanie rozmowami

  • Pobierz rozmowy

    • Dodano parametr zapytania call_duration_min_secs (integer) do filtrowania rozmów według minimalnego czasu trwania połączenia
    • Dodano parametr zapytania call_duration_max_secs (integer) do filtrowania rozmów według maksymalnego czasu trwania połączenia
    • Dodano parametr zapytania evaluation_params (tablica ciągów) do filtrowania według kryteriów oceny
    • Dodano parametr zapytania data_collection_params (tablica ciągów) do filtrowania według parametrów zbierania danych
    • Dodano parametr zapytania tool_names (tablica ciągów) do filtrowania rozmów, które używały konkretnych narzędzi
  • Prześlij opinię o rozmowie

    • Korzysta teraz z ConversationFeedbackRequestModel z ustrukturyzowanymi typami opinii
    • Dodano pole type, aby określić kategorię opinii
    • Dodano pole rating dla opinii liczbowej
    • Dodano pole comment dla opinii tekstowej

Konfiguracja agenta

  • Pobierz widżet agenta
    • Dodano pole end_feedback z WidgetEndFeedbackConfig do konfiguracji zbierania opinii po zakończeniu rozmowy
    • Obsługuje opcjonalne pola oceny i komentarza w formularzach opinii
  • Pobierz agenta i Zaktualizuj agenta
    • Zaktualizowano schemat odpowiedzi o nowe opcje konfiguracji platformy
    • Rozszerzono schemat żądania o dodatkowe pola ustawień

Konfiguracja tur i rozmów

  • Utwórz agenta, Symuluj rozmowę, Symuluj strumień rozmowy

    • Dodano pole soft_timeout_config do sterowania zachowaniem podczas pauz w rozmowach
    • Dodano nadpisania konfiguracji turn przez TurnConfigOverride i TurnConfigOverrideConfig
    • Dodano initial_wait_time do TurnConfig do sterowania czasem początkowej odpowiedzi
    • Konfiguracja jest dostępna na poziomie rozmowy i nadpisania workflow

Testowanie

  • Uruchom testy agenta

    • Rozszerzono schemat żądania o obsługę wyrażeń workflow
    • Zaktualizowano schemat odpowiedzi o dodatkowe pola wyników testów
  • Pobierz wywołanie testu

    • Odpowiedź zawiera rozszerzone dane wyników testu
    • Zaktualizowano schemat wyników wyrażeń workflow

ElevenCreative Studio

  • Pobierz projekt

    • Dodano wymagane pole assets zawierające filmy i referencje do zewnętrznego audio
    • Wprowadzono ProjectVideoResponseModel dla metadanych zasobów wideo
    • Wprowadzono ProjectExternalAudioResponseModel do śledzenia zewnętrznego audio
    • Wprowadzono ProjectVideoThumbnailSheetResponseModel dla miniatur wideo
  • Pobierz migawkę projektu

    • Przebudowano odpowiedź z nowym ProjectSnapshotExtendedResponseModel
    • Dodano wymagane pole audio_duration_secs do danych migawki
    • Usunięto character_alignments z ProjectSnapshotResponseModel
    • Wprowadzono ProjectSnapshotsResponseModel dla kolekcji migawek

Rozliczenia

  • Pobierz subskrypcję
    • Dodano wymaganą tablicę discounts z wpisami DiscountResponseModel
    • Wycofano pole discount_percent_off (nadal dostępne, ale oznaczone do usunięcia)
    • Wycofano pole discount_amount_off (nadal dostępne, ale oznaczone do usunięcia)
    • Dodano pole subtotal_cents (integer, nullable) dla sum faktur przed podatkiem
    • Dodano pole tax_cents (integer, nullable) dla kwot podatku
    • Zaktualizowano przykłady faktur o nowe pola rabatów i sum

Speech to Text

  • Transkrybuj audio
    • Zaktualizowano schemat odpowiedzi o rozszerzone dane transkrypcji

Text to Speech

Zarządzanie głosami

Professional Voice Cloning (PVC)

Ustawienia językowe

  • Modele ustawień językowych zawierają teraz pole soft_timeout_translation dla zlokalizowanych komunikatów miękkiego limitu czasu

Wyzwalacze integracji API

  • Zarejestrowano nową kolekcję API: convai_api_integration_trigger_connections

Wycofania

  • Pola faktury discount_percent_off i discount_amount_off są wycofane; użyj zamiast nich tablicy discounts