Text to Voice
- Voice Design: Uruchomiliśmy nowe Text to Voice Design z Eleven v3 do tworzenia niestandardowych głosów na podstawie opisów tekstowych.
Speech to Text
- Ulepszona diarizacja: Dodaliśmy parametr
diarization_thresholddo endpointu Speech to Text. Dostosuj równowagę między dokładnością rozpoznawania mówców a ich łączną liczbą, ustawiając próg od 0.1 do 0.4.
Professional Voice Cloning
- Usuwanie szumu tła: Dodaliśmy
remove_background_noise, aby oczyszczać próbki głosu za pomocą modeli izolacji audio i uzyskać lepsze dane treningowe.
ElevenCreative Studio
- Wykrywanie obsługi wideo: Dodaliśmy właściwość
has_videodo odpowiedzi rozdziałów, aby wskazać, czy rozdziały zawierają materiały wideo.
Przestrzenie robocze
-
Grupy kont usługowych: Konta usługowe można teraz dodawać do grup w przestrzeni roboczej, co ułatwia zarządzanie uprawnieniami i kontrolę dostępu.
-
Uwierzytelnianie przestrzeni roboczej: Dodaliśmy obsługę połączeń uwierzytelniania przestrzeni roboczej, umożliwiając bezpieczne integracje narzędzi webhook z usługami zewnętrznymi.
SDK
- Python SDK: Wydano v2.6.0 z obsługą najnowszego API i poprawkami błędów.
- JavaScript SDK: Wydano v2.5.0 z obsługą najnowszego API i poprawkami błędów.
- React Agents Platform SDK: Dodano obsługę WebRTC w 0.2.0
API
Zobacz zmiany w API
Nowe endpointy
- Dodano 2 nowe endpointy:
- Zaprojektuj głos - Utwórz podglądy głosu na podstawie opisów tekstowych
- Utwórz głos z podglądu - Zamień podglądy głosu w trwałe głosy
Zaktualizowane endpointy
Speech to Text
- Konwertuj mowę na tekst - Dodano parametr
diarization_thresholddo precyzyjnego dostrajania rozdzielania mówców
Zarządzanie głosami
- Pobierz audio próbki głosu - Dodano parametr zapytania
remove_background_noisei przeniesiono go z treści żądania do parametrów zapytania