Strumieniuj mowę z informacją o czasie

Zamienia tekst na mowę przy użyciu wybranego głosu i zwraca strumień obiektów JSON zawierających audio jako ciąg zakodowany w base64 wraz z informacją o tym, kiedy wypowiedziano który znak.

Parametry ścieżki

voice_idstringWymagany

ID głosu do użycia. Wszystkie dostępne głosy możesz wyświetlić za pomocą endpointu Pobierz głosy.

Nagłówki

xi-api-keystringOpcjonalny

Parametry zapytania

enable_loggingbooleanOpcjonalnyDomyślnie true

Gdy enable_logging ma wartość false, dla żądania zostanie użyty tryb zerowej retencji. Funkcje historii, w tym łączenie żądań, będą niedostępne dla tego żądania. Z trybu zerowej retencji mogą korzystać tylko klienci Enterprise.

optimize_streaming_latencyinteger or nullOpcjonalnyDeprecated
Możesz włączyć optymalizacje opóźnienia kosztem jakości. Najniższe możliwe końcowe opóźnienie zależy od modelu. Dostępne wartości: 0 - tryb domyślny (bez optymalizacji opóźnienia) 1 - standardowe optymalizacje opóźnienia (około 50% możliwej poprawy opóźnienia z opcji 3) 2 - silne optymalizacje opóźnienia (około 75% możliwej poprawy opóźnienia z opcji 3) 3 - maksymalne optymalizacje opóźnienia 4 - maksymalne optymalizacje opóźnienia z wyłączonym normalizatorem tekstu, aby jeszcze bardziej zmniejszyć opóźnienie (najniższe opóźnienie, ale możliwa błędna wymowa np. liczb i dat). Domyślnie None.
output_formatenumOpcjonalnyDomyślnie mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Żądanie

This endpoint expects an object.
textstringWymagany

Tekst, który zostanie przekształcony w mowę.

model_idstringOpcjonalnyDomyślnie eleven_multilingual_v2

Identyfikator modelu, który zostanie użyty. Możesz sprawdzić dostępne modele za pomocą GET /v1/models. Model musi obsługiwać zamianę tekstu na mowę, co możesz sprawdzić we właściwości can_do_text_to_speech.

language_codestring or nullOpcjonalny

Kod języka (ISO 639-1) używany do wymuszenia języka modelu i normalizacji tekstu. Jeśli model nie obsługuje podanego kodu języka, zostanie on zignorowany. Ten parametr nie jest obsługiwany przez modele multilingual_v2.

voice_settingsobject or nullOpcjonalny

Ustawienia głosu nadpisujące zapisane ustawienia danego głosu. Są stosowane tylko w tym żądaniu.

pronunciation_dictionary_locatorslist of objects or nullOpcjonalny

Lista lokalizatorów słowników wymowy (id, version_id), które zostaną zastosowane do tekstu. Będą stosowane po kolei. W jednym żądaniu możesz podać do 3 lokalizatorów

seedinteger or nullOpcjonalny

Jeśli podano, nasz system dołoży starań, by generowanie było deterministyczne, więc powtarzane żądania z tym samym seedem i parametrami powinny zwracać ten sam wynik. Determinizm nie jest gwarantowany. Musi być liczbą całkowitą od 0 do 4294967295.

previous_textstring or nullOpcjonalny

Tekst poprzedzający tekst bieżącego żądania. Może poprawić ciągłość mowy przy łączeniu wielu generacji lub wpłynąć na ciągłość mowy w bieżącej generacji.

next_textstring or nullOpcjonalny

Tekst następujący po tekście bieżącego żądania. Może poprawić ciągłość mowy przy łączeniu wielu generacji lub wpłynąć na ciągłość mowy w bieżącej generacji.

previous_request_idslist of strings or nullOpcjonalny

Lista request_id próbek wygenerowanych przed tą generacją. Można jej użyć, aby poprawić ciągłość mowy przy dzieleniu dużego zadania na kilka żądań. Najlepsze wyniki uzyskasz, używając tego samego modelu dla wszystkich generacji. Jeśli wyślesz zarówno previous_text, jak i previous_request_ids, previous_text zostanie zignorowane. Możesz wysłać maksymalnie 3 request_ids.

next_request_idslist of strings or nullOpcjonalny

Lista request_id próbek następujących po tej generacji. next_request_ids jest szczególnie przydatne do zachowania ciągłości mowy podczas ponownego generowania próbki z problemami z jakością audio. Na przykład, jeśli wygenerowano 3 klipy mowy i chcesz poprawić klip 2, przekazanie identyfikatora żądania klipu 3 jako next_request_id (oraz klipu 1 jako previous_request_id) pomoże zachować naturalny tok połączonej mowy. Najlepsze wyniki uzyskasz, używając tego samego modelu dla wszystkich generacji. Jeśli wyślesz zarówno next_text, jak i next_request_ids, next_text zostanie zignorowane. Możesz wysłać maksymalnie 3 request_ids.

use_pvc_as_ivcbooleanOpcjonalnyDomyślnie false

Czy używać wersji IVC profesjonalnego głosu. Może to poprawić ekspresję i zmniejszyć opóźnienie.

apply_text_normalizationenumOpcjonalnyDomyślnie auto

Ten parametr kontroluje normalizację tekstu w trzech trybach: „auto”, „on” i „off”. W trybie „auto” system automatycznie zdecyduje, czy zastosować normalizację tekstu, np. zapisywanie liczb słownie. W trybie „on” normalizacja tekstu będzie zawsze stosowana, a w trybie „off” zostanie pominięta.

Dozwolone wartości:
apply_language_text_normalizationbooleanOpcjonalnyDomyślnie false

Ten parametr kontroluje normalizację tekstu dla języka. Pomaga w poprawnej wymowie tekstu w niektórych obsługiwanych językach. OSTRZEŻENIE: ten parametr może znacznie zwiększyć opóźnienie żądania. Obecnie obsługiwany tylko dla języka japońskiego.

Odpowiedź

Strumień fragmentów transkrypcji

audio_base64string
Dane audio zakodowane w Base64
alignmentobject or nullOpcjonalny

Informacje o znacznikach czasu dla każdego znaku w oryginalnym tekście

normalized_alignmentobject or nullOpcjonalny

Informacje o znacznikach czasu dla każdego znaku w znormalizowanym tekście

Błędy

422
Unprocessable Entity Error