Strumieniowanie tekstu na dialog ze znacznikami czasu

Zamienia listę par tekstu i identyfikatora głosu na mowę (dialog) oraz zwraca strumień obiektów JSON zawierających audio jako ciąg zakodowany w base64 i znaczniki czasu

Nagłówki

xi-api-keystringOpcjonalny

Parametry zapytania

output_formatenumOpcjonalny
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
enable_loggingbooleanOpcjonalnyDomyślnie true

Gdy enable_logging ma wartość false, dla żądania zostanie użyty tryb zerowej retencji. Funkcje historii, w tym łączenie żądań, będą niedostępne dla tego żądania. Z trybu zerowej retencji mogą korzystać tylko klienci Enterprise.

Żądanie

This endpoint expects an object.
inputslist of objectsWymagany

Lista danych wejściowych dialogu, z których każda zawiera tekst i identyfikator głosu do zamiany na mowę. Maksymalna liczba unikalnych identyfikatorów głosów to 10. Aby generowanie było niezawodne, łączna liczba znaków we wszystkich wartościach inputs[].text nie powinna przekraczać 2000 na żądanie. Dłuższe żądania mogą zakończyć się przedwcześnie w odpowiedziach strumieniowych lub zwrócić błąd walidacji.

model_idstringOpcjonalnyDomyślnie eleven_v3

Identyfikator modelu, który zostanie użyty. Możesz sprawdzić dostępne modele za pomocą GET /v1/models. Model musi obsługiwać zamianę tekstu na mowę, co możesz sprawdzić we właściwości can_do_text_to_speech.

language_codestring or nullOpcjonalny

Kod języka (ISO 639-1) używany do wymuszenia języka modelu i normalizacji tekstu. Jeśli model nie obsługuje podanego kodu języka, zostanie on zignorowany. Ten parametr nie jest obsługiwany przez modele multilingual_v2.

settingsobject or nullOpcjonalny

Ustawienia sterujące generowaniem dialogu.

pronunciation_dictionary_locatorslist of objects or nullOpcjonalny

Lista lokalizatorów słowników wymowy (id, version_id), które zostaną zastosowane do tekstu. Będą stosowane po kolei. W jednym żądaniu możesz podać do 3 lokalizatorów

seedinteger or nullOpcjonalny

Jeśli podano, nasz system dołoży starań, by generowanie było deterministyczne, więc powtarzane żądania z tym samym seedem i parametrami powinny zwracać ten sam wynik. Determinizm nie jest gwarantowany. Musi być liczbą całkowitą od 0 do 4294967295.

apply_text_normalizationenumOpcjonalnyDomyślnie auto

Ten parametr kontroluje normalizację tekstu w trzech trybach: „auto”, „on” i „off”. W trybie „auto” system automatycznie zdecyduje, czy zastosować normalizację tekstu, np. zapisywanie liczb słownie. W trybie „on” normalizacja tekstu będzie zawsze stosowana, a w trybie „off” zostanie pominięta.

Dozwolone wartości:
use_pvc_as_ivcbooleanOpcjonalnyDomyślnie false

Czy używać wersji IVC profesjonalnego głosu. Może to poprawić ekspresję i zmniejszyć opóźnienie.

previous_request_idslist of strings or nullOpcjonalny

Lista request_ids generacji dialogu poprzedzających tę generację. Służy do zapewnienia ciągłości modelu przy dzieleniu dużego zadania na kilka żądań. Możesz wysłać maksymalnie 3 request_ids. Ostatni request_id oznacza audio najbliższe bieżącemu żądaniu. Nie jest obsługiwane przez każdy model.

next_request_idslist of strings or nullOpcjonalny

Lista request_ids generacji dialogu następujących po tej generacji. Przydatna do zachowania ciągłości podczas ponownego generowania klipu w środku sekwencji. Możesz wysłać maksymalnie 3 request_ids. Pierwszy request_id oznacza audio najbliższe bieżącemu żądaniu. Nie jest obsługiwane przez każdy model.

previous_textstring or nullOpcjonalny<=100 characters

Tekst bezpośrednio poprzedzający tę generację, używany do zapewnienia ciągłości prozodycznej. Można wysłać maksymalnie 100 znaków. Nie jest obsługiwane przez każdy model.

future_textstring or nullOpcjonalny<=100 characters

Tekst bezpośrednio po tej generacji, używany do zapewnienia modelowi ciągłości prozodycznej. Można wysłać maksymalnie 100 znaków. Nie jest obsługiwany przez każdy model.

Odpowiedź

Strumień fragmentów transkrypcji

audio_base64string
Dane audio zakodowane w Base64
voice_segmentslist of objects

Segmenty głosowe dla audio

alignmentobject or nullOpcjonalny

Informacje o znacznikach czasu dla każdego znaku w oryginalnym tekście

normalized_alignmentobject or nullOpcjonalny

Informacje o znacznikach czasu dla każdego znaku w znormalizowanym tekście

Błędy

422
Unprocessable Entity Error