Strumieniuj dialog
Zamienia listę par tekstu i identyfikatora głosu na mowę (dialog) oraz zwraca strumień audio.
Nagłówki
Parametry zapytania
Gdy enable_logging ma wartość false, dla żądania zostanie użyty tryb zerowej retencji. Funkcje historii, w tym łączenie żądań, będą niedostępne dla tego żądania. Z trybu zerowej retencji mogą korzystać tylko klienci Enterprise.
Żądanie
Lista danych wejściowych dialogu, z których każda zawiera tekst i identyfikator głosu do zamiany na mowę. Maksymalna liczba unikalnych identyfikatorów głosów to 10. Aby generowanie było niezawodne, łączna liczba znaków we wszystkich wartościach inputs[].text nie powinna przekraczać 2000 na żądanie. Dłuższe żądania mogą zakończyć się przedwcześnie w odpowiedziach strumieniowych lub zwrócić błąd walidacji.
Identyfikator modelu, który zostanie użyty. Możesz sprawdzić dostępne modele za pomocą GET /v1/models. Model musi obsługiwać zamianę tekstu na mowę, co możesz sprawdzić we właściwości can_do_text_to_speech.
Kod języka (ISO 639-1) używany do wymuszenia języka modelu i normalizacji tekstu. Jeśli model nie obsługuje podanego kodu języka, zostanie on zignorowany. Ten parametr nie jest obsługiwany przez modele multilingual_v2.
Ustawienia sterujące generowaniem dialogu.
Tekst bezpośrednio poprzedzający tę generację, używany do zapewnienia ciągłości prozodycznej. Można wysłać maksymalnie 100 znaków. Nie jest obsługiwane przez każdy model.
Tekst bezpośrednio po tej generacji, używany do zapewnienia modelowi ciągłości prozodycznej. Można wysłać maksymalnie 100 znaków. Nie jest obsługiwany przez każdy model.
Lista lokalizatorów słowników wymowy (id, version_id), które zostaną zastosowane do tekstu. Będą stosowane po kolei. W jednym żądaniu możesz podać do 3 lokalizatorów
Jeśli podano, nasz system dołoży starań, by generowanie było deterministyczne, więc powtarzane żądania z tym samym seedem i parametrami powinny zwracać ten sam wynik. Determinizm nie jest gwarantowany. Musi być liczbą całkowitą od 0 do 4294967295.
Ten parametr kontroluje normalizację tekstu w trzech trybach: „auto”, „on” i „off”. W trybie „auto” system automatycznie zdecyduje, czy zastosować normalizację tekstu, np. zapisywanie liczb słownie. W trybie „on” normalizacja tekstu będzie zawsze stosowana, a w trybie „off” zostanie pominięta.
Czy używać wersji IVC profesjonalnego głosu. Może to poprawić ekspresję i zmniejszyć opóźnienie.
Lista request_ids generacji dialogu poprzedzających tę generację. Służy do zapewnienia ciągłości modelu przy dzieleniu dużego zadania na kilka żądań. Możesz wysłać maksymalnie 3 request_ids. Ostatni request_id oznacza audio najbliższe bieżącemu żądaniu. Nie jest obsługiwane przez każdy model.
Lista request_ids generacji dialogu następujących po tej generacji. Przydatna do zachowania ciągłości podczas ponownego generowania klipu w środku sekwencji. Możesz wysłać maksymalnie 3 request_ids. Pierwszy request_id oznacza audio najbliższe bieżącemu żądaniu. Nie jest obsługiwane przez każdy model.
Odpowiedź
Dane audio przesyłane strumieniowo