Strumieniuj mowę z informacją o czasie
Strumieniuj mowę z informacją o czasie
Zamienia tekst na mowę przy użyciu wybranego głosu i zwraca strumień obiektów JSON zawierających audio jako ciąg zakodowany w base64 wraz z informacją o tym, kiedy wypowiedziano który znak.
Parametry ścieżki
ID głosu do użycia. Wszystkie dostępne głosy możesz wyświetlić za pomocą endpointu Pobierz głosy.
Nagłówki
Parametry zapytania
Gdy enable_logging ma wartość false, dla żądania zostanie użyty tryb zerowej retencji. Funkcje historii, w tym łączenie żądań, będą niedostępne dla tego żądania. Z trybu zerowej retencji mogą korzystać tylko klienci Enterprise.
Żądanie
Tekst, który zostanie przekształcony w mowę.
Identyfikator modelu, który zostanie użyty. Możesz sprawdzić dostępne modele za pomocą GET /v1/models. Model musi obsługiwać zamianę tekstu na mowę, co możesz sprawdzić we właściwości can_do_text_to_speech.
Kod języka (ISO 639-1) używany do wymuszenia języka modelu i normalizacji tekstu. Jeśli model nie obsługuje podanego kodu języka, zostanie on zignorowany. Ten parametr nie jest obsługiwany przez modele multilingual_v2.
Ustawienia głosu nadpisujące zapisane ustawienia danego głosu. Są stosowane tylko w tym żądaniu.
Lista lokalizatorów słowników wymowy (id, version_id), które zostaną zastosowane do tekstu. Będą stosowane po kolei. W jednym żądaniu możesz podać do 3 lokalizatorów
Jeśli podano, nasz system dołoży starań, by generowanie było deterministyczne, więc powtarzane żądania z tym samym seedem i parametrami powinny zwracać ten sam wynik. Determinizm nie jest gwarantowany. Musi być liczbą całkowitą od 0 do 4294967295.
Tekst poprzedzający tekst bieżącego żądania. Może poprawić ciągłość mowy przy łączeniu wielu generacji lub wpłynąć na ciągłość mowy w bieżącej generacji.
Tekst następujący po tekście bieżącego żądania. Może poprawić ciągłość mowy przy łączeniu wielu generacji lub wpłynąć na ciągłość mowy w bieżącej generacji.
Lista request_id próbek wygenerowanych przed tą generacją. Można jej użyć, aby poprawić ciągłość mowy przy dzieleniu dużego zadania na kilka żądań. Najlepsze wyniki uzyskasz, używając tego samego modelu dla wszystkich generacji. Jeśli wyślesz zarówno previous_text, jak i previous_request_ids, previous_text zostanie zignorowane. Możesz wysłać maksymalnie 3 request_ids.
Lista request_id próbek następujących po tej generacji. next_request_ids jest szczególnie przydatne do zachowania ciągłości mowy podczas ponownego generowania próbki z problemami z jakością audio. Na przykład, jeśli wygenerowano 3 klipy mowy i chcesz poprawić klip 2, przekazanie identyfikatora żądania klipu 3 jako next_request_id (oraz klipu 1 jako previous_request_id) pomoże zachować naturalny tok połączonej mowy. Najlepsze wyniki uzyskasz, używając tego samego modelu dla wszystkich generacji. Jeśli wyślesz zarówno next_text, jak i next_request_ids, next_text zostanie zignorowane. Możesz wysłać maksymalnie 3 request_ids.
Czy używać wersji IVC profesjonalnego głosu. Może to poprawić ekspresję i zmniejszyć opóźnienie.
Ten parametr kontroluje normalizację tekstu w trzech trybach: „auto”, „on” i „off”. W trybie „auto” system automatycznie zdecyduje, czy zastosować normalizację tekstu, np. zapisywanie liczb słownie. W trybie „on” normalizacja tekstu będzie zawsze stosowana, a w trybie „off” zostanie pominięta.
Ten parametr kontroluje normalizację tekstu dla języka. Pomaga w poprawnej wymowie tekstu w niektórych obsługiwanych językach. OSTRZEŻENIE: ten parametr może znacznie zwiększyć opóźnienie żądania. Obecnie obsługiwany tylko dla języka japońskiego.
Odpowiedź
Strumień fragmentów transkrypcji
Informacje o znacznikach czasu dla każdego znaku w oryginalnym tekście
Informacje o znacznikach czasu dla każdego znaku w znormalizowanym tekście