Zaprojektuj głos.
Zaprojektuj głos.
Zaprojektuj głos za pomocą promptu. Ta metoda zwraca listę podglądów głosu. Każdy podgląd ma generated_voice_id oraz próbkę głosu jako dźwięk mp3 zakodowany w base64. Aby utworzyć głos, użyj generated_voice_id wybranego podglądu z endpointem /v1/text-to-voice.
Nagłówki
Parametry zapytania
Żądanie
Opis dla utworzonego głosu.
Model do użycia do generowania głosu. Możliwe wartości: eleven_multilingual_ttv_v2, eleven_ttv_v3.
Tekst do wygenerowania musi mieć od 100 do 1000 znaków.
Czy automatycznie generować tekst odpowiedni do opisu głosu.
Określa poziom głośności wygenerowanego głosu. -1 oznacza najciszej, 1 najgłośniej, a 0 odpowiada około -24 LUFS.
Liczba losowa sterująca generowaniem głosu. Ten sam seed przy tych samych danych wejściowych daje ten sam głos.
Określa, jak ściśle AI podąża za promptem. Niższe wartości dają AI większą swobodę twórczą, a wyższe zmuszają ją do bliższego trzymania się promptu. Wysokie wartości mogą sprawić, że głos zabrzmi sztucznie lub robotycznie. Przy niższej wartości Guidance Scale zalecamy używać dłuższych, bardziej szczegółowych promptów.
Określa, czy podglądy Text to Voice mają być uwzględnione w odpowiedzi. Jeśli wartość to true, zwrócone zostaną tylko wygenerowane identyfikatory, które można następnie przesyłać strumieniowo przez endpoint /v1/text-to-voice/:generated_voice_id/stream.
Czy ulepszać opis głosu za pomocą AI, by dodać więcej szczegółów i poprawić jakość generowania głosu. Po włączeniu system automatycznie rozwinie proste prompty w bardziej szczegółowe opisy głosu. Domyślnie False
ID iteracji sesji remiksowania, do której należy dołączyć te generacje. Jeśli nie zostanie podane, zostanie utworzona nowa iteracja.
Wyższa jakość daje lepszy głos, ale mniejszą różnorodność.
Audio referencyjne do użycia przy generowaniu głosu. Audio powinno być zakodowane w base64. Obsługiwane tylko przy użyciu modelu eleven_ttv_v3.
Określa równowagę między promptem a referencyjnym audio podczas generowania próbek głosu. 0 oznacza niemal brak wpływu promptu, a 1 — niemal brak wpływu referencyjnego audio. Obsługiwane tylko przez model eleven_ttv_v3.
Odpowiedź
Pomyślna odpowiedź
Podglądy wygenerowanych głosów.
Tekst używany do podglądu głosów.