Zaprojektuj głos.

Zaprojektuj głos za pomocą promptu. Ta metoda zwraca listę podglądów głosu. Każdy podgląd ma generated_voice_id oraz próbkę głosu jako dźwięk mp3 zakodowany w base64. Aby utworzyć głos, użyj generated_voice_id wybranego podglądu z endpointem /v1/text-to-voice.

Nagłówki

xi-api-keystringOpcjonalny

Parametry zapytania

output_formatenumOpcjonalny
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Żądanie

This endpoint expects an object.
voice_descriptionstringWymagany20-1000 characters

Opis dla utworzonego głosu.

model_idenumOpcjonalnyDomyślnie eleven_multilingual_ttv_v2

Model do użycia do generowania głosu. Możliwe wartości: eleven_multilingual_ttv_v2, eleven_ttv_v3.

Dozwolone wartości:
textstring or nullOpcjonalny100-1000 characters

Tekst do wygenerowania musi mieć od 100 do 1000 znaków.

auto_generate_textbooleanOpcjonalnyDomyślnie false

Czy automatycznie generować tekst odpowiedni do opisu głosu.

loudnessdoubleOpcjonalny-1-1Domyślnie 0.5

Określa poziom głośności wygenerowanego głosu. -1 oznacza najciszej, 1 najgłośniej, a 0 odpowiada około -24 LUFS.

seedinteger or nullOpcjonalny0-2147483647

Liczba losowa sterująca generowaniem głosu. Ten sam seed przy tych samych danych wejściowych daje ten sam głos.

guidance_scaledoubleOpcjonalny0-100Domyślnie 5

Określa, jak ściśle AI podąża za promptem. Niższe wartości dają AI większą swobodę twórczą, a wyższe zmuszają ją do bliższego trzymania się promptu. Wysokie wartości mogą sprawić, że głos zabrzmi sztucznie lub robotycznie. Przy niższej wartości Guidance Scale zalecamy używać dłuższych, bardziej szczegółowych promptów.

stream_previewsbooleanOpcjonalnyDomyślnie false

Określa, czy podglądy Text to Voice mają być uwzględnione w odpowiedzi. Jeśli wartość to true, zwrócone zostaną tylko wygenerowane identyfikatory, które można następnie przesyłać strumieniowo przez endpoint /v1/text-to-voice/:generated_voice_id/stream.

should_enhancebooleanOpcjonalnyDomyślnie false

Czy ulepszać opis głosu za pomocą AI, by dodać więcej szczegółów i poprawić jakość generowania głosu. Po włączeniu system automatycznie rozwinie proste prompty w bardziej szczegółowe opisy głosu. Domyślnie False

remixing_session_idstring or nullOpcjonalny
ID sesji remiksowania.
remixing_session_iteration_idstring or nullOpcjonalny

ID iteracji sesji remiksowania, do której należy dołączyć te generacje. Jeśli nie zostanie podane, zostanie utworzona nowa iteracja.

qualitydouble or nullOpcjonalny-1-1

Wyższa jakość daje lepszy głos, ale mniejszą różnorodność.

reference_audio_base64string or nullOpcjonalny

Audio referencyjne do użycia przy generowaniu głosu. Audio powinno być zakodowane w base64. Obsługiwane tylko przy użyciu modelu eleven_ttv_v3.

prompt_strengthdouble or nullOpcjonalny0-1

Określa równowagę między promptem a referencyjnym audio podczas generowania próbek głosu. 0 oznacza niemal brak wpływu promptu, a 1 — niemal brak wpływu referencyjnego audio. Obsługiwane tylko przez model eleven_ttv_v3.

Odpowiedź

Pomyślna odpowiedź

previewslist of objects

Podglądy wygenerowanych głosów.

textstring

Tekst używany do podglądu głosów.

Błędy

409
Conflict Error
422
Unprocessable Entity Error