Zremiksuj głos.

Stwórz remix istniejącego głosu za pomocą promptu. Ta metoda zwraca listę podglądów głosu. Każdy podgląd zawiera generated_voice_id i próbkę głosu jako audio MP3 zakodowane w base64. Aby utworzyć głos, użyj generated_voice_id wybranego podglądu z endpointem /v1/text-to-voice.

Parametry ścieżki

voice_idstringWymagany
Voice ID to be used, you can use https://api.elevenlabs.io/v1/voices to list all the available voices.

Nagłówki

xi-api-keystringOpcjonalny

Parametry zapytania

output_formatenumOpcjonalny
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Żądanie

This endpoint expects an object.
voice_descriptionstringWymagany5-1000 characters

Opis zmian, które należy wprowadzić w głosie.

textstring or nullOpcjonalny100-1000 characters

Tekst do wygenerowania musi mieć od 100 do 1000 znaków.

auto_generate_textbooleanOpcjonalnyDomyślnie false

Czy automatycznie generować tekst odpowiedni do opisu głosu.

loudnessdoubleOpcjonalny-1-1Domyślnie 0.5

Określa poziom głośności wygenerowanego głosu. -1 oznacza najciszej, 1 najgłośniej, a 0 odpowiada około -24 LUFS.

seedinteger or nullOpcjonalny0-2147483647

Liczba losowa sterująca generowaniem głosu. Ten sam seed przy tych samych danych wejściowych daje ten sam głos.

guidance_scaledoubleOpcjonalny0-100Domyślnie 2

Określa, jak ściśle AI podąża za promptem. Niższe wartości dają AI większą swobodę twórczą, a wyższe zmuszają ją do bliższego trzymania się promptu. Wysokie wartości mogą sprawić, że głos zabrzmi sztucznie lub robotycznie. Przy niższej wartości Guidance Scale zalecamy używać dłuższych, bardziej szczegółowych promptów.

stream_previewsbooleanOpcjonalnyDomyślnie false

Określa, czy podglądy Text to Voice mają być uwzględnione w odpowiedzi. Jeśli wartość to true, zwrócone zostaną tylko wygenerowane identyfikatory, które można następnie przesyłać strumieniowo przez endpoint /v1/text-to-voice/:generated_voice_id/stream.

remixing_session_idstring or nullOpcjonalny
ID sesji remiksowania.
remixing_session_iteration_idstring or nullOpcjonalny

ID iteracji sesji remiksowania, do której należy dołączyć te generacje. Jeśli nie zostanie podane, zostanie utworzona nowa iteracja.

prompt_strengthdouble or nullOpcjonalny0-1

Określa równowagę między promptem a referencyjnym audio podczas generowania próbek głosu. 0 oznacza niemal brak wpływu promptu, a 1 — niemal brak wpływu referencyjnego audio. Obsługiwane tylko przez model eleven_ttv_v3.

Odpowiedź

Pomyślna odpowiedź

previewslist of objects

Podglądy wygenerowanych głosów.

textstring

Tekst używany do podglądu głosów.

Błędy

409
Conflict Error
422
Unprocessable Entity Error