Stimme gestalten.

Erstellen Sie eine Stimme über einen Prompt. Diese Methode gibt eine Liste von Stimmvorschauen zurück. Jede Vorschau enthält eine generated_voice_id und ein Stimmbeispiel als base64-kodiertes MP3-Audio. Um eine Stimme zu erstellen, verwenden Sie die generated_voice_id der gewünschten Vorschau mit dem Endpunkt /v1/text-to-voice.

Header

xi-api-keystringOptional

Abfrageparameter

output_formatenumOptional
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Anfrage

This endpoint expects an object.
voice_descriptionstringErforderlich20-1000 characters

Beschreibung für die erstellte Stimme.

model_idenumOptionalStandardwert ist eleven_multilingual_ttv_v2

Modell für die Stimmgenerierung. Mögliche Werte: eleven_multilingual_ttv_v2, eleven_ttv_v3.

Erlaubte Werte:
textstring or nullOptional100-1000 characters

Zu generierender Text; die Textlänge muss zwischen 100 und 1000 liegen.

auto_generate_textbooleanOptionalStandardwert ist false

Ob automatisch ein für die Stimmbeschreibung geeigneter Text erstellt werden soll.

loudnessdoubleOptional-1-1Standardwert ist 0.5

Steuert die Lautstärke der generierten Stimme. -1 ist am leisesten, 1 am lautesten, 0 entspricht etwa -24 LUFS.

seedinteger or nullOptional0-2147483647
Zufallszahl zur Steuerung der Stimmgenerierung. Derselbe Seed mit denselben Eingaben erzeugt dieselbe Stimme.
guidance_scaledoubleOptional0-100Standardwert ist 5

Steuert, wie genau die KI dem Prompt folgt. Niedrigere Werte geben der KI mehr kreative Freiheit, höhere Werte zwingen sie, sich stärker an den Prompt zu halten. Hohe Werte können die Stimme künstlich oder roboterhaft klingen lassen. Bei niedrigerer Guidance Scale empfehlen wir längere, detailliertere Prompts.

stream_previewsbooleanOptionalStandardwert ist false

Legt fest, ob die Text-to-Voice-Vorschauen in die Antwort aufgenommen werden sollen. Bei true werden nur die generierten IDs zurückgegeben, die dann über den Endpunkt /v1/text-to-voice/:generated_voice_id/stream gestreamt werden können.

should_enhancebooleanOptionalStandardwert ist false

Ob die Stimmbeschreibung mithilfe von KI erweitert werden soll, um mehr Details hinzuzufügen und die Qualität der Stimmgenerierung zu verbessern. Wenn aktiviert, erweitert das System einfache Prompts automatisch zu detaillierteren Stimmbeschreibungen. Standardmäßig False.

remixing_session_idstring or nullOptional

Die ID der Remixing-Sitzung.

remixing_session_iteration_idstring or nullOptional

Die ID der Iteration der Remixing-Sitzung, der diese Generierungen zugeordnet werden sollen. Wenn nicht angegeben, wird eine neue Iteration erstellt.

qualitydouble or nullOptional-1-1

Höhere Qualität führt zu besserer Sprachausgabe, aber weniger Vielfalt.

reference_audio_base64string or nullOptional

Referenzaudio für die Stimmgenerierung. Das Audio muss base64-codiert sein. Nur bei Verwendung des Modells eleven_ttv_v3 unterstützt.

prompt_strengthdouble or nullOptional0-1

Steuert das Verhältnis zwischen Prompt und Referenz-Audio bei der Generierung von Stimmproben. 0 bedeutet fast keinen Prompt-Einfluss, 1 bedeutet fast keinen Einfluss des Referenz-Audios. Wird nur vom Modell eleven_ttv_v3 unterstützt.

Antwort

Erfolgreiche Antwort
previewslist of objects
Die Vorschauen der generierten Stimmen.
textstring

Der für die Stimmvorschau verwendete Text.

Fehler

409
Conflict Error
422
Unprocessable Entity Error