Stimme gestalten.
Erstellen Sie eine Stimme über einen Prompt. Diese Methode gibt eine Liste von Stimmvorschauen zurück. Jede Vorschau enthält eine generated_voice_id und ein Stimmbeispiel als base64-kodiertes MP3-Audio. Um eine Stimme zu erstellen, verwenden Sie die generated_voice_id der gewünschten Vorschau mit dem Endpunkt /v1/text-to-voice.
Header
Abfrageparameter
Anfrage
Beschreibung für die erstellte Stimme.
Modell für die Stimmgenerierung. Mögliche Werte: eleven_multilingual_ttv_v2, eleven_ttv_v3.
Zu generierender Text; die Textlänge muss zwischen 100 und 1000 liegen.
Ob automatisch ein für die Stimmbeschreibung geeigneter Text erstellt werden soll.
Steuert die Lautstärke der generierten Stimme. -1 ist am leisesten, 1 am lautesten, 0 entspricht etwa -24 LUFS.
Steuert, wie genau die KI dem Prompt folgt. Niedrigere Werte geben der KI mehr kreative Freiheit, höhere Werte zwingen sie, sich stärker an den Prompt zu halten. Hohe Werte können die Stimme künstlich oder roboterhaft klingen lassen. Bei niedrigerer Guidance Scale empfehlen wir längere, detailliertere Prompts.
Legt fest, ob die Text-to-Voice-Vorschauen in die Antwort aufgenommen werden sollen. Bei true werden nur die generierten IDs zurückgegeben, die dann über den Endpunkt /v1/text-to-voice/:generated_voice_id/stream gestreamt werden können.
Ob die Stimmbeschreibung mithilfe von KI erweitert werden soll, um mehr Details hinzuzufügen und die Qualität der Stimmgenerierung zu verbessern. Wenn aktiviert, erweitert das System einfache Prompts automatisch zu detaillierteren Stimmbeschreibungen. Standardmäßig False.
Die ID der Remixing-Sitzung.
Die ID der Iteration der Remixing-Sitzung, der diese Generierungen zugeordnet werden sollen. Wenn nicht angegeben, wird eine neue Iteration erstellt.
Höhere Qualität führt zu besserer Sprachausgabe, aber weniger Vielfalt.
Referenzaudio für die Stimmgenerierung. Das Audio muss base64-codiert sein. Nur bei Verwendung des Modells eleven_ttv_v3 unterstützt.
Steuert das Verhältnis zwischen Prompt und Referenz-Audio bei der Generierung von Stimmproben. 0 bedeutet fast keinen Prompt-Einfluss, 1 bedeutet fast keinen Einfluss des Referenz-Audios. Wird nur vom Modell eleven_ttv_v3 unterstützt.
Antwort
Der für die Stimmvorschau verwendete Text.