Dialog erstellen

Wandelt eine Liste von Text- und Stimm-ID-Paaren in Sprache (Dialog) um und gibt Audio zurück.

Header

xi-api-keystringOptional

Abfrageparameter

output_formatenumOptionalStandardwert ist mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
enable_loggingbooleanOptionalStandardwert ist true

Wenn enable_logging auf false gesetzt ist, wird für die Anfrage der Zero-Retention-Modus verwendet. Dadurch sind Verlaufsfunktionen für diese Anfrage nicht verfügbar, einschließlich Request Stitching. Der Zero-Retention-Modus darf nur von Enterprise-Kunden verwendet werden.

Anfrage

This endpoint expects an object.
inputslist of objectsErforderlich

Eine Liste von Dialogeingaben, die jeweils Text und eine Stimme-ID enthalten, die in Sprache umgewandelt werden. Die maximale Anzahl eindeutiger Stimme-IDs beträgt 10. Halten Sie für eine zuverlässige Generierung die Gesamtzeichenzahl aller inputs[].text-Werte pro Anfrage bei höchstens 2.000 Zeichen. Längere Anfragen können bei Streaming-Antworten vorzeitig enden oder einen Validierungsfehler zurückgeben.

model_idstringOptionalStandardwert ist eleven_v3

Kennung des zu verwendenden Modells. Sie können Modelle mit GET /v1/models abfragen. Das Modell muss Text to Speech unterstützen. Dies können Sie über die Eigenschaft can_do_text_to_speech prüfen.

language_codestring or nullOptional

Sprachcode (ISO 639-1), mit dem eine Sprache für das Modell und die Textnormalisierung erzwungen wird. Unterstützt das Modell den angegebenen Sprachcode nicht, wird er ignoriert. Dieser Parameter wird für multilingual_v2-Modelle nicht unterstützt.

settingsobject or nullOptional
Einstellungen zur Steuerung der Dialoggenerierung.
previous_textstring or nullOptional<=100 characters

Der Text, der dieser Generierung unmittelbar vorausgeht und zur Konditionierung des Modells für prosodische Kontinuität verwendet wird. Es können maximal 100 Zeichen gesendet werden. Nicht von jedem Modell unterstützt.

future_textstring or nullOptional<=100 characters

Der Text, der unmittelbar auf diese Generierung folgt und zur Konditionierung des Modells für prosodische Kontinuität verwendet wird. Es können maximal 100 Zeichen gesendet werden. Nicht von jedem Modell unterstützt.

pronunciation_dictionary_locatorslist of objects or nullOptional

Eine Liste von Aussprachewörterbuch-Referenzen (id, version_id), die auf den Text angewendet werden. Sie werden der Reihe nach angewendet. Pro Anfrage sind bis zu 3 Referenzen möglich.

seedinteger or nullOptional

Falls angegeben, bemüht sich unser System um eine deterministische Generierung, sodass wiederholte Anfragen mit demselben Seed und denselben Parametern dasselbe Ergebnis liefern sollten. Determinismus wird nicht garantiert. Muss eine Ganzzahl zwischen 0 und 4294967295 sein.

apply_text_normalizationenumOptionalStandardwert ist auto

Dieser Parameter steuert die Textnormalisierung mit drei Modi: ‘auto’, ‘on’ und ‘off’. Bei ‘auto’ entscheidet das System automatisch, ob die Textnormalisierung angewendet wird, z. B. zum Ausschreiben von Zahlen. Bei ‘on’ wird die Textnormalisierung immer angewendet, bei ‘off’ übersprungen.

Erlaubte Werte:
use_pvc_as_ivcbooleanOptionalStandardwert ist false
Whether to use the IVC version of a professional voice. This may improve expressiveness and reduce latency.
previous_request_idslist of strings or nullOptional

Eine Liste der request_ids von Dialoggenerierungen vor dieser Generierung. Wird verwendet, um das Modell auf Kontinuität zu konditionieren, wenn eine große Aufgabe auf mehrere Anfragen aufgeteilt wird. Es können maximal 3 request_ids gesendet werden. Die letzte request_id ist das Audio, das der aktuellen Anfrage am nächsten liegt. Wird nicht von jedem Modell unterstützt.

next_request_idslist of strings or nullOptional

Eine Liste der request_ids von Dialoggenerierungen nach dieser Generierung. Hilfreich, um die Kontinuität beizubehalten, wenn ein Clip in der Mitte einer Sequenz neu generiert wird. Es können maximal 3 request_ids gesendet werden. Die erste request_id ist das Audio, das der aktuellen Anfrage am nächsten liegt. Wird nicht von jedem Modell unterstützt.

Antwort

Die generierte Audiodatei

Fehler

422
Unprocessable Entity Error