Dialog erstellen
Wandelt eine Liste von Text- und Stimm-ID-Paaren in Sprache (Dialog) um und gibt Audio zurück.
Header
Abfrageparameter
Wenn enable_logging auf false gesetzt ist, wird für die Anfrage der Zero-Retention-Modus verwendet. Dadurch sind Verlaufsfunktionen für diese Anfrage nicht verfügbar, einschließlich Request Stitching. Der Zero-Retention-Modus darf nur von Enterprise-Kunden verwendet werden.
Anfrage
Eine Liste von Dialogeingaben, die jeweils Text und eine Stimme-ID enthalten, die in Sprache umgewandelt werden. Die maximale Anzahl eindeutiger Stimme-IDs beträgt 10. Halten Sie für eine zuverlässige Generierung die Gesamtzeichenzahl aller inputs[].text-Werte pro Anfrage bei höchstens 2.000 Zeichen. Längere Anfragen können bei Streaming-Antworten vorzeitig enden oder einen Validierungsfehler zurückgeben.
Kennung des zu verwendenden Modells. Sie können Modelle mit GET /v1/models abfragen. Das Modell muss Text to Speech unterstützen. Dies können Sie über die Eigenschaft can_do_text_to_speech prüfen.
Sprachcode (ISO 639-1), mit dem eine Sprache für das Modell und die Textnormalisierung erzwungen wird. Unterstützt das Modell den angegebenen Sprachcode nicht, wird er ignoriert. Dieser Parameter wird für multilingual_v2-Modelle nicht unterstützt.
Der Text, der dieser Generierung unmittelbar vorausgeht und zur Konditionierung des Modells für prosodische Kontinuität verwendet wird. Es können maximal 100 Zeichen gesendet werden. Nicht von jedem Modell unterstützt.
Der Text, der unmittelbar auf diese Generierung folgt und zur Konditionierung des Modells für prosodische Kontinuität verwendet wird. Es können maximal 100 Zeichen gesendet werden. Nicht von jedem Modell unterstützt.
Eine Liste von Aussprachewörterbuch-Referenzen (id, version_id), die auf den Text angewendet werden. Sie werden der Reihe nach angewendet. Pro Anfrage sind bis zu 3 Referenzen möglich.
Falls angegeben, bemüht sich unser System um eine deterministische Generierung, sodass wiederholte Anfragen mit demselben Seed und denselben Parametern dasselbe Ergebnis liefern sollten. Determinismus wird nicht garantiert. Muss eine Ganzzahl zwischen 0 und 4294967295 sein.
Dieser Parameter steuert die Textnormalisierung mit drei Modi: ‘auto’, ‘on’ und ‘off’. Bei ‘auto’ entscheidet das System automatisch, ob die Textnormalisierung angewendet wird, z. B. zum Ausschreiben von Zahlen. Bei ‘on’ wird die Textnormalisierung immer angewendet, bei ‘off’ übersprungen.
Eine Liste der request_ids von Dialoggenerierungen vor dieser Generierung. Wird verwendet, um das Modell auf Kontinuität zu konditionieren, wenn eine große Aufgabe auf mehrere Anfragen aufgeteilt wird. Es können maximal 3 request_ids gesendet werden. Die letzte request_id ist das Audio, das der aktuellen Anfrage am nächsten liegt. Wird nicht von jedem Modell unterstützt.
Eine Liste der request_ids von Dialoggenerierungen nach dieser Generierung. Hilfreich, um die Kontinuität beizubehalten, wenn ein Clip in der Mitte einer Sequenz neu generiert wird. Es können maximal 3 request_ids gesendet werden. Die erste request_id ist das Audio, das der aktuellen Anfrage am nächsten liegt. Wird nicht von jedem Modell unterstützt.