Sprache mit Zeitstempeln streamen
Wandelt Text mit einer Stimme Ihrer Wahl in Sprache um und gibt einen Stream von JSON-Objekten zurück, die Audio als Base64-codierten String sowie Informationen dazu enthalten, wann welches Zeichen gesprochen wurde.
Pfadparameter
ID der zu verwendenden Stimme. Mit dem Endpunkt Get voices können Sie alle verfügbaren Stimmen auflisten.
Header
Abfrageparameter
Wenn enable_logging auf false gesetzt ist, wird für die Anfrage der Zero-Retention-Modus verwendet. Dadurch sind Verlaufsfunktionen für diese Anfrage nicht verfügbar, einschließlich Request Stitching. Der Zero-Retention-Modus darf nur von Enterprise-Kunden verwendet werden.
Anfrage
Kennung des zu verwendenden Modells. Sie können Modelle mit GET /v1/models abfragen. Das Modell muss Text to Speech unterstützen. Dies können Sie über die Eigenschaft can_do_text_to_speech prüfen.
Sprachcode (ISO 639-1), mit dem eine Sprache für das Modell und die Textnormalisierung erzwungen wird. Unterstützt das Modell den angegebenen Sprachcode nicht, wird er ignoriert. Dieser Parameter wird für multilingual_v2-Modelle nicht unterstützt.
Stimmeneinstellungen, die gespeicherte Einstellungen für die angegebene Stimme überschreiben. Sie werden nur auf die angegebene Anfrage angewendet.
Eine Liste von Aussprachewörterbuch-Referenzen (id, version_id), die auf den Text angewendet werden. Sie werden der Reihe nach angewendet. Pro Anfrage sind bis zu 3 Referenzen möglich.
Falls angegeben, bemüht sich unser System um eine deterministische Generierung, sodass wiederholte Anfragen mit demselben Seed und denselben Parametern dasselbe Ergebnis liefern sollten. Determinismus wird nicht garantiert. Muss eine Ganzzahl zwischen 0 und 4294967295 sein.
Der Text vor dem Text der aktuellen Anfrage. Kann verwendet werden, um die Kontinuität der Sprache beim Zusammenfügen mehrerer Generierungen zu verbessern oder die Kontinuität der Sprache in der aktuellen Generierung zu beeinflussen.
Der Text nach dem Text der aktuellen Anfrage. Kann verwendet werden, um die Kontinuität der Sprache beim Zusammenfügen mehrerer Generierungen zu verbessern oder die Kontinuität der Sprache in der aktuellen Generierung zu beeinflussen.
Eine Liste der request_id von Samples, die vor dieser Generierung erstellt wurden. Kann verwendet werden, um die Kontinuität der Sprache zu verbessern, wenn eine große Aufgabe auf mehrere Anfragen aufgeteilt wird. Die besten Ergebnisse erzielen Sie, wenn für alle Generierungen dasselbe Modell verwendet wird. Wenn sowohl previous_text als auch previous_request_ids gesendet werden, wird previous_text ignoriert. Es können maximal 3 request_ids gesendet werden.
Eine Liste der request_id von Samples, die auf diese Generierung folgen. next_request_ids ist besonders hilfreich, um die Kontinuität der Sprache beizubehalten, wenn ein Sample mit Problemen bei der Audioqualität neu generiert wird. Wenn Sie beispielsweise 3 Sprachclips generiert haben und Clip 2 verbessern möchten, hilft die Übergabe der Request-ID von Clip 3 als next_request_id und die von Clip 1 als previous_request_id dabei, einen natürlichen Fluss in der kombinierten Sprache beizubehalten. Die besten Ergebnisse erzielen Sie, wenn für alle Generierungen dasselbe Modell verwendet wird. Wenn sowohl next_text als auch next_request_ids gesendet werden, wird next_text ignoriert. Es können maximal 3 request_ids gesendet werden.
Dieser Parameter steuert die Textnormalisierung mit drei Modi: ‘auto’, ‘on’ und ‘off’. Bei ‘auto’ entscheidet das System automatisch, ob die Textnormalisierung angewendet wird, z. B. zum Ausschreiben von Zahlen. Bei ‘on’ wird die Textnormalisierung immer angewendet, bei ‘off’ übersprungen.
Dieser Parameter steuert die sprachspezifische Textnormalisierung. Sie unterstützt die korrekte Aussprache von Text in einigen unterstützten Sprachen. WARNUNG: Dieser Parameter kann die Latenz der Anfrage erheblich erhöhen. Derzeit nur für Japanisch unterstützt.
Antwort
Stream von Transkriptionsblöcken
Base64-kodierte Audiodaten
Zeitstempelinformationen für jedes Zeichen im Originaltext
Zeitstempelinformationen für jedes Zeichen im normalisierten Text