Transkriptbearbeitung
Dieser Leitfaden zeigt, wie Sie Transkripte mit natürlichsprachigen Anweisungen über die Speech to Text API bearbeiten.
Anleitung · Setzt voraus, dass Sie den Speech to Text Schnellstart abgeschlossen haben.
Überblick
Die Bearbeitung von Transkripten ist eine experimentelle Funktion und verursacht zusätzliche Kosten von 30 % auf die grundlegenden Transkriptionskosten. Pro Anfrage werden mindestens 10 Sekunden Audio abgerechnet. Ausführliche Preisinformationen finden Sie auf der API-Preisseite.
Mit der Transkriptbearbeitung können Sie einer Transkriptionsanfrage eine Anweisung in natürlicher Sprache hinzufügen. Nachdem das Audio transkribiert wurde, wird Ihre Anweisung auf das Transkript angewendet. Der bearbeitete Text wird zusammen mit dem Original zurückgegeben.
Dadurch entfällt ein separater Nachbearbeitungsschritt in Ihrer eigenen Pipeline. Typische Anwendungsfälle sind die Vereinheitlichung der Schreibweise von Daten, Uhrzeiten oder Einheiten, das Ausschreiben von Abkürzungen, das Entfernen nicht benötigter Inhalte, die Anwendung eines anderen Stils oder Tons oder die Neuformatierung des Transkripts.
Wenn Sie beispielsweise eine Voicemail mit der Anweisung Write all dates in ISO 8601 format (YYYY-MM-DD) transkribieren, erhalten Sie beide Textversionen:
Die Felder text und words beschreiben immer das ursprüngliche Transkript. Die bearbeitete Version wird separat in edited_transcript zurückgegeben.
Transkriptbearbeitung integrieren
Die Transkriptbearbeitung wird in die Speech to Text API integriert, indem Sie den Parameter transcript_edit an die Methode convert übergeben. Die Anweisung darf bis zu 2.000 Zeichen lang sein.
Die Transkriptbearbeitung funktioniert sowohl mit synchronen Anfragen als auch mit Webhook-Anfragen. Bei Webhook-Anfragen ist edited_transcript im Objekt transcription der Webhook-Payload enthalten.
Scribe v2 Realtime unterstützt dieselben Anweisungen für jedes bestätigte Transkript. Weitere Informationen finden Sie im Leitfaden zur Transkriptbearbeitung in Echtzeit.
Anweisungen formulieren
Die Anweisung wird auf das gesamte Transkript angewendet, wo sie relevant ist, und jede passende Stelle wird bearbeitet, nicht nur die erste. Eine Anweisung kann bestimmte Wörter oder Ausdrücke ändern und alles andere unverändert lassen. Sie kann auch den gesamten Text umschreiben oder mit Anmerkungen versehen. Eine einzelne Anweisung kann mehrere Bearbeitungen kombinieren.
Die folgenden Beispiele zeigen die Bandbreite unterstützter Anweisungen:
Einige Anpassungen haben eigene Parameter, die günstiger und vorhersehbarer sind als eine
Bearbeitungsanweisung. Verwenden Sie Keyterm
Prompting, um die
Erkennung auf bestimmte Namen und Begriffe auszurichten, no_verbatim, um Füllwörter und
Sprechunflüssigkeiten zu entfernen, und numbers_format (falls unterstützt), um zwischen Ziffern
und Wörtern zu wählen. Nutzen Sie die Transkriptbearbeitung für Änderungen, die diese Optionen nicht abdecken.
Beachten Sie beim Formulieren von Anweisungen Folgendes:
- Beschreiben Sie die gewünschte Ausgabe genau.
Write all dates in ISO 8601 format (YYYY-MM-DD)ist zuverlässiger alsfix the dates. - Die Anweisung kann in jeder Sprache geschrieben werden, wobei Anweisungen auf Englisch am besten funktionieren. Das bearbeitete Transkript bleibt in der Sprache des Originals.
- Es wird nur die Anweisung ausgeführt. Im Audio gesprochene Inhalte werden als Daten behandelt und können nicht beeinflussen, wie die Anweisung angewendet wird.
- Wenn die Anweisung nichts im Transkript betrifft, ist das bearbeitete Transkript mit dem Original identisch.
Antwortformat
Wenn transcript_edit gesetzt ist, enthält die Antwort ein Objekt edited_transcript. Dessen Feld kind gibt an, ob die Bearbeitung erfolgreich war:
Das Feld fehlt, wenn kein transcript_edit angefordert wurde.
Folgendes sollten Sie beachten:
- Das bearbeitete Transkript ist Klartext. Zeitstempel auf Wortebene, Sprecherbezeichnungen und
additional_formatsbeschreiben weiterhin das ursprüngliche Transkript. - Die Bearbeitung erfolgt nach Abschluss der Transkription. Dadurch entsteht zusätzliche Latenz, die mit der Länge des Transkripts zunimmt.
- Der Aufpreis wird auf die Audiodauer der Anfrage angewendet. Pro Anfrage werden mindestens 10 Sekunden abgerechnet.
Die Transkriptbearbeitung kann nicht mit entity_detection, entity_redaction oder
use_multi_channel kombiniert werden. Anfragen, die diese kombinieren, werden mit einem Fehler für ungültige Parameter abgelehnt.