For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Transkribiert eine Audio- oder Videodatei. Wenn webhook auf true gesetzt ist, wird die Anfrage asynchron verarbeitet und die Ergebnisse an konfigurierte Webhooks gesendet. Wenn use_multi_channel true ist und das bereitgestellte Audio mehrere Kanäle hat, wird ein 'transcripts'-Objekt mit separaten Transkripten für jeden Kanal zurückgegeben. Setzen Sie multichannel_output_style='combined', um stattdessen ein einzelnes Transkript mit zusammengeführten und zeitlich sortierten Kanälen zu erhalten. Andernfalls wird ein einzelnes Transkript zurückgegeben. Mit dem optionalen Parameter webhook_metadata können Sie benutzerdefinierte Daten anhängen, die zur Anfragenkorrelation und Nachverfolgung in Webhook-Antworten aufgenommen werden.
Header
xi-api-keystringOptional
Abfrageparameter
tokenstring or nullOptional
Ein Einmal-Authentifizierungstoken, das über POST /v1/single-use-token/batch_scribe erstellt wird. Dieser Token kann nur einmal verwendet werden und läuft nach 15 Minuten ab. Alternative zur Authentifizierung per API-Key oder Bearer-Token für Frontend-Clients.
enable_loggingbooleanOptionalStandardwert ist true
Wenn enable_logging auf false gesetzt ist, wird für die Anfrage der Zero-Retention-Modus verwendet. Dadurch sind Funktionen zur Speicherung von Logs und Transkripten für diese Anfrage nicht verfügbar. Der Zero-Retention-Modus darf nur von Enterprise-Kunden verwendet werden.
Anfrage
This endpoint expects a multipart form containing an optional file.
model_idstringErforderlich
Die ID des für die Transkription zu verwendenden Modells.
filefileOptional
Die zu transkribierende Datei (mindestens 100 ms Audiolänge). Alle gängigen Audio- und Videoformate werden unterstützt. Genau einer der Parameter file oder cloud_storage_url muss angegeben werden. Die Dateigröße muss unter 5,0 GB liegen.
language_codestring or nullOptional
Ein ISO-639-1- oder ISO-639-3-language_code, der der Sprache der Audiodatei entspricht. Kann die Transkriptionsleistung verbessern, wenn er im Voraus bekannt ist. Standardmäßig null; in diesem Fall wird die Sprache automatisch erkannt.
transcript_editstring or nullOptional
Natural-language instruction applied to the final transcript (max 2000 characters). The edited text is returned in 'edited_transcript' alongside the original transcript. Cannot be combined with entity_detection, entity_redaction or use_multi_channel. Usage of this parameter will incur an additional 30% surcharge on the base transcription cost, billed for at least 10 seconds of audio.
tag_audio_eventsbooleanOptionalStandardwert ist true
Ob Audioereignisse wie (Lachen), (Schritte) usw. in der Transkription markiert werden sollen.
num_speakersinteger or nullOptional1-32
The maximum amount of speakers talking in the uploaded file. Can help with predicting who speaks when. The maximum amount of speakers that can be predicted is 32. Defaults to null, in this case the amount of speakers is set to the maximum value the model supports.
timestamps_granularityenumOptionalStandardwert ist word
Die Granularität der Zeitstempel in der Transkription. „word“ liefert Zeitstempel auf Wortebene und „character“ Zeitstempel auf Zeichenebene pro Wort.
Erlaubte Werte:
diarizebooleanOptionalStandardwert ist false
Ob annotiert werden soll, welcher Sprecher derzeit in der hochgeladenen Datei spricht.
diarization_thresholddouble or nullOptional0.1-0.4
Schwellenwert für die Sprecherdiarisierung. Ein höherer Wert verringert die Wahrscheinlichkeit, dass ein Sprecher als zwei unterschiedliche Sprecher diarisiert wird, erhöht aber die Wahrscheinlichkeit, dass zwei unterschiedliche Sprecher als ein Sprecher diarisiert werden (weniger Sprecher insgesamt vorhergesagt). Ein niedriger Wert erhöht die Wahrscheinlichkeit, dass ein Sprecher als zwei unterschiedliche Sprecher diarisiert wird, verringert aber die Wahrscheinlichkeit, dass zwei unterschiedliche Sprecher als ein Sprecher diarisiert werden (mehr Sprecher insgesamt vorhergesagt). Kann nur gesetzt werden, wenn diarize=True und num_speakers=None. Standard ist None; in diesem Fall wählen wir anhand von model_id einen Schwellenwert (in der Regel 0.22).
additional_formatslist of objectsOptional
Eine Liste zusätzlicher Formate, in die das Transkript exportiert werden soll.
file_formatenumOptionalStandardwert ist other
The format of input audio. Options are ‘pcm_s16le_16’ or ‘other’ For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.
Erlaubte Werte:
cloud_storage_urlstring or nullOptionalDeprecated
[Deprecated] Dieser Parameter ist veraltet und wird künftig entfernt. Verwenden Sie stattdessen 'source_url'. Die HTTPS-URL der zu transkribierenden Datei. Es muss genau einer der Parameter file oder cloud_storage_url angegeben werden. Die Datei muss über HTTPS erreichbar sein und kleiner als 2 GB sein. Jede gültige HTTPS-URL wird akzeptiert, einschließlich URLs von Cloud-Speicheranbietern (AWS S3, Google Cloud Storage, Cloudflare R2 usw.), CDNs oder anderen HTTPS-Quellen. URLs können vorab signiert sein oder Authentifizierungstoken in Abfrageparametern enthalten.
source_urlstring or nullOptional
Die URL einer zu transkribierenden Audio- oder Videodatei. Unterstützt gehostete Video- oder Audiodateien, YouTube-Video-URLs, TikTok-Video-URLs und andere Video-Hosting-Dienste.
webhookbooleanOptionalStandardwert ist false
Ob das Transkriptionsergebnis an konfigurierte Speech-to-Text-Webhooks gesendet werden soll. Wenn festgelegt, wird die Anfrage frühzeitig ohne Transkription zurückgegeben, die später per Webhook zugestellt wird.
webhook_idstring or nullOptional
Optionale spezifische Webhook-ID, an die das Transkriptionsergebnis gesendet wird. Nur gültig, wenn webhook auf true gesetzt ist. Wenn nicht angegeben, wird die Transkription an alle konfigurierten Speech-to-Text-Webhooks gesendet.
temperaturedouble or nullOptional0-2
Steuert die Zufälligkeit der Transkription. Akzeptiert Werte zwischen 0.0 und 2.0, wobei höhere Werte vielfältigere und weniger deterministische Ergebnisse liefern. Wenn nicht angegeben, verwenden wir eine Temperatur basierend auf dem gewählten Modell, die normalerweise 0 ist.
seedinteger or nullOptional0-2147483647
Falls angegeben, bemüht sich unser System um eine deterministische Generierung, sodass wiederholte Anfragen mit demselben Seed und denselben Parametern dasselbe Ergebnis liefern sollten. Determinismus wird nicht garantiert. Muss eine Ganzzahl zwischen 0 und 2147483647 sein.
use_multi_channelbooleanOptionalStandardwert ist false
Gibt an, ob die Audiodatei mehrere Kanäle enthält, wobei jeder Kanal einen einzelnen Sprecher enthält. Wenn aktiviert, wird jeder Kanal unabhängig transkribiert. Standardmäßig wird für jeden Kanal ein separates Transkript zurückgegeben. Setzen Sie multichannel_output_style='combined', um stattdessen ein einzelnes Transkript mit allen zusammengeführten und nach Zeit sortierten Kanälen zu erhalten. Jedes Wort in der Antwort enthält ein Feld 'channel_index', das angibt, auf welchem Kanal es gesprochen wurde. Es werden maximal 5 Kanäle unterstützt. Jeder Kanal wird unabhängig über die volle Audiodauer abgerechnet, sodass die Kosten linear mit der Anzahl der Kanäle steigen.
multichannel_output_styleenumOptionalStandardwert ist separate
Controls the response shape when use_multi_channel is enabled. 'separate' (default) returns one transcript per channel under 'transcripts'. 'combined' merges all channels into a single transcript whose words are sorted by start time, each carrying a 'channel_index' - matching the single-channel response shape. 'combined' requires timestamps (timestamps_granularity must not be 'none') and does not support entity detection or redaction.
Erlaubte Werte:
webhook_metadatastring or map from strings to any or nullOptional
Optionale Metadaten, die in die Webhook-Antwort aufgenommen werden. Dies sollte ein JSON-String sein, der ein Objekt mit maximal 2 Ebenen und einer maximalen Größe von 16 KB darstellt. Nützlich zum Nachverfolgen interner IDs, Job-Referenzen oder anderer Kontextinformationen.
entity_detectionstring or list of strings or nullOptional
Erkennt Entitäten im Transkript. Kann auf 'all' gesetzt werden, um alle Entitäten zu erkennen, oder eine einzelne Entitätsart bzw. Kategoriezeichenfolge oder eine Liste von Entitätsarten/Kategorien enthalten. Kategorien umfassen 'pii', 'phi', 'pci', 'other' und 'offensive_language'. Wenn aktiviert, werden erkannte Entitäten im Feld 'entities' mit Text, Typ und Zeichenpositionen zurückgegeben. Die Verwendung dieses Parameters verursacht einen zusätzlichen Aufschlag von 30 % auf die grundlegenden Transkriptionskosten.
no_verbatimbooleanOptionalStandardwert ist false
Wenn true, enthält die Transkription keine Füllwörter, Fehlansätze oder nichtsprachlichen Geräusche. Wird nur vom Modell scribe_v2 unterstützt.
use_speaker_librarybooleanOptionalStandardwert ist false
Ob die Sprecherbibliothek verwendet werden soll, um bekannte Sprecher bei der Sprechertrennung zu identifizieren. Wenn aktiviert und diarize auf true gesetzt ist, werden erkannte Sprecher mit registrierten Sprechern in der Sprecherbibliothek des Workspace abgeglichen.
detect_speaker_rolesbooleanOptionalStandardwert ist false
Ob Sprecherrollen erkannt werden sollen (Agent vs. Kunde). Erfordert diarize=true. Kann nicht mit use_multi_channel=true verwendet werden. Wenn aktiviert, lauten die speaker_id-Werte 'agent' und 'customer' statt 'speaker_0', 'speaker_1' usw. Die Nutzung verursacht einen zusätzlichen Aufschlag von 10 % auf die Grundkosten der Transkription.
entity_redactionstring or list of strings or nullOptional
Schwärzt Entitäten im Transkripttext. Akzeptiert dasselbe Format wie entity_detection: 'all', eine Kategorie ('pii', 'phi') oder bestimmte Entitätstypen. Muss eine Teilmenge von entity_detection sein. Bei aktivierter Schwärzung wird das Feld entities nicht zurückgegeben. Die Verwendung dieses Parameters verursacht einen zusätzlichen Aufschlag von 30 % auf die Basiskosten der Transkription.
entity_redaction_modestringOptionalStandardwert ist enumerated_entity_type
Wie geschwärzte Entitäten formatiert werden. ‘redacted’ ersetzt durch {REDACTED}, ‘entity_type’ durch {ENTITY_TYPE}, ‘enumerated_entity_type’ durch {ENTITY_TYPE_N}, wobei N jedes Vorkommen nummeriert. Wird nur verwendet, wenn entity_redaction festgelegt ist.
keytermslist of stringsOptionalStandardwert ist []
Eine Liste von Schlüsselbegriffen, auf die die Transkription ausgerichtet wird. Die Schlüsselbegriffe sind Wörter oder Phrasen, die das Modell genauer erkennen soll. Die Anzahl der Schlüsselbegriffe darf 1000 nicht überschreiten. Jeder Schlüsselbegriff darf höchstens 50 Zeichen lang sein. Schlüsselbegriffe dürfen nach der Normalisierung höchstens 5 Wörter enthalten. Zum Beispiel ["hello", "world", "technical term"]. Die folgenden Zeichen werden nicht unterstützt: `<`, `>`, `{`, `}`, `[`, `]`, `\`. Die Verwendung dieses Parameters verursacht einen zusätzlichen Aufschlag von 20 % auf die Basiskosten der Transkription. Bei mehr als 100 Schlüsselbegriffen gilt pro Anfrage eine abrechenbare Mindestdauer von 20 Sekunden.
Antwort
Synchrones Transkriptionsergebnis
SpeechToTextChunkResponseModelobject
Details der Transkription auf Chunk-Ebene mit Zeitinformationen.
OR
MultichannelSpeechToTextResponseModelobject
Antwortmodell für mehrkanalige Speech-to-Text-Transkription.
Transkribiert eine Audio- oder Videodatei. Wenn webhook auf true gesetzt ist, wird die Anfrage asynchron verarbeitet und die Ergebnisse an konfigurierte Webhooks gesendet. Wenn use_multi_channel true ist und das bereitgestellte Audio mehrere Kanäle hat, wird ein ‘transcripts’-Objekt mit separaten Transkripten für jeden Kanal zurückgegeben. Setzen Sie multichannel_output_style=‘combined’, um stattdessen ein einzelnes Transkript mit zusammengeführten und zeitlich sortierten Kanälen zu erhalten. Andernfalls wird ein einzelnes Transkript zurückgegeben. Mit dem optionalen Parameter webhook_metadata können Sie benutzerdefinierte Daten anhängen, die zur Anfragenkorrelation und Nachverfolgung in Webhook-Antworten aufgenommen werden.
Natural-language instruction applied to the final transcript (max 2000 characters). The edited text is returned in ‘edited_transcript’ alongside the original transcript. Cannot be combined with entity_detection, entity_redaction or use_multi_channel. Usage of this parameter will incur an additional 30% surcharge on the base transcription cost, billed for at least 10 seconds of audio.
Schwellenwert für die Sprecherdiarisierung. Ein höherer Wert verringert die Wahrscheinlichkeit, dass ein Sprecher als zwei unterschiedliche Sprecher diarisiert wird, erhöht aber die Wahrscheinlichkeit, dass zwei unterschiedliche Sprecher als ein Sprecher diarisiert werden (weniger Sprecher insgesamt vorhergesagt). Ein niedriger Wert erhöht die Wahrscheinlichkeit, dass ein Sprecher als zwei unterschiedliche Sprecher diarisiert wird, verringert aber die Wahrscheinlichkeit, dass zwei unterschiedliche Sprecher als ein Sprecher diarisiert werden (mehr Sprecher insgesamt vorhergesagt). Kann nur gesetzt werden, wenn diarize=True und num_speakers=None. Standard ist None; in diesem Fall wählen wir anhand von model_id einen Schwellenwert (in der Regel 0.22).
[Deprecated] Dieser Parameter ist veraltet und wird künftig entfernt. Verwenden Sie stattdessen ‘source_url’. Die HTTPS-URL der zu transkribierenden Datei. Es muss genau einer der Parameter file oder cloud_storage_url angegeben werden. Die Datei muss über HTTPS erreichbar sein und kleiner als 2 GB sein. Jede gültige HTTPS-URL wird akzeptiert, einschließlich URLs von Cloud-Speicheranbietern (AWS S3, Google Cloud Storage, Cloudflare R2 usw.), CDNs oder anderen HTTPS-Quellen. URLs können vorab signiert sein oder Authentifizierungstoken in Abfrageparametern enthalten.
Gibt an, ob die Audiodatei mehrere Kanäle enthält, wobei jeder Kanal einen einzelnen Sprecher enthält. Wenn aktiviert, wird jeder Kanal unabhängig transkribiert. Standardmäßig wird für jeden Kanal ein separates Transkript zurückgegeben. Setzen Sie multichannel_output_style=‘combined’, um stattdessen ein einzelnes Transkript mit allen zusammengeführten und nach Zeit sortierten Kanälen zu erhalten. Jedes Wort in der Antwort enthält ein Feld ‘channel_index’, das angibt, auf welchem Kanal es gesprochen wurde. Es werden maximal 5 Kanäle unterstützt. Jeder Kanal wird unabhängig über die volle Audiodauer abgerechnet, sodass die Kosten linear mit der Anzahl der Kanäle steigen.
Controls the response shape when use_multi_channel is enabled. ‘separate’ (default) returns one transcript per channel under ‘transcripts’. ‘combined’ merges all channels into a single transcript whose words are sorted by start time, each carrying a ‘channel_index’ - matching the single-channel response shape. ‘combined’ requires timestamps (timestamps_granularity must not be ‘none’) and does not support entity detection or redaction.
Erkennt Entitäten im Transkript. Kann auf ‘all’ gesetzt werden, um alle Entitäten zu erkennen, oder eine einzelne Entitätsart bzw. Kategoriezeichenfolge oder eine Liste von Entitätsarten/Kategorien enthalten. Kategorien umfassen ‘pii’, ‘phi’, ‘pci’, ‘other’ und ‘offensive_language’. Wenn aktiviert, werden erkannte Entitäten im Feld ‘entities’ mit Text, Typ und Zeichenpositionen zurückgegeben. Die Verwendung dieses Parameters verursacht einen zusätzlichen Aufschlag von 30 % auf die grundlegenden Transkriptionskosten.
Ob Sprecherrollen erkannt werden sollen (Agent vs. Kunde). Erfordert diarize=true. Kann nicht mit use_multi_channel=true verwendet werden. Wenn aktiviert, lauten die speaker_id-Werte ‘agent’ und ‘customer’ statt ‘speaker_0’, ‘speaker_1’ usw. Die Nutzung verursacht einen zusätzlichen Aufschlag von 10 % auf die Grundkosten der Transkription.
Schwärzt Entitäten im Transkripttext. Akzeptiert dasselbe Format wie entity_detection: ‘all’, eine Kategorie (‘pii’, ‘phi’) oder bestimmte Entitätstypen. Muss eine Teilmenge von entity_detection sein. Bei aktivierter Schwärzung wird das Feld entities nicht zurückgegeben. Die Verwendung dieses Parameters verursacht einen zusätzlichen Aufschlag von 30 % auf die Basiskosten der Transkription.
Eine Liste von Schlüsselbegriffen, auf die die Transkription ausgerichtet wird. Die Schlüsselbegriffe sind Wörter oder Phrasen, die das Modell genauer erkennen soll. Die Anzahl der Schlüsselbegriffe darf 1000 nicht überschreiten. Jeder Schlüsselbegriff darf höchstens 50 Zeichen lang sein. Schlüsselbegriffe dürfen nach der Normalisierung höchstens 5 Wörter enthalten. Zum Beispiel [“hello”, “world”, “technical term”]. Die folgenden Zeichen werden nicht unterstützt: <, >, {, }, [, ], \. Die Verwendung dieses Parameters verursacht einen zusätzlichen Aufschlag von 20 % auf die Basiskosten der Transkription. Bei mehr als 100 Schlüsselbegriffen gilt pro Anfrage eine abrechenbare Mindestdauer von 20 Sekunden.