Transkription
Überblick
Die Speech to Text (STT) API von ElevenLabs wandelt gesprochene Audiodaten mit modernster Genauigkeit in Text um. Unser Scribe-v2-Modell passt sich an Textsignale in über 90 Sprachen und mehreren Sprechstilen an. Eine Live-Demo finden Sie auf unserer Speech-to-Text-Produktseite.
Unternehmen, die HIPAA-Konformität benötigen, müssen den ElevenLabs- Vertrieb kontaktieren, um einen Business Associate Agreement (BAA) abzuschließen. Stellen Sie sicher, dass dieser Schritt abgeschlossen ist, bevor Sie mit HIPAA-bezogenen Integrationen oder Bereitstellungen fortfahren.
Modelle
Beispiel einer API-Antwort
Das folgende Beispiel zeigt die Ausgabe der Speech-to-Text-API mit dem Scribe-v2-Modell für eine Beispiel-Audiodatei.
Vollständige JSON-Antwort anzeigen
Die Ausgabe wird in drei Kategorien klassifiziert:
word– Ein Wort in der Sprache der Audiodateispacing– Der Abstand zwischen Wörtern; nicht relevant für Sprachen ohne Leerzeichen wie Japanisch, Mandarin, Thai, Lao, Birmanisch und Kantonesischaudio_event– Nichtsprachliche Geräusche wie Lachen oder Applaus
Parallelität und Priorität
Parallelität beschreibt, wie viele Anfragen gleichzeitig verarbeitet werden können.
Bei Speech to Text werden Dateien mit einer Länge von über 8 Minuten intern parallel transkribiert, um die Verarbeitung zu beschleunigen. Die Audiodaten werden dafür in vier Segmente aufgeteilt, die gleichzeitig transkribiert werden.
Sie können das Parallelitätslimit mit der folgenden Formel berechnen:
Beispielsweise wird eine 15-minütige Audiodatei mit einer Parallelität von 2 transkribiert, während eine 120-minütige Audiodatei mit einer Parallelität von 4 transkribiert wird.
Die obige Berechnung gilt nur für Scribe v2 und Scribe v2 Medical. Für Scribe v2 Realtime siehe die Tabelle zu Parallelitätslimits.
Erweiterte Funktionen
Keyterm Prompting und Transkriptbearbeitung verursachen zusätzliche Kosten. Detaillierte Preisinformationen finden Sie auf der API-Preisseite.
Keyterm Prompting
Keyterm Prompting ist mit Scribe v2, Scribe v2 Medical (Batch) und Scribe v2 Realtime verfügbar.
Heben Sie Wörter oder Phrasen hervor, um das Modell bei der Transkription in diese Richtung zu lenken. Das ist nützlich für bestimmte Wörter oder Sätze, die in den Audiodaten nicht häufig vorkommen, etwa Produktnamen, Namen oder andere spezifische Begriffe. Keyterms sind leistungsfähiger als gewichtete Keywords oder benutzerdefinierte Vokabulare anderer Modelle, da sie den Kontext nutzen, um zu entscheiden, ob ein Begriff transkribiert werden soll. Batch unterstützt bis zu 1.000 Keyterms mit jeweils 50 Zeichen, Echtzeit bis zu 50 Keyterms mit jeweils 20 Zeichen.
Weitere Informationen zur Verwendung von Keyterm Prompting finden Sie in der Dokumentation zu Keyterm Prompting.
Kein-Verbatim-Modus
Der Kein-Verbatim-Modus ist mit Scribe v2, Scribe v2 Medical (Batch) und Scribe v2 Realtime verfügbar.
Wenn no_verbatim aktiviert ist, entfernt das Modell Füllwörter, Satzabbrüche und Sprechunflüssigkeiten aus dem Transkript. So entsteht eine klarere Ausgabe für Untertitel, Zusammenfassungen oder andere Anwendungsfälle, bei denen Lesbarkeit wichtiger ist als jedes gesprochene Wort zu erfassen.
Entitätserkennung
Batch-Modelle und Scribe v2 Realtime können mehrere Entitätskategorien im Transkript erkennen und deren genaue Zeitstempel bereitstellen. Das ist nützlich, um Kreditkartennummern, Namen, medizinische Zustände oder Sozialversicherungsnummern hervorzuheben.
Eine vollständige Liste der unterstützten Entitäten finden Sie in der Dokumentation zur Entitätserkennung.
Transkriptbearbeitung
Die Transkriptbearbeitung ist eine experimentelle Funktion, die mit allen Batch-Modellen und Scribe v2 Realtime verfügbar ist.
Übergeben Sie eine Anweisung in natürlicher Sprache mit dem Parameter transcript_edit; sie wird auf das fertige Transkript angewendet. Der bearbeitete Text wird neben dem Originaltranskript in edited_transcript zurückgegeben. Zeitstempel und Sprecherbezeichnungen bleiben erhalten. Das ist nützlich, um die Schreibweise von Daten, Uhrzeiten oder Einheiten zu vereinheitlichen, einen anderen Stil anzuwenden oder das Transkript in einer einzigen Anfrage umzuschreiben.
Weitere Informationen finden Sie in der Dokumentation zur Transkriptbearbeitung und im Leitfaden zur Transkriptbearbeitung in Echtzeit.
Unterstützte Sprachen
Scribe v2 unterstützt mehr als 90 Sprachen, darunter:
Afrikaans (afr), Amharisch (amh), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Asturisch (ast), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Birmanisch (mya), Kantonesisch (yue), Katalanisch (cat), Cebuano (ceb), Chichewa (nya), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Fulfulde (ful), Galicisch (glg), Ganda (lug), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Igbo (ibo), Indonesisch (ind), Irisch (gle), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kabuverdianu (kea), Kannada (kan), Kasachisch (kaz), Khmer (khm), Koreanisch (kor), Kurdisch (kur), Kirgisisch (kir), Laotisch (lao), Lettisch (lav), Lingala (lin), Litauisch (lit), Luo (luo), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Maltesisch (mlt), Mandarin-Chinesisch (zho), Māori (mri), Marathi (mar), Mongolisch (mon), Nepalesisch (nep), Nord-Sotho (nso), Norwegisch (nor), Okzitanisch (oci), Odia (ori), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch (por), Panjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Shona (sna), Sindhi (snd), Singhalesisch (sin), Slowakisch (slk), Slowenisch (slv), Somali (som), Spanisch (spa), Suaheli (swa), Schwedisch (swe), Tamil (tam), Tadschikisch (tgk), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Umbundu (umb), Urdu (urd), Usbekisch (uzb), Vietnamesisch (vie), Walisisch (cym), Wolof (wol), Xhosa (xho) und Zulu (zul).
Aufschlüsselung der Sprachunterstützung
Die Word Error Rate (WER) ist eine zentrale Kennzahl zur Bewertung der Genauigkeit von Transkriptionssystemen. Sie misst, wie viele Fehler ein Transkript im Vergleich zu einem Referenztranskript enthält. Unten finden Sie eine Aufschlüsselung der WER für jede von Scribe v2 unterstützte Sprache.
Ausgezeichnet (≤ 5 % WER)
Belarussisch (bel), Bosnisch (bos), Bulgarisch (bul), Katalanisch (cat), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Finnisch (fin), Französisch (fra), Galicisch (glg), Deutsch (deu), Griechisch (ell), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Italienisch (ita), Japanisch (jpn), Kannada (kan), Lettisch (lav), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Norwegisch (nor), Polnisch (pol), Portugiesisch (por), Rumänisch (ron), Russisch (rus), Slowakisch (slk), Spanisch (spa), Schwedisch (swe), Türkisch (tur), Ukrainisch (ukr) und Vietnamesisch (vie).
Hohe Genauigkeit (>5 % bis ≤10 % WER)
Armenisch (hye), Aserbaidschanisch (aze), Bengalisch (ben), Kantonesisch (yue), Filipino (fil), Georgisch (kat), Gujarati (guj), Hindi (hin), Kasachisch (kaz), Litauisch (lit), Maltesisch (mlt), Mandarin (cmn), Marathi (mar), Nepalesisch (nep), Odia (ori), Persisch (fas), Serbisch (srp), Slowenisch (slv), Suaheli (swa), Tamil (tam) und Telugu (tel)
Gut (>10 % bis ≤20 % WER)
Afrikaans (afr), Arabisch (ara), Assamesisch (asm), Asturisch (ast), Birmanisch (mya), Hausa (hau), Hebräisch (heb), Javanisch (jav), Koreanisch (kor), Kirgisisch (kir), Luxemburgisch (ltz), Māori (mri), Okzitanisch (oci), Punjabi (pan), Tadschikisch (tgk), Thai (tha), Usbekisch (uzb) und Walisisch (cym).
Mittelmäßig (>25 % bis ≤50 % WER)
Amharisch (amh), Ganda (lug), Igbo (ibo), Irisch (gle), Khmer (khm), Kurdisch (kur), Lao (lao), Mongolisch (mon), Nord-Sotho (nso), Paschtu (pus), Shona (sna), Sindhi (snd), Singhalesisch (sin), Somali (som), Urdu (urd), Wolof (wol), Xhosa (xho), Yoruba (yor) und Zulu (zul).
FAQ
Kann ich die Speech-to-Text-API mit Videodateien verwenden?
Ja, die API unterstützt das Hochladen von Audio- und Videodateien zur Transkription.
Welche Dateigrößen- und Dauerlimits gelten für die Speech-to-Text-API?
Dateien mit einer Größe von bis zu 3 GB werden unterstützt. Die Dauerlimits hängen vom Transkriptionsmodus ab:
- Standardmodus (
use_multi_channel=false): Bis zu 10 Stunden - Mehrkanalmodus (
use_multi_channel=true): Die Gesamtdauer aller Kanäle muss unter 10 Stunden liegen
Welche Audio- und Videoformate werden von der API unterstützt?
Die API unterstützt die folgenden Audio- und Videoformate:
- audio/aac
- audio/x-aac
- audio/x-aiff
- audio/ogg
- audio/mpeg
- audio/mp3
- audio/mpeg3
- audio/x-mpeg-3
- audio/opus
- audio/wav
- audio/x-wav
- audio/webm
- audio/flac
- audio/x-flac
- audio/mp4
- audio/aiff
- audio/x-m4a
Zu den unterstützten Videoformaten gehören:
- video/mp4
- video/x-msvideo
- video/x-matroska
- video/quicktime
- video/x-ms-wmv
- video/x-flv
- video/webm
- video/mpeg
- video/3gpp
Wann werden Sie weitere Sprachen unterstützen?
ElevenLabs erweitert kontinuierlich die Anzahl der von unseren Modellen unterstützten Sprachen. Bitte schauen Sie regelmäßig nach Updates.
Unterstützt die Speech-to-Text-API Webhooks?
Ja, asynchrone Transkriptionsergebnisse können an Webhooks gesendet werden, die in den Webhook-Einstellungen der Benutzeroberfläche konfiguriert sind. Weitere Informationen finden Sie im Webhooks-Cookbook.
Wird ein Mehrkanal-Transkriptionsmodus von der API unterstützt?
Ja, die Mehrkanal-STT-Funktion ermöglicht die Transkription von Audiodaten, bei denen jeder Kanal unabhängig verarbeitet und anhand seiner Kanalnummer einer Sprecher-ID zugeordnet wird. Diese Funktion unterstützt bis zu 5 Kanäle. Weitere Informationen finden Sie im Cookbook zur Mehrkanal-Transkription.
Wie funktioniert die Abrechnung für die Speech-to-Text-API?
ElevenLabs berechnet Speech to Text anhand der Dauer der zur Transkription übermittelten Audiodaten. Die Abrechnung erfolgt pro Audiostunde, wobei die Preise je nach Tarif und Modell variieren. Detaillierte Preisinformationen finden Sie auf der API-Preisseite.
Wichtige Fakten
- Unterstützte Eingaben: Audio- und Videodateien werden akzeptiert
- Maximale Dateigröße: 3 GB
- Maximale Dauer: 10 Stunden (Standardmodus), 1 Stunde (Mehrkanalmodus)
- Mehrkanalmodus: Bis zu 5 Kanäle; jeder wird unabhängig verarbeitet und erhält eine Sprecher-ID anhand der Kanalnummer
- Webhooks: Asynchrone Transkriptionsergebnisse können an einen Webhook übermittelt werden – Konfiguration in den Workspace-Einstellungen
- Unterstützte Audioformate: AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A, WebM
- Unterstützte Videoformate: MP4, AVI, MKV, MOV, WMV, FLV, WebM, MPEG, 3GPP