Transkription

Erfahren Sie, wie Sie gesprochene Audiodaten mit ElevenLabs in Text umwandeln.

Überblick

Die Speech to Text (STT) API von ElevenLabs wandelt gesprochene Audiodaten mit modernster Genauigkeit in Text um. Unser Scribe-v2-Modell passt sich an Textsignale in über 90 Sprachen und mehreren Sprechstilen an. Eine Live-Demo finden Sie auf unserer Speech-to-Text-Produktseite.

Unternehmen, die HIPAA-Konformität benötigen, müssen den ElevenLabs- Vertrieb kontaktieren, um einen Business Associate Agreement (BAA) abzuschließen. Stellen Sie sicher, dass dieser Schritt abgeschlossen ist, bevor Sie mit HIPAA-bezogenen Integrationen oder Bereitstellungen fortfahren.

Modelle

Beispiel einer API-Antwort

Das folgende Beispiel zeigt die Ausgabe der Speech-to-Text-API mit dem Scribe-v2-Modell für eine Beispiel-Audiodatei.

{
"language_code": "en",
"language_probability": 1,
"text": "With a soft and whispery American accent, I'm the ideal choice for creating ASMR content, meditative guides, or adding an intimate feel to your narrative projects.",
"words": [
{
"text": "With",
"start": 0.119,
"end": 0.259,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 0.239,
"end": 0.299,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "a",
"start": 0.279,
"end": 0.359,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 0.339,
"end": 0.499,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "soft",
"start": 0.479,
"end": 1.039,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 1.019,
"end": 1.2,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "and",
"start": 1.18,
"end": 1.359,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 1.339,
"end": 1.44,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "whispery",
"start": 1.419,
"end": 1.979,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 1.959,
"end": 2.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "American",
"start": 2.159,
"end": 2.719,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 2.699,
"end": 2.779,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "accent,",
"start": 2.759,
"end": 3.389,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 4.119,
"end": 4.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "I'm",
"start": 4.159,
"end": 4.459,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 4.44,
"end": 4.52,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "the",
"start": 4.5,
"end": 4.599,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 4.579,
"end": 4.699,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "ideal",
"start": 4.679,
"end": 5.099,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 5.079,
"end": 5.219,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "choice",
"start": 5.199,
"end": 5.719,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 5.699,
"end": 6.099,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "for",
"start": 6.099,
"end": 6.199,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 6.179,
"end": 6.279,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "creating",
"start": 6.259,
"end": 6.799,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 6.779,
"end": 6.979,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "ASMR",
"start": 6.959,
"end": 7.739,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 7.719,
"end": 7.859,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "content,",
"start": 7.839,
"end": 8.45,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 9,
"end": 9.06,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "meditative",
"start": 9.04,
"end": 9.64,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 9.619,
"end": 9.699,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "guides,",
"start": 9.679,
"end": 10.359,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 10.359,
"end": 10.409,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "or",
"start": 11.319,
"end": 11.439,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 11.42,
"end": 11.52,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "adding",
"start": 11.5,
"end": 11.879,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 11.859,
"end": 12,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "an",
"start": 11.979,
"end": 12.079,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 12.059,
"end": 12.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "intimate",
"start": 12.179,
"end": 12.579,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 12.559,
"end": 12.699,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "feel",
"start": 12.679,
"end": 13.159,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.139,
"end": 13.179,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "to",
"start": 13.159,
"end": 13.26,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.239,
"end": 13.3,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "your",
"start": 13.299,
"end": 13.399,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.379,
"end": 13.479,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "narrative",
"start": 13.479,
"end": 13.889,
"type": "word",
"speaker_id": "speaker_0"
},
{
"text": " ",
"start": 13.919,
"end": 13.939,
"type": "spacing",
"speaker_id": "speaker_0"
},
{
"text": "projects.",
"start": 13.919,
"end": 14.779,
"type": "word",
"speaker_id": "speaker_0"
}
]
}

Die Ausgabe wird in drei Kategorien klassifiziert:

  • word – Ein Wort in der Sprache der Audiodatei
  • spacing – Der Abstand zwischen Wörtern; nicht relevant für Sprachen ohne Leerzeichen wie Japanisch, Mandarin, Thai, Lao, Birmanisch und Kantonesisch
  • audio_event – Nichtsprachliche Geräusche wie Lachen oder Applaus

Parallelität und Priorität

Parallelität beschreibt, wie viele Anfragen gleichzeitig verarbeitet werden können.

Bei Speech to Text werden Dateien mit einer Länge von über 8 Minuten intern parallel transkribiert, um die Verarbeitung zu beschleunigen. Die Audiodaten werden dafür in vier Segmente aufgeteilt, die gleichzeitig transkribiert werden.

Sie können das Parallelitätslimit mit der folgenden Formel berechnen:

Concurrency=min⁡(4,round_up(audio_ duration_secs480))Concurrency = \min(4, \text{round\_up}(\frac{\text{audio\_ duration\_secs}}{480}))

Beispielsweise wird eine 15-minütige Audiodatei mit einer Parallelität von 2 transkribiert, während eine 120-minütige Audiodatei mit einer Parallelität von 4 transkribiert wird.

Die obige Berechnung gilt nur für Scribe v2 und Scribe v2 Medical. Für Scribe v2 Realtime siehe die Tabelle zu Parallelitätslimits.

Erweiterte Funktionen

Keyterm Prompting und Transkriptbearbeitung verursachen zusätzliche Kosten. Detaillierte Preisinformationen finden Sie auf der API-Preisseite.

Keyterm Prompting

Keyterm Prompting ist mit Scribe v2, Scribe v2 Medical (Batch) und Scribe v2 Realtime verfügbar.

Heben Sie Wörter oder Phrasen hervor, um das Modell bei der Transkription in diese Richtung zu lenken. Das ist nützlich für bestimmte Wörter oder Sätze, die in den Audiodaten nicht häufig vorkommen, etwa Produktnamen, Namen oder andere spezifische Begriffe. Keyterms sind leistungsfähiger als gewichtete Keywords oder benutzerdefinierte Vokabulare anderer Modelle, da sie den Kontext nutzen, um zu entscheiden, ob ein Begriff transkribiert werden soll. Batch unterstützt bis zu 1.000 Keyterms mit jeweils 50 Zeichen, Echtzeit bis zu 50 Keyterms mit jeweils 20 Zeichen.

Weitere Informationen zur Verwendung von Keyterm Prompting finden Sie in der Dokumentation zu Keyterm Prompting.

Kein-Verbatim-Modus

Der Kein-Verbatim-Modus ist mit Scribe v2, Scribe v2 Medical (Batch) und Scribe v2 Realtime verfügbar.

Wenn no_verbatim aktiviert ist, entfernt das Modell Füllwörter, Satzabbrüche und Sprechunflüssigkeiten aus dem Transkript. So entsteht eine klarere Ausgabe für Untertitel, Zusammenfassungen oder andere Anwendungsfälle, bei denen Lesbarkeit wichtiger ist als jedes gesprochene Wort zu erfassen.

Entitätserkennung

Die Entitätserkennung ist mit allen Batch-Modellen und Scribe v2 Realtime verfügbar.

Batch-Modelle und Scribe v2 Realtime können mehrere Entitätskategorien im Transkript erkennen und deren genaue Zeitstempel bereitstellen. Das ist nützlich, um Kreditkartennummern, Namen, medizinische Zustände oder Sozialversicherungsnummern hervorzuheben.

Eine vollständige Liste der unterstützten Entitäten finden Sie in der Dokumentation zur Entitätserkennung.

Transkriptbearbeitung

Die Transkriptbearbeitung ist eine experimentelle Funktion, die mit allen Batch-Modellen und Scribe v2 Realtime verfügbar ist.

Übergeben Sie eine Anweisung in natürlicher Sprache mit dem Parameter transcript_edit; sie wird auf das fertige Transkript angewendet. Der bearbeitete Text wird neben dem Originaltranskript in edited_transcript zurückgegeben. Zeitstempel und Sprecherbezeichnungen bleiben erhalten. Das ist nützlich, um die Schreibweise von Daten, Uhrzeiten oder Einheiten zu vereinheitlichen, einen anderen Stil anzuwenden oder das Transkript in einer einzigen Anfrage umzuschreiben.

Weitere Informationen finden Sie in der Dokumentation zur Transkriptbearbeitung und im Leitfaden zur Transkriptbearbeitung in Echtzeit.

Unterstützte Sprachen

Scribe v2 unterstützt mehr als 90 Sprachen, darunter:

Afrikaans (afr), Amharisch (amh), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Asturisch (ast), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Birmanisch (mya), Kantonesisch (yue), Katalanisch (cat), Cebuano (ceb), Chichewa (nya), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Fulfulde (ful), Galicisch (glg), Ganda (lug), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Igbo (ibo), Indonesisch (ind), Irisch (gle), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kabuverdianu (kea), Kannada (kan), Kasachisch (kaz), Khmer (khm), Koreanisch (kor), Kurdisch (kur), Kirgisisch (kir), Laotisch (lao), Lettisch (lav), Lingala (lin), Litauisch (lit), Luo (luo), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Maltesisch (mlt), Mandarin-Chinesisch (zho), Māori (mri), Marathi (mar), Mongolisch (mon), Nepalesisch (nep), Nord-Sotho (nso), Norwegisch (nor), Okzitanisch (oci), Odia (ori), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch (por), Panjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Shona (sna), Sindhi (snd), Singhalesisch (sin), Slowakisch (slk), Slowenisch (slv), Somali (som), Spanisch (spa), Suaheli (swa), Schwedisch (swe), Tamil (tam), Tadschikisch (tgk), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Umbundu (umb), Urdu (urd), Usbekisch (uzb), Vietnamesisch (vie), Walisisch (cym), Wolof (wol), Xhosa (xho) und Zulu (zul).

Aufschlüsselung der Sprachunterstützung

Die Word Error Rate (WER) ist eine zentrale Kennzahl zur Bewertung der Genauigkeit von Transkriptionssystemen. Sie misst, wie viele Fehler ein Transkript im Vergleich zu einem Referenztranskript enthält. Unten finden Sie eine Aufschlüsselung der WER für jede von Scribe v2 unterstützte Sprache.

Belarussisch (bel), Bosnisch (bos), Bulgarisch (bul), Katalanisch (cat), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Finnisch (fin), Französisch (fra), Galicisch (glg), Deutsch (deu), Griechisch (ell), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Italienisch (ita), Japanisch (jpn), Kannada (kan), Lettisch (lav), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Norwegisch (nor), Polnisch (pol), Portugiesisch (por), Rumänisch (ron), Russisch (rus), Slowakisch (slk), Spanisch (spa), Schwedisch (swe), Türkisch (tur), Ukrainisch (ukr) und Vietnamesisch (vie).

Armenisch (hye), Aserbaidschanisch (aze), Bengalisch (ben), Kantonesisch (yue), Filipino (fil), Georgisch (kat), Gujarati (guj), Hindi (hin), Kasachisch (kaz), Litauisch (lit), Maltesisch (mlt), Mandarin (cmn), Marathi (mar), Nepalesisch (nep), Odia (ori), Persisch (fas), Serbisch (srp), Slowenisch (slv), Suaheli (swa), Tamil (tam) und Telugu (tel)

Afrikaans (afr), Arabisch (ara), Assamesisch (asm), Asturisch (ast), Birmanisch (mya), Hausa (hau), Hebräisch (heb), Javanisch (jav), Koreanisch (kor), Kirgisisch (kir), Luxemburgisch (ltz), Māori (mri), Okzitanisch (oci), Punjabi (pan), Tadschikisch (tgk), Thai (tha), Usbekisch (uzb) und Walisisch (cym).

Amharisch (amh), Ganda (lug), Igbo (ibo), Irisch (gle), Khmer (khm), Kurdisch (kur), Lao (lao), Mongolisch (mon), Nord-Sotho (nso), Paschtu (pus), Shona (sna), Sindhi (snd), Singhalesisch (sin), Somali (som), Urdu (urd), Wolof (wol), Xhosa (xho), Yoruba (yor) und Zulu (zul).

FAQ

Ja, die API unterstützt das Hochladen von Audio- und Videodateien zur Transkription.

Dateien mit einer Größe von bis zu 3 GB werden unterstützt. Die Dauerlimits hängen vom Transkriptionsmodus ab:

  • Standardmodus (use_multi_channel=false): Bis zu 10 Stunden
  • Mehrkanalmodus (use_multi_channel=true): Die Gesamtdauer aller Kanäle muss unter 10 Stunden liegen

Die API unterstützt die folgenden Audio- und Videoformate:

  • audio/aac
  • audio/x-aac
  • audio/x-aiff
  • audio/ogg
  • audio/mpeg
  • audio/mp3
  • audio/mpeg3
  • audio/x-mpeg-3
  • audio/opus
  • audio/wav
  • audio/x-wav
  • audio/webm
  • audio/flac
  • audio/x-flac
  • audio/mp4
  • audio/aiff
  • audio/x-m4a

Zu den unterstützten Videoformaten gehören:

  • video/mp4
  • video/x-msvideo
  • video/x-matroska
  • video/quicktime
  • video/x-ms-wmv
  • video/x-flv
  • video/webm
  • video/mpeg
  • video/3gpp

ElevenLabs erweitert kontinuierlich die Anzahl der von unseren Modellen unterstützten Sprachen. Bitte schauen Sie regelmäßig nach Updates.

Ja, asynchrone Transkriptionsergebnisse können an Webhooks gesendet werden, die in den Webhook-Einstellungen der Benutzeroberfläche konfiguriert sind. Weitere Informationen finden Sie im Webhooks-Cookbook.

Ja, die Mehrkanal-STT-Funktion ermöglicht die Transkription von Audiodaten, bei denen jeder Kanal unabhängig verarbeitet und anhand seiner Kanalnummer einer Sprecher-ID zugeordnet wird. Diese Funktion unterstützt bis zu 5 Kanäle. Weitere Informationen finden Sie im Cookbook zur Mehrkanal-Transkription.

ElevenLabs berechnet Speech to Text anhand der Dauer der zur Transkription übermittelten Audiodaten. Die Abrechnung erfolgt pro Audiostunde, wobei die Preise je nach Tarif und Modell variieren. Detaillierte Preisinformationen finden Sie auf der API-Preisseite.

Wichtige Fakten

  • Unterstützte Eingaben: Audio- und Videodateien werden akzeptiert
  • Maximale Dateigröße: 3 GB
  • Maximale Dauer: 10 Stunden (Standardmodus), 1 Stunde (Mehrkanalmodus)
  • Mehrkanalmodus: Bis zu 5 Kanäle; jeder wird unabhängig verarbeitet und erhält eine Sprecher-ID anhand der Kanalnummer
  • Webhooks: Asynchrone Transkriptionsergebnisse können an einen Webhook übermittelt werden – Konfiguration in den Workspace-Einstellungen
  • Unterstützte Audioformate: AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A, WebM
  • Unterstützte Videoformate: MP4, AVI, MKV, MOV, WMV, FLV, WebM, MPEG, 3GPP