Was ist Speech to Text?
Speech to Text wandelt gesprochene Audios in geschriebenen Text um. Bei ElevenLabs heißt unser Speech-to-Text-Modell Scribe. Damit können Sie Sprache in über 90 Sprachen präzise transkribieren und Audio einfach in lesbaren, durchsuchbaren Text umwandeln.
Hauptfunktionen von Scribe
- Branchenführende Genauigkeit mit 98 % Genauigkeit in wichtigen Sprachen wie Englisch, Französisch, Italienisch, Portugiesisch, Spanisch und Deutsch.
- Präzise Zeitstempel auf Wortebene, damit Sie genau sehen, wann jedes Wort gesprochen wird.
- Intelligente Sprecherdiarisierung, die verschiedene Sprecher automatisch erkennt und voneinander trennt.
- Dynamische Audio-Tagging zur Erkennung nichtsprachlicher Geräusche.
- Unterstützung für bis zu 32 Sprecher bei hoher Genauigkeit.
Neu in Scribe v2
Scribe v2 erweitert das Kernmodell um zusätzliche Funktionen für anspruchsvollere Anwendungsfälle.
- Keyterm-Prompting. Sie können bis zu 100 Wörter oder Ausdrücke angeben, um das Modell bei der korrekten Transkription wichtiger Begriffe zu unterstützen. Die Verwendung von Keyterm-Prompting erhöht die Kosten um 20 %.
- Entitätserkennung. Sie können bestimmte Informationskategorien für die Erkennung im Transkript auswählen, etwa Kreditkartennummern, Namen oder medizinische Erkrankungen. Die Entitätserkennung ist nur über die API verfügbar und erhöht die Kosten um 30 %.
- Intelligente Unterstützung mehrerer Sprachen. Sie können Audio mit mehreren Sprachen übermitteln, und Scribe v2 erkennt und transkribiert jede Sprache automatisch korrekt.
- Verbesserte Stabilität. Scribe v2 verarbeitet Pausen, Tonwechsel und lange Stille
ohne Unterbrechungen oder Genauigkeitsverlust.
Welche Version sollten Sie verwenden?
Wir empfehlen Scribe v2, wenn Transkriptionen mit hoher Genauigkeit erforderlich sind. Es ist über unsere Website und API verfügbar. Bei der Nutzung von Speech to Text über unsere Website ist Scribe v2 das Standardmodell.
Für medizinische und klinische Audios verwenden Sie Scribe v2 Medical (scribe_v2_medical) über dieselbe API. Die Abrechnung erfolgt zum selben Tarif wie für Scribe v2.
Für Echtzeit-Anwendungsfälle empfehlen wir Scribe v2 Realtime, verfügbar über ElevenAgents und per API.
Weitere Details finden Sie in unserer Speech-to-Text-Dokumentation.