Zum Inhalt springen

Treffen Sie Scribe

Veröffentlicht

AnhörenArtikel anhören

Scribe, unser erstes Speech-to-Text-Modell, ist das weltweit genaueste Transkriptionsmodell. Scribe wurde für die Unvorhersehbarkeit von Audio aus der Praxis entwickelt und transkribiert Sprache in 99 Sprachen – mit Zeitstempeln auf Wortebene, Sprecherdiarisierung und der Markierung von Audioereignissen. Alles wird in einer strukturierten Antwort für eine nahtlose Integration bereitgestellt.

Scribe ist auf Präzision ausgelegt. In FLEURS- und Common-Voice-Benchmarktests in 99 Sprachen übertrifft es führende Modelle wie Gemini 2.0 Flash, Whisper Large V3 und Deepgram Nova-3 durchgehend. Ob Besprechungszusammenfassungen, Filmuntertitel oder Songtexte: Scribe erzielt die niedrigste Wortfehlerrate bei automatisierter Transkription in Italienisch (98,7 %), Englisch (96,7 %) und 97 weiteren Sprachen.

Scribe macht ASR universell zugänglich und reduziert Fehler in bisher oft vernachlässigten Sprachen wie Serbisch, Kantonesisch und Malayalam deutlich. Bei diesen Sprachen überschreiten konkurrierende Modelle häufig Wortfehlerraten von 40 %.

The world's most accurate ASR model by IIElevenLabs.

Entwickler können Scribe schon heute über unsere Speech-to-Text-API integrieren und strukturierte JSON-Transkripte mit Sprecherdiarisierung sowie Zeitstempeln auf Wortebene und Markierungen für Nicht-Sprachereignisse (z. B. Lachen) erhalten. Eine Version mit geringer Latenz für Echtzeitanwendungen erscheint in Kürze.

Kreative und Unternehmen können Scribe direkt über das ElevenLabs-Dashboard nutzen, um Audio- oder Videodateien hochzuladen und formatierte Transkripte zu erstellen.

Starten Sie mit Scribe:

API-Dokumentation | Im ElevenLabs-Dashboard testen

Benchmarks

FLEURS – Wortfehlerrate % – 102 Sprachen

Bar chart comparing word error rates for different languages and speech recognition models.

Common Voice – Wortfehlerrate % – 102 Sprachen

Bar chart comparing word error rates for different voice recognition models across various countries.

Mitwirkende

Forschungsleitung, Training, Architektur

Flavio Schneider

Projektleitung, Pre-Training-Daten, Fine-Tuning-Daten

Tim von Känel

Inferenz, Optimierungen

Maximiliano Levi

Forschungsmitwirkende

Johan Nordberg, Piotr Dabkowski

Frontend

Austin Malerba

Backend

Hristo Stoychev

Datenbeschaffung

Alex George

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio