Scribe v2 Medical ist jetzt für alle verfügbar
- Verfasst von
- Min Kim
- Veröffentlicht
AnhörenArtikel anhören
Klinische Audiodaten gehören zu den anspruchsvollsten Tests für präzise Spracherkennung. Medikamentennamen sind lang, selten und leicht zu verwechseln (hydroxyzine und hydralazine unterscheiden sich nur durch eine falsch verstandene Silbe). Der Wortschatz ist dicht: Dosierungen, Einheiten sowie Begriffe aus Anatomie und Pathologie können in schneller Folge auftreten. Zudem steht mehr auf dem Spiel, da ein Transkriptionsfehler in der Patientenakte landen könnte.
Deshalb veröffentlicht ElevenLabs heute Scribe v2 Medical, unser für klinische Audiodaten feinabgestimmtes Speech to Text-Modell, das jetzt allgemein über die ElevenAPI verfügbar ist. In den unten vorgestellten Evaluierungen erzielt es durchgehend eine der niedrigsten Wortfehlerraten (WER) unter den verglichenen Modellen und senkt die WER bei klinischen Audiodaten gegenüber unserem Basismodell Scribe v2 um rund 35 %.
Allzweckmodelle verarbeiten Alltagssprache zuverlässig, können aber gerade dort an Leistung verlieren, wo klinische Workflows sie am dringendsten brauchen. Wir haben eine medizinische Feinabstimmung von Scribe v2 für Medikamentennamen und klinische Diktate auf öffentlichen Benchmarks trainiert, die jeder reproduzieren kann.
Scribe v2 Medical ist für klinische Anwendungsfälle optimiert
Klinische Diktate (MedDictate)
Cortis MedDictate testet die Transkription diktierter klinischer Notizen mit Medikamentennamen, Dosierungen und Einheiten, die auf Englisch, Französisch und Deutsch direkt aufeinanderfolgen. In unserer Evaluierung erzielt Scribe v2 Medical die niedrigste Gesamt-WER aller getesteten Modelle und eine um etwa 35 % niedrigere WER als das Basismodell Scribe v2.
Modell | EN | FR | DE | Gesamt-WER |
|---|---|---|---|---|
Scribe v2 Medical | 3.0% | 8.3% | 7.2% | 4.9% |
OpenAI GPT Transcribe | 3.9% | 7.8% | 9.6% | 5.9% |
Scribe v2 (Basis) | 5.0% | 10.7% | 11.7% | 7.6% |
Muse Voice Transcribe 1.0 | 4.5% | 11.0% | 13.3% | 7.8% |
Deepgram Nova-3 Medical* | 5.5% | - | - | - |
*Nur Englisch (24 Clips) – Deepgram Nova-3 Medical unterstützt weder Französisch noch Deutsch.
Medizinische Terminologie (MedTerm)
MedTerm ist ebenfalls ein von Corti veröffentlichter Datensatz und umfasst einen Benchmark mit 600 klinischen Terminologiebeispielen in denselben drei Sprachen, in dem die medizinischen Begriffe jedes Beispiels annotiert sind. Diese Annotation ermöglicht es, Modelle über die WER des gesamten Transkripts hinaus in zwei Dimensionen zu bewerten. Die Begriffserkennung ist der Anteil annotierter medizinischer Begriffe, die korrekt im Transkript erscheinen (höher ist besser). Die Term-WER ist die Fehlerrate nur für diese Begriffe und ignoriert die umgebende gewöhnliche Sprache (niedriger ist besser).
Scribe v2 Medical führt bei beiden Kennzahlen alle getesteten Modelle an und liegt in allen drei Sprachen vor allen anderen Anbietern:
Modell | Begriffserkennung ↑ | Term-WER ↓ |
Scribe v2 Medical | 77.7% | 10.4% |
Scribe v2 (Basis) | 77.1% | 10.7% |
OpenAI GPT Transcribe | 74.0% | 12.3% |
Muse Voice Transcribe 1.0 | 73.4% | 12.9% |
Deepgram Nova-3 Medical* | 72.5% | 13.6% |
Omi Health Benchmark für medizinisches Speech to Text
Die Leistung bestätigt sich auch in unabhängigen Tests. Omi Health führt eine öffentliche Rangliste mit 30 Modellen, die anhand von 1.513 klinischen englischen Clips bewertet werden (7,2 Stunden aus 57 Konsultationen). Scribe v2 Medical erzielt die niedrigste Gesamt-WER aller 30 getesteten Modelle (5,88 %) und verbessert die Dosierungsgenauigkeit gegenüber dem Basismodell Scribe v2 deutlich (86,2 % gegenüber 79,8 %).
Omis Benchmark wird am 25. September mit den Ergebnissen für Scribe v2 Medical aktualisiert. Die oben genannten Zahlen werden mit ihrer Zustimmung vor diesem Update veröffentlicht.
Eka Medical ASR-Benchmark
Der Eka Medical ASR-Benchmark enthält 3.619 englische klinische Audiobeispiele – von isolierten Medikamenten- und Krankheitsnamen über klinische Sätze bis zu Gesprächen zwischen medizinischem Personal und Patienten – mit Annotationen pro Begriff und einer veröffentlichten Rangliste auf der Datensatzkarte.
Da der veröffentlichte Datensatz ältere Modelle wie Gemini 2.5 Flash und GPT-4o enthält, führten wir die Evaluierung mit neueren Modellen durch. SemWER (semantische WER) bewertet, ob das Modell die richtigen Inhalte erkannt hat, unabhängig von der Formatierung („mg“ und „Milligramm“ zählen als dieselbe Antwort). kwWER (Keyword-WER) wendet dieselbe Bewertung nur auf die annotierten medizinischen Schlüsselbegriffe an.
Modell | semWER | kwWER |
Scribe v2 Medical | 6.50% | 6.02% |
Scribe v2 (Basis) | 7.35% | 7.04% |
Deepgram Nova-3 Medical | 7.79% | 7.65% |
Muse Voice Transcribe 1.0 | 8.85% | 8.99% |
OpenAI GPT Transcribe | 13.90% | 13.20% |
Eka annotiert die medizinischen Begriffe in jedem Beispiel. Damit lassen sich die Verbesserungen von Scribe v2 Medical gegenüber dem Basismodell bei den medizinischen Begriffen allein detaillierter bewerten. Scribe v2 Medical macht 15 % weniger Fehler als das Basismodell (9,5 % gegenüber 11,1 %), wobei die Verbesserungen am größten sind, wenn Begriffe in vollständigen klinischen Sätzen vorkommen (7,5 % gegenüber 9,9 %).

Eine Einschränkung derselben Daten: Isolierte Clips mit einzelnen Wörtern – ein einzelner ausgesprochener Medikamentenname ohne Kontext – bleiben für jedes Modell in der Rangliste, einschließlich Scribe v2 Medical, der schwierigste Fall. Bei isolierten Begriffen erzielte es eine WER von 14,3 %, gegenüber 7,5 %, wenn diese Begriffe in Sätzen vorkommen. Ohne Kontext kann eine falsch verstandene Silbe zu einprägsamen Fehlern führen:
- etodolac (ein NSAR) → „It'll do the luck“
- levomilnacipran (ein Antidepressivum) → „Leave me alone now, Sephora.“
- methdilazine (ein Antihistaminikum) → „Let's play our scene.“
Eine Möglichkeit, diese Fehler zu reduzieren, ist Keyterm Prompting. Damit können Sie Medikamentennamen oder medizinische Ausdrücke hervorheben, um das Modell bei der korrekten Transkription zu unterstützen.
Kunden im produktiven Einsatz
Kunden nutzen Scribe v2 Medical bereits produktiv und erzielen Verbesserungen bei klinischen Audiodaten.
„Seit wir von Deepgram zu ElevenLabs Scribe v2 Medical gewechselt sind, erreichen wir bei klinischer Terminologie eine deutlich höhere Genauigkeit. Das hat die Arbeitsweise des Teams verändert“, sagt Mendel Erlenwein, CEO und Gründer von CareCo. „Wenn unsere Koordinatoren den Transkripten vertrauen, verbringen sie weniger Zeit mit der Korrektur von Notizen und mehr Zeit am Telefon mit Patienten. Unsere Patienten haben komplexe Behandlungspläne, und die Notiz, die das Behandlungsteam liest, muss stimmen.“
Starke Leistung bei allgemeiner Sprache
Das Team hat außerdem bestätigt, dass die medizinische Feinabstimmung die Leistung in anderen Bereichen nicht beeinträchtigt. Bei 6.000 Beispielen alltäglicher, nicht medizinischer Sprache aus Common Voice erzielt Scribe v2 Medical gerundet dieselben Ergebnisse wie das Basismodell Scribe v2: in beiden Fällen 5,3 % WER. Mit v2 Medical erhalten Sie also die Vorteile eines spezialisierten medizinischen Modells – ohne bei diesem Benchmark an Genauigkeit einzubüßen.
Entwickelt für geschützte Gesundheitsdaten
Scribe v2 Medical ist für Unternehmenskunden mit bestehendem Business Associate Agreement HIPAA-geeignet, wenn Zero Retention Mode (ZRM) aktiviert ist.
Bei aktivierter ZRM für Speech to Text-API-Anfragen werden Audioeingaben und Textausgaben unmittelbar nach Abschluss jeder Anfrage gelöscht. ElevenLabs speichert keines von beidem. Ihre Anwendung erhält die vollständige API-Antwort und steuert, wie Transkripte aufbewahrt werden.
Erste Schritte
Scribe v2 Medical ist über die Speech-to-Text-API verfügbar. Übergeben Sie einfach die neue Modell-ID: scribe_v2_medical
Das Modell läuft auf dem Batch-Speech-to-Text-Endpunkt.



