Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

Was ist automatische Spracherkennung (ASR)?

Verfasst von
Jack Limebear
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

1952 konnte das fortschrittlichste Spracherkennungssystem der Welt genau 9 Wörter verstehen. 

Rund 75 Jahre später transkribiert die automatische Spracherkennung (ASR) Dutzende Sprachen in Echtzeit. Sie ermöglicht alles – von Sprachassistenten auf Ihrem Smartphone bis zu Untertiteln in Live-Videos.

Dieser Leitfaden erläutert die Technologie, die die Lücke zwischen 1952 und heute geschlossen hat: Was ASR ist, wie sie Sprache in Text umwandelt und wie sie sich bis heute weiterentwickelt.

Zusammenfassung:

  • ASR steht für automatische Spracherkennung, die Technologie zur Umwandlung gesprochener Audiodaten in geschriebenen Text.
  • Die erste Form von ASR entstand 1952. Ende der 2010er-Jahre erreichten Deep-Learning-Systeme menschliche Referenzwerte.
  • Moderne ASR nutzt Ende-zu-Ende-Neuronale Netze, die mit Millionen Stunden Audio trainiert wurden.
  • Die Wortfehlerrate (WER) ist die Standardmetrik für Genauigkeit. Doch auch Latenz, Diarisierungsqualität und Kontextverständnis sind für produktionsreife ASR relevant.
  • ElevenAPI bietet Entwicklern produktionsreife ASR, unabhängig bewertet von Artificial Analysis mit einer Wortfehlerrate von 2,2 % – dem niedrigsten Wert im Index (Juli 2026).

Was ist automatische Spracherkennung (ASR)?

Automatische Spracherkennung, oft nur unter dem Akronym ASR bekannt, bezeichnet Software, die menschliche Sprache verarbeitet und in präzisen, maschinenlesbaren Text umwandelt. Sie wird auch häufig als Speech to Text und Spracherkennung bezeichnet, manchmal auch als computerbasierte Spracherkennung.

ASR ist so verbreitet, dass Sie vermutlich jeden Tag damit interagieren, ohne es zu bemerken. Wenn Sie eine Nachricht diktieren, einem Sprachassistenten eine Frage stellen, Untertitel in einem Live-Video lesen oder durch ein interaktives Sprachdialogsystem navigieren, nutzen Sie ASR.

Obwohl Speech to Text und ASR oft synonym verwendet werden und eng verwandt sind, bezeichnen sie nicht genau dasselbe. ASR ist die Technologie, die erkennt, was gesagt wird, während STT die Anwendung dieser Technologie als Tool ist. Spracherkennungssoftware baut auf ASR auf und identifiziert, wer ein bestimmtes Wort gesagt hat. Das bildet die Grundlage für Funktionen zur Sprecherdiarisierung.

Das sind kleine, aber wichtige Unterschiede, wenn Sie ASR-, STT- oder Spracherkennungssysteme in Ihre Apps oder Website integrieren möchten.

Eine kurze Geschichte der automatischen Spracherkennung

Die Technologie der automatischen Spracherkennung ist deutlich älter, als die meisten vermuten. Ihre ersten Versionen entstanden bereits in den 1950er-Jahren. In mehr als 70 Jahren hat ASR mehrere wichtige Entwicklungsstufen durchlaufen, die ihre Fortschritte maßgeblich geprägt haben.

Dies sind die wichtigsten Epochen der ASR-Technologie:

  • 1952 und die erste ASR: 1952 entwickelten die Bell Laboratories den Automatic Digit Recognizer, bekannt als AUDREY, um die Ziffern eins bis neun zu erkennen. Das Tool war nur zu etwa 90 % genau und funktionierte nur, wenn es von seinem Erfinder verwendet wurde. Seine Einsatzmöglichkeiten waren daher äußerst begrenzt. Dennoch war bereits die Fähigkeit, 1 bis 9 zu erkennen, für die damalige Zeit beachtlich.
  • 1960er bis 1970er-Jahre und der wachsende ASR-Wortschatz: In den folgenden Jahrzehnten entwickelten Labore weltweit, darunter bei IBM, dem University College London und NEC in Japan, ähnliche Modelle wie AUDREY für verschiedene Kontexte. Raj Reddy, ein indischer Doktorand in Stanford, baute für seine Promotion einen Vokalerkenner. Damit legte er die Grundlage für kontinuierliche Spracherkennung ohne Pausen zwischen einzelnen Wörtern. DARPA (Defense Advanced Research Projects Agency) finanzierte in dieser Zeit Forschung, die zu Beam Search führte – einer Methode zur Satzkonstruktion und Dekodierung, die bis 1976 entscheidend dafür war, mehr als 1.000 Wörter zu erkennen.
  • 1980er bis frühe 2010er-Jahre und statistische Fortschritte: 1987 kombinierte ein Doktorand von Raj Reddy, inzwischen Professor, Hidden Markov Models mit Beam Search. Dadurch entstanden ASR-Systeme, die nicht auf eine bestimmte Person trainiert werden mussten. Dieser Durchbruch verkürzte die Trainingszeit für Spracherkennungssysteme erheblich. 1997 veröffentlichte Dragon Systems mit NaturallySpeaking Preferred die erste kommerziell verfügbare ASR. Sie konnte 100 Wörter pro Minute erkennen und verkaufte sich gut. 
  • Die moderne Ära und Deep Learning: In den 2010er-Jahren zeigten Forschende, dass ein einzelnes, Ende-zu-Ende mit Audio und Transkripten trainiertes neuronales Netz eine rein statistische Pipeline übertrifft. Mit tiefen neuronalen Netzen erreichten ASR-Systeme eine nahezu menschliche Leistung mit Fehlerraten zwischen 5 % und 10 %. In dieser Zeit kamen sprachbasierte Assistenten wie Alexa und Siri auf den Markt. 

Seitdem ist ASR immer präziser und weiter verbreitet geworden. Im Juli 2026 identifizierte die unabhängige Studie von Artificial Analysis ElevenLabs Scribe v2 mit einer branchenführenden Wortfehlerrate (WER) von nur 2,2 %. 

Chart showing Scribe V2 with the lowest word error rate at 2.2%, indicating high transcription accuracy.

Wie funktioniert ASR? Die Grundlagen der Speech-to-Text-Technologie

ASR erfasst eine Audioprobe, wandelt sie in eine numerische Darstellung um und nutzt anschließend ein trainiertes Modell, um die wahrscheinlichste Wortfolge vorherzusagen, die diese Werte repräsentieren. Moderne ASR führt dieses gesamte Ende-zu-Ende-Verfahren in Echtzeit und in weniger als einer Sekunde aus.

Flowchart of the automatic speech recognition process by ElevenLabs to explain what it ASR

Eine ASR-Pipeline besteht aus fünf Hauptphasen:

  1. Audioerfassung und Vorverarbeitung: Das System zeichnet das Audiosignal auf, entfernt Hintergrundgeräusche, reduziert Echo und normalisiert Lautstärkepegel für konsistentere Ergebnisse. Je nach Modell kann es vor Beginn der Transkription die Sprachaktivitätserkennung (VAD) nutzen, um Sprache von Stille oder Hintergrundgeräuschen zu unterscheiden.
  2. Merkmalsextraktion: Audio wird in eine numerische Darstellung umgewandelt, meist ein Spektrogramm oder Mel-Frequenz-Merkmale. Diese bilden die Frequenzen und Muster menschlicher Sprache präzise ab. Dieser Schritt wandelt eine rohe Wellenform in Daten um, die ein Machine-Learning-Modell effektiv verarbeiten kann.
  3. Akustische Modellierung: Ein neuronales Netz analysiert die Merkmale aus dem vorherigen Schritt und sagt Phoneme oder andere Spracheinheiten voraus. Es lernt die Beziehung zwischen akustischen Mustern und gesprochener Sprache. Moderne Ende-zu-Ende-Modelle führen diesen Schritt häufig gemeinsam mit dem Sprachverständnis aus, statt als völlig separate Phase.
  4. Sprachmodellierung und Dekodierung: Das System gewichtet dann, welche Wortfolgen anhand von Regeln wie Grammatik, Kontext und mathematischer Wahrscheinlichkeit am wahrscheinlichsten sind. Die letzten beiden Faktoren sind entscheidend: Die IPA-Transkription (Internationales Phonetisches Alphabet) zweier Sätze kann ähnlich sein, obwohl ihr Kontext völlig unterschiedlich ist. Beispielsweise können „Recognize Speech“ und „Wreck a nice peach“ gleich klingen, aber völlig unterschiedliche Bedeutungen haben. Wenn die Präzision allein keine eindeutige Entscheidung zulässt, hilft der Kontext dem System bei der Auswahl. 
  5. Ausgabeformatierung: Nachdem das System entschieden hat, was die Sprache enthält, wird der endgültige Text mit Satzzeichen und Großschreibung transkribiert. Zusätzliche Metadaten wie wortgenaue Zeitstempel und Sprecherlabels ermöglichen detailliertere Transkripte.

Über diese Hauptphasen hinweg wandelt das Modell eingehende Audiodaten in ein geschriebenes Transkript um.

Traditionelle Hybridsysteme vs. Ende-zu-Ende-ASR mit Deep Learning

Die oben beschriebene Pipeline erklärt zwar, wie ASR funktioniert. Für den mittleren Teil dieser Pipeline gibt es jedoch zwei technologische Ansätze. 

Ältere Systeme verketten mehrere Komponenten: ein Lexikonmodell, das die Aussprache von Wörtern kodiert, ein akustisches Modell, das Audio Phonemen zuordnet, und ein Sprachmodell, das wahrscheinliche Wortfolgen vorhersagt. Jede dieser Komponenten erfordert menschliches Fachwissen – von Linguisten, die Aussprachewörterbücher manuell erstellen, bis zu Annotatoren, die jedes Wort seiner genauen Position im Audio zuordnen.

Ende-zu-Ende-Deep-Learning führt all diese Komponenten in einem einzigen neuronalen Netz zusammen. Das Netz ordnet Audio direkt Text zu und erfasst Aussprache, Akustik und Sprachwahrscheinlichkeiten implizit aus Millionen Stunden zusammengehöriger Audio- und Transkriptdaten.

Sehen wir uns die Unterschiede zwischen traditionellen und modernen ASR-Ansätzen an. 

Traditional hybrid
Architecture
Separate lexicon, acoustic, and language model components
Training data
Requires force-aligned, expert-annotated audio
Human expertise
Phoneticians and linguists per language with annotators for each segment
Accuracy trajectory
Plateaued in the 2010s
Accents and noise
Brittle outside training conditions
New language support
Months of expert work
End-to-end deep learning
Architecture
Single unified neural network
Training data
Learns from raw audio and transcript pairs across huge volumes of training data
Human expertise
Minimal, scales across languages
Accuracy trajectory
Still improving with more data and compute
Accents and noise
Far more robust across real-world audio
New language support
Fine-tuning on new data

So wird die ASR-Genauigkeit gemessen: Benchmarks zur Wortfehlerrate (WER)

Für alle Speech-to-Text- und ASR-Workflows ist die Wortfehlerrate (WER) die wichtigste Genauigkeitsmetrik für Unternehmen. Sie vergleicht ein maschinell per ASR erstelltes Transkript mit einer von Menschen geprüften Version. Dabei werden drei Hauptfehlertypen berücksichtigt: Ersetzungen, Löschungen und Einfügungen.

Die WER-Formel teilt die Gesamtzahl der Fehler durch die Anzahl der Wörter im Referenztranskript. Eine WER von 5 % bedeutet, dass das System 95 % des Textes korrekt transkribiert hat. Die meisten führenden Modelle liegen inzwischen deutlich unter 5 % und nähern sich der Perfektion.

WER ist ein nützlicher Benchmark. Bei der Bewertung der Wirksamkeit eines ASR-Tools sollten jedoch auch andere Faktoren berücksichtigt werden:

  • Formatierungsgenauigkeit: Kann das System nicht standardisierte Zeichenfolgen korrekt formatieren? Wird ein Geldbetrag wie 1.225 $ beispielsweise so angezeigt oder als „eintausendzweihundertfünfundzwanzig Dollar“ ausgeschrieben?
  • Latenz: Genauigkeit ist wichtig. Doch wenn die Erstellung eines einfachen Transkripts mehrere Minuten dauert, ist ein Tool nicht praktikabel. Selbst bei hoher Genauigkeit muss es eine niedrige Latenz bieten, um nützlich zu sein.
  • Robustheit: Auch Anwendungsfälle wie starke Akzente oder laute Hintergrundgeräusche sollten die Modellgenauigkeit nicht deutlich senken. 
  • Diarisierungsqualität: Anwendungsfälle mit mehreren Sprechern hängen davon ab, jedes Wort korrekt der richtigen Person zuzuordnen. Unterschiedliche Sprecher zu identifizieren und korrekt zu kennzeichnen, trägt zur ASR bei – besonders in Branchen mit vielen Sprechern wie Gerichtsverhandlungen.

Weitere Informationen finden Sie in unserem umfassenden Leitfaden zur Wortfehlerrate.

Explanation of Word Error Rate (WER) formula and components for ASR accuracy.

Die wichtigsten Vorteile von ASR für moderne Unternehmen

Der globale Markt für Sprach- und Stimmerkennung wird voraussichtlich bis 2030 auf über 23,11 Milliarden US-Dollar wachsen. Die jährliche Wachstumsrate von 19,1 % zeigt, wie verbreitet diese Technologie in kommerziellen Geräten geworden ist. Jedes moderne Smartphone verfügt über eine Diktaturtastatur und einen Sprachassistenten, die meisten neuen Autos reagieren auf Sprachbefehle und smarte Lautsprecher oder Assistenten gehören inzwischen weltweit zum Alltag.

Die Interaktion mit Technologie per Sprache ist heute ein Standardweg für Kunden. Für Unternehmen ermöglicht ASR alles von der Transkription von Kundengesprächen bis zur Unterstützung durch Sprachagenten, integriert sich in Prozesse und steigert die Produktivität.

Hier sind einige der wichtigsten Vorteile von ASR für moderne Unternehmen:

  • Schnellere Eingabe und Dokumentation: Bereits vor über 10 Jahren veröffentlichte Stanford eine Studie, die zeigte, dass Spracherkennung fast dreimal schneller als Tippen auf einer Tastatur war und zugleich eine niedrigere Fehlerrate aufwies. Für die meisten Menschen ermöglicht ASR eine schnellere Dokumentation für Transkriptions-Workflows und sprachbasierte Notizen.
  • Niedrigere Betriebskosten: In vielen Anwendungsfällen, die früher stundenlange manuelle Notizen erforderten, senkt ASR die Kosten für hochwertige Transkriptionen erheblich. Gerichtsverfahren, Contact Center, Gesundheitskliniken und Geschäftstreffen können heute präzise ASR-Systeme nutzen, die detaillierte Notizen und vollständige diarisierten Gesprächstranskripte erstellen. 
  • Bessere Barrierefreiheit: Die Weltgesundheitsorganisation prognostiziert, dass 2,5 Milliarden Menschen bis 2050 mit einer Form von Hörverlust leben werden. Echtzeit-Untertitel fortschrittlicher ASR-Tools können digitale Meetings und Medien für Nutzer zugänglich machen.
  • Durchsuchbare Sprachdaten: Wenn Sie Sprache automatisch mit ASR transkribieren, wird jede Interaktion zwischen Kunden und Unternehmen vollständig erfasst. Jeder Vertriebsanruf, jedes Support-Ticket, jedes Gespräch mit Interessenten und jedes Meeting wird zu einem durchsuchbaren und prüfbaren Text. Besonders im KI-Zeitalter hilft maschinenlesbarer Kontext beim Aufbau umfassender Wissensdatenbanken. Das sorgt für sichtbare Informationen – für Funktionalität ebenso wie für Compliance. 
  • Ständige Kundenerlebnisse: ASR liefert eine der grundlegenden Technologien für Sprachagenten und ermöglicht automatisierte Support-Anwendungsfälle, die Kundenanrufe lösen – rund um die Uhr, 365 Tage im Jahr.

Automatische Spracherkennung ist in der Technologie so verbreitet, weil ihre Integration viele Vorteile bietet und sie zahlreiche Anwendungsfälle unterstützt. Ob Sie im Gesundheitswesen arbeiten oder Kundengespräche für Stimmungsanalysen transkribieren möchten: ASR ist eine grundlegende Technologie, die Sie einsetzen werden. 

Beliebte ASR-Anwendungen in verschiedenen Branchen

Automatische Spracherkennung ist eine zentrale Technologie in unzähligen Workflows und Produkten. Sie ist so allgegenwärtig, dass Nutzer oft gar nicht darüber nachdenken, wie sie in ihre verwendete Technologie integriert ist.

Hier ist ein kurzer Überblick über beliebte ASR-Anwendungsfälle weltweit.

Kundenservice und Contact Center

Contact Center gehörten zu den frühen ASR-Anwendern und nutzten sie zur Transkription von Anrufen für Qualitätssicherung und Compliance. Heute kann ASR in Echtzeit arbeiten, Mitarbeitenden während eines Gesprächs Vorschläge liefern und Tausende Kundeninteraktionen in Daten umwandeln, die Teams analysieren können. 

Medien und Unterhaltung

Sender und Streaming-Plattformen können ASR nutzen, um Untertitel und Captions für menschliche Gespräche in einem Umfang zu erstellen, den menschliche Transkribierende nie erreichen könnten. Sie ermöglicht Echtzeit-Transkription und macht Video- und Audiobibliotheken vollständig durchsuchbar.

Gesundheitswesen

Klinisches Personal verbringt einen überraschend großen Teil des Tages mit Dokumentation und Aktenführung. ASR gibt ihnen diese Zeit zurück und bietet Ärzten eine medizinische STT-Plattform, in die sie ihre Notizen in Echtzeit diktieren können.

Virtuelle Meetings

Meeting-Plattformen bieten häufig digitale Notizfunktionen, die Gespräche währenddessen transkribieren. So muss niemand zwischen Teilnahme und Notizen wählen. Dienste wie Google Meet senden diese Transkripte nach jedem Meeting sogar mit hervorgehobenen Aktionspunkten und helfen so, einen durchsuchbaren Informationsindex aufzubauen. 

Recht und Compliance

Im rechtlichen Umfeld ist die präzise Aufzeichnung dessen, was gesagt wurde und von wem, eine zentrale Anforderung vor Gericht. Anwaltskanzleien nutzen ASR-Plattformen, um ihre Meetings, Anhörungen, Mandantengespräche und Gerichtstermine mit präzisen Zeitstempeln für spätere Referenzen zu transkribieren. 

Bildung

Hochschuldozierende können aufgezeichnete Transkripte ihrer Vorlesungen bereitstellen, damit Studierende die besuchten Veranstaltungen dokumentieren können. Zum Verstehen und Einprägen von Informationen steht ihnen so eine umfassende Ressource als Ausgangspunkt zur Verfügung.

Die Rolle von ASR in einer Sprachagenten-Pipeline

ASR ist ein Standardbestandteil verschiedener Technologieimplementierungen. Bei Sprachagenten ist sie die erste von drei übergeordneten Phasen, die in einer kontinuierlichen Schleife ablaufen.

  • Zuhören (ASR): Der Agent erfasst eingehende Audiostreams und wandelt Sprache in Echtzeit in Text um. Moderne ASR verarbeitet Audio kontinuierlich beim Eintreffen, filtert Hintergrundgeräusche, verarbeitet Unterbrechungen, erstellt Teiltranskripte und erkennt, wann jede Person spricht. 
  • Denken (Sprachmodell): Ein großes Sprachmodell interpretiert das Transkript, erkennt die Absicht des Nutzers, ruft Informationen aus verbundenen Tools und Wissensdatenbanken ab, erhält den Gesprächskontext und bestimmt die passendste Antwort oder Aktion. 
  • Sprechen (Text to Speech): Ein Text to Speech-Modell wandelt die generierte LLM-Antwort in natürliche, ausdrucksstarke Audiodaten um. Moderne TTS-Systeme können Tempo, Intonation, Emotion und Betonung anpassen, während das Audio zurück an den Anrufer gestreamt wird – statt auf die vollständige Antwort zu warten. 

Konversationslatenz summiert sich über all diese Phasen hinweg. Streaming-ASR gibt Wörter aus, sobald sie gesprochen werden, statt auf das Ende einer Äußerung zu warten. Das reduziert die Latenz. ElevenAgents nutzt dies als Standard für Echtzeit-Sprachagenten und schafft so ein effizientes Agentenerlebnis.

Herausforderungen bei ASR und die Weiterentwicklung der Technologie

Obwohl die ASR-Technologie seit ihren Anfängen 1952 große Fortschritte gemacht hat, bestehen weiterhin Herausforderungen, die die Genauigkeit verringern können.

Hier sind einige Probleme, auf die ASR-Tools noch heute stoßen:

  • Akzente und Dialekte: Verfügbare Trainingsdaten konzentrieren sich typischerweise auf einige wenige Sprachen und Akzente. Weniger verbreitete Akzente oder Sprachen mit weniger Sprechern sind daher für ASR-Tools schwieriger. Umfangreiche und vielfältige Trainingsdaten sind hier die Lösung.
  • Hintergrundgeräusche und überlappende Sprecher: Umgebungen mit schwankender Lautstärke oder lauten Hintergrundgeräuschen erschweren es, einzelne Wörter einer Aufnahme zu erkennen. Überlappende Sprecher können einen ähnlichen Effekt haben und die Genauigkeit einer ASR-Transkription verringern.
  • Domänenspezifischer Wortschatz: Fachgebiete mit spezifischem Jargon oder Akronymen benötigen domänenspezifische Wörterbücher und Referenzen, um die Genauigkeit zu erhöhen. Medizin und Recht sind zwei Bereiche, in denen ASR-Tools zusätzliche Unterstützung oder spezialisiertes Training benötigen.
  • Datenschutz und Sicherheit: In vielen Rechtsordnungen gelten Sprachdaten als personenbezogene Daten. Unternehmen benötigen klare Aufbewahrungsrichtlinien und Schutzmechanismen für den Umgang mit Sprachdaten und zur Einhaltung umfassender Vorschriften.

Bei der Arbeit mit ASR-Technologie ist das Verhältnis zwischen Latenz und Genauigkeit ein weiterer wichtiger Faktor. Bestimmte Anwendungsfälle müssen beides ausbalancieren, während Bereiche wie die Medizin vermutlich vor allem Genauigkeit priorisieren. 

Starten Sie mit ElevenAPI für produktionsreife ASR-Integration

ElevenAPI bringt produktionsreife automatische Spracherkennung mit Scribe v2, dem ElevenLabs Speech-to-Text-Modell, in Ihr Produkt. Scribe v2 bietet wortgenaue Zeitstempel, Sprecherdiarisierung, Audioereignis-Tagging sowie die für Echtzeitanwendungen erforderliche Genauigkeit und Zuverlässigkeit.

Weitere Informationen finden Sie auf der Seite ElevenLabs Speech to Text oder erstellen Sie ein kostenloses Konto, um eine API in wenigen Minuten einzurichten. 

Häufige Fragen zu ASR

Verfasst von

Jack Limebear ist Teil des Growth-Teams und arbeitet als Content Writer und Stratege für Blog- und Insights-Seiten. Vor ElevenLabs leitete er über zehn Jahre die Content-Strategie für Unternehmen – von schnell wachsenden SaaS-Startups bis zu Fortune-500-Konzernen. Er hat einen Masterabschluss in Englischer Literatur von der University of Cambridge.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio