Was ist Sprecherdiarisierung? Funktionsweise und Anwendungsfälle
- Verfasst von
- Jack Limebear
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Die Sprecherdiarisierung verarbeitet einen Audiostream mit unbekannter Sprecheranzahl und erstellt eine Zeitleiste mit beschrifteten Segmenten: Sprecher A von 0:00 bis 0:42, Sprecher B von 0:42 bis 1:15, danach wieder Sprecher A. Das System weiß nicht, wer die Sprecher sind, erkennt aber unterschiedliche Personen und verwendet während der gesamten Aufnahme konsistente Labels.
Dieser Prozess macht Audio mit mehreren Sprechern nutzbar. Besprechungsnotizen, Callcenter-Analysen, Interviewtranskriptionen, Podcast-Bearbeitung und juristische Dokumentationen hängen davon ab, nicht nur zu wissen, was gesagt wurde, sondern auch, wer es gesagt hat.
Dieser Leitfaden erklärt, wie Diarisierung funktioniert, wie sie sich von verwandten Verfahren wie Segmentierung und Identifizierung unterscheidet, welche Open-Source-Tools sie unterstützen und wie Sie die Leistung eines Diarisierungssystems messen.
Zusammenfassung
- Die Sprecherdiarisierung segmentiert eine Audioaufnahme danach, wer spricht, und erstellt beschriftete Sprecherwechsel, ohne Personen namentlich zu identifizieren.
- Die Sprecherdiarisierung unterscheidet sich von der Sprechersegmentierung, die Sprecherwechsel erkennt, und der Sprecheridentifizierung, die Stimmen echten Namen zuordnet.
- Die Diarisierungsleistung wird anhand der Diarization Error Rate (DER) für die Gesamtgenauigkeit und der Jaccard Error Rate (JER) gemessen, um die Genauigkeit für jeden Sprecher zu prüfen.
Was ist Sprecherdiarisierung, und wie funktioniert sie?
Sprecherdiarisierung unterteilt einen Audiostream in Segmente danach, wer spricht. Ein Transkript mit Sprecherdiarisierung versieht jedes Audiosegment mit einer Sprecheridentität. Vereinfacht beantwortet sie die Frage: „Wer hat wann gesprochen?“
Ein Rohtranskript einer Besprechung liefert die Worte. Ein diarisiertes Transkript zeigt Ihnen, dass Sprecher 1 die Frage stellte, Sprecher 2 antwortete und Sprecher 3 mittendrin unterbrach.
Die meisten Systeme zur Sprecherdiarisierung folgen einer Pipeline mit vier Stufen:

Sehen wir uns diese Stufen genauer an.
Sprachaktivitätserkennung (VAD)
Die Sprachaktivitätserkennung trennt Sprache von allem anderen: Stille, Hintergrundgeräuschen, Musik oder Tastaturklicken. Nur Audiosegmente mit tatsächlicher Sprache gelangen in die nächste Stufe.
Fehler in dieser Stufe wirken sich auf alle folgenden Stufen aus.
Segmentierung
Diese sprachhaltigen Segmente werden dann an Punkten unterteilt, an denen ein Sprecherwechsel wahrscheinlich ist, etwa bei einer Veränderung des Stimmklangs, einer Pause zwischen Sprecherwechseln oder einem anderen Tonhöhenmuster. Die meisten Systeme erkennen diese Wechselpunkte direkt, indem sie die akustischen Merkmale auf beiden Seiten einer potenziellen Grenze vergleichen.
Einige Segmentierungstools teilen Audio in kurze, gleich große Fenster, beispielsweise Zwei-Sekunden-Abschnitte, und nutzen dann die Clustering-Stufe, um benachbarte Fenster desselben Sprechers zusammenzuführen.
Embedding-Extraktion
Jedes Sprachsegment wird in ein Sprecher-Embedding umgewandelt – einen numerischen Vektor, der die stimmlichen Merkmale der sprechenden Person erfasst. Embeddings desselben Sprechers liegen im Vektorraum nah beieinander, Embeddings verschiedener Sprecher weiter auseinander.
Clustering
Anschließend werden die Embeddings gruppiert, sodass Segmente desselben Sprechers ein gemeinsames Label erhalten. Das System kennt die Sprecheranzahl meist nicht im Voraus. Der Clustering-Algorithmus muss sie daher ableiten und entscheiden, ob ein leicht anders klingendes Segment zu einem neuen Sprecher gehört oder dieselbe Person mit anderem Stimmklang zeigt.

Das Ergebnis ist eine Reihe von Sprecherlabels für Zeitbereiche, meist zusammen mit einem Transkript. Ein diarisiertes Transkript eines Gesprächs zwischen zwei Personen sieht beispielsweise so aus:
- [speaker_0] Danke für Ihren Anruf. Wie kann ich Ihnen helfen?
- [speaker_1] Hallo, ich rufe wegen meiner Rechnung vom letzten Monat an.
- [speaker_0] Gern, ich rufe sie auf.
Die Labels sind anonym und intern konsistent. Speaker_0 steht bei jedem Auftreten für dieselbe Stimme, aber das System weiß nicht, dass speaker_0 Fergal heißt. Das Zuweisen echter Identitäten ist eine andere Aufgabe, die wir unten behandeln.
Wichtige Unterschiede zwischen Sprechersegmentierung und Sprecheridentifizierung
Sprechersegmentierung und Sprecheridentifizierung überschneiden sich stark mit der Diarisierung. Daher werden die drei Verfahren oft verwechselt.
Jedes löst ein etwas anderes Problem. Deshalb ist es bei der Bewertung von Tools wichtig, den Unterschied zu verstehen.
Wie bereits erklärt, ist die Sprechersegmentierung ein früher Schritt innerhalb der Diarisierungspipeline. Sie findet die Grenzen, an denen eine Stimme zur nächsten wechselt, ohne Labels zu vergeben. Die Segmentierung zeigt Ihnen, dass bei 0:42 ein Wechsel stattfand. Die Diarisierung baut darauf auf, indem sie die resultierenden Segmente gruppiert und vollständig beschriftete Ergebnisse erstellt. So erkennen Sie, dass die Stimme bei 1:15 dieselbe ist, die zu Beginn der Aufnahme sprach.
Die Sprecheridentifizierung ist eine eigenständige Funktion außerhalb der Diarisierung, wird aber häufig damit kombiniert. Sie bestimmt, wer diese Sprecher tatsächlich sind. Ein Identifizierungssystem vergleicht Stimmen mit registrierten Stimmabdrücken und nutzt bekannte Sprecher als Referenz, um Identitäten zurückzugeben. Nach der Identifizierung werden aus speaker_0 und speaker_1 „Fergal“ und „Eric“.
Viele Produkte kombinieren diese Tools, um ein umfassenderes endgültiges Transkript zu erstellen. Ein Besprechungstool kann dies automatisch erledigen und dabei möglicherweise Angaben wie den in Teams oder Meet hinterlegten Namen verwenden. So werden die Beiträge aller Teilnehmenden ohne manuelle Prüfung namentlich zugeordnet.

Beliebte Open-Source-Tools und -Bibliotheken für Sprecherdiarisierung
Open-Source-Tools für Sprecherdiarisierung sind eine Überlegung wert, wenn Sie Kontrolle, Flexibilität oder lokale Bereitstellung benötigen. Die beste Wahl hängt von der Art Ihrer Audiodaten ab – Telefonate, Besprechungen, Podcasts oder Sendungen –, Ihren Latenzanforderungen und der verfügbaren Engineering-Zeit.
Hier sind einige der beliebtesten Optionen.
Pyannote.audio
Pyannote.audio ist ein PyTorch-basiertes Toolkit, das speziell für die Sprecherdiarisierung entwickelt wurde und zu den meistgenutzten Open-Source-Optionen zählt. Es bietet vortrainierte Pipelines für den gesamten Diarisierungs-Stack, einschließlich VAD, Segmentierung, Embeddings und Clustering, sowie Bausteine zum Trainieren oder Fine-Tuning von Modellen mit Ihren eigenen Daten.
Die vortrainierten Modelle werden über Hugging Face bereitgestellt und häufig als Diarisierungsschicht in größeren Transkriptionsprojekten eingesetzt.
WhisperX
WhisperX kombiniert OpenAIs Whisper ASR mit Diarisierung und Forced Alignment. Whisper allein erstellt gute Transkripte, vergibt jedoch keine Sprecherlabels, und seine Zeitstempel sind nur näherungsweise. WhisperX ergänzt Zeitstempel auf Wortebene und integriert Pyannote-basierte Diarisierung. So entstehen Transkripte, in denen jedes Wort sowohl einen präzisen Zeitstempel als auch ein Sprecherlabel trägt.
NVIDIA NeMo
NVIDIA NeMo enthält Diarisierung als Teil seines umfassenderen Frameworks für konversationelle KI. Es bietet trainierbare Diarisierungsmodelle, einschließlich End-to-End-Ansätzen für überlappende Sprache, und richtet sich an Teams, die benutzerdefinierte Sprachsysteme im großen Maßstab auf GPU-Infrastruktur entwickeln.
Bei jedem dieser Tools müssen Sie die Diarisierungsinfrastruktur verwalten, einschließlich Modellbereitstellung, Skalierung, Monitoring und Updates. Für Teams, die diesen Betriebsaufwand vermeiden möchten, bieten verwaltete APIs für Sprachdiarisierung eine einfachere Alternative. Sie lassen sich in bestehende Workflows integrieren oder übernehmen die gesamte Diarisierungspipeline. Damit eignen sie sich gut für Produktionsanwendungen wie Kundensupport-Analysen, Besprechungstranskription und Podcast-Verarbeitung.
Echtzeit-Diarisierung: Herausforderungen und Anwendungsfälle
Echtzeit-Diarisierung ist deutlich schwieriger als die Diarisierung einer abgeschlossenen Aufnahme, weil das System mit unvollständigem Kontext entscheiden muss.
Ein Offline-System sieht die gesamte Aufnahme, bevor es Entscheidungen trifft. Es kann eine Stimme in Minute 2 mit einer Stimme in Minute 40 vergleichen und sicher erkennen, dass es sich um denselben Sprecher handelt, weil ihm beide Momente gleichzeitig vorliegen. Ein Echtzeit-System hat diesen Vorteil nicht: Es muss Sprache beim Eintreffen beschriften, ohne zu wissen, was als Nächstes gesagt wird, und kann Entscheidungen danach kaum oder gar nicht korrigieren.
Dieser fehlende zukünftige Kontext macht insbesondere drei Probleme in Echtzeit deutlich schwieriger:
- Latenz vs. Genauigkeit: Ohne die Möglichkeit, die gesamte Unterhaltung vor und zurück zu analysieren, geht das Einhalten engerer Reaktionszeitbudgets direkt zulasten der Genauigkeit.
- Überlappende Sprache: Wenn Personen gleichzeitig sprechen, könnte ein System mit erneuter Audioverarbeitung die Stimmen möglicherweise trennen. Ein Echtzeit-System muss sie in ein einziges Label zwingen oder spezialisierte, überlappungsfähige Modelle unmittelbar einsetzen.
- Kurze Äußerungen: Ein kurzes „Ja“ oder „Nur zu“ liefert dem System kaum genug Stimme zur Analyse. Ohne umgebenden Kontext muss es trotzdem sofort ein Label vergeben.
Trotz dieser Schwierigkeit können einige Anwendungen nicht warten, bis eine Aufnahme abgeschlossen ist. Live-Untertitel für Besprechungen und Sendungen benötigen Sprecherlabels, während Personen sprechen. Callcenter-Software muss wissen, welche Worte der Kunde in Echtzeit verwendet, wenn sie Mitarbeitenden während eines Anrufs Hinweise gibt. Sprachagenten für Anrufe mit mehreren Teilnehmenden müssen ohne Verzögerung verfolgen, wer was fragt. In allen Fällen ist ein etwas weniger genaues, aber sofortiges System besser als ein genaueres mit Verzögerung.
Für Arbeitslasten, die keine Echtzeit-Labels benötigen, etwa Analysen, Compliance-Prüfungen und Transkripterstellung, bleibt Batch-Diarisierung die bessere Wahl, da sie deutlich genauer ist.
So bewerten Sie die Leistung der Sprecherdiarisierung
Bei der Messung der Diarisierungsgenauigkeit sind zwei Metriken entscheidend: die Diarization Error Rate (DER) für die Gesamtgenauigkeit und die Jaccard Error Rate (JER), die prüft, ob diese Genauigkeit für jeden Sprecher erhalten bleibt.
Die DER berechnet den Anteil der gesamten Sprachzeit, der falsch zugeordnet wurde. Sie kombiniert drei Fehlerarten:
- Falscher Sprachalarm: Das System hat ein Segment als Sprache markiert, obwohl niemand sprach.
- Nicht erkannte Sprache: Jemand sprach, aber das System hat es als Stille markiert.
- Sprecherverwechslung: Sprache wurde erkannt, aber dem falschen Sprecher zugeordnet.
DER = (falscher Alarm + nicht erkannte Sprache + Sprecherverwechslung) / gesamte Sprachdauer
Eine DER von 10 % bedeutet, dass Fehler über diese drei Arten hinweg einem Zehntel der gesamten Sprachzeit entsprechen. Niedrigere Werte sind besser, und Ergebnisse sind nur vergleichbar, wenn sie auf denselben Daten unter denselben Bedingungen gemessen werden. Die DER variiert stark mit Audioqualität, Sprecheranzahl und dem Ausmaß der Überlappung in der Aufnahme.
Die Jaccard Error Rate (JER) misst die Diarisierungsgenauigkeit für jeden Sprecher einzeln und mittelt anschließend das Ergebnis über alle Sprecher. Für jeden Referenzsprecher gleicht die Auswertung das ähnlichste Sprecherlabel des Systems ab und vergleicht die korrekt überlappende Zeit mit der Gesamtzeit, die einem der beiden Sprecher zugeordnet ist.
Stellen Sie sich beispielsweise eine 60-minütige Besprechung vor, in der Sprecher A 50 Minuten und Sprecher B 10 Minuten spricht. Ein Diarisierungssystem kennzeichnet 48 der 50 Minuten von Sprecher A korrekt, aber nur 4 der 10 Minuten von Sprecher B. Die Gesamt-DER kann dennoch relativ gut aussehen, weil Sprecher A den Großteil der Besprechung ausmacht. Die JER gewichtet das schlechte Ergebnis von Sprecher B gleich stark, weil Sprecher A und Sprecher B vor der Mittelung ihrer Werte unabhängig bewertet werden.
JER_speaker = 1 - (correct_overlap / (ref_time + sys_time - correct_overlap))
Die endgültige JER ist der Durchschnitt dieser Fehlerraten pro Sprecher:
JER = (1 / N) * Σ[JER_speaker_i] für i = 1..N
Das gemeinsame Tracking von DER und JER liefert ein vollständigeres Bild der Diarisierungsgenauigkeit: DER für die Gesamtgenauigkeit, JER dafür, ob sie für alle Teilnehmenden gilt, auch für Personen, die seltener sprechen.
Tests mit produktionsnahen Audiodaten
Berechnen Sie bei der Bewertung eines Systems zur Sprecherdiarisierung sowohl DER als auch JER anhand von Audio, das Ihren tatsächlichen Einsatzbedingungen entspricht: Ihrer typischen Sprecheranzahl, Ihrer Audioqualität und dem Ausmaß des Übersprechens.
Veröffentlichte Benchmark-Ergebnisse werden möglicherweise mit sauberen, kontrollierten Datensätzen wie Studio-Aufnahmen gemessen, die selten dem Klang echter Anrufaufzeichnungen oder Live-Besprechungen entsprechen. Ein System mit guten Benchmark-Ergebnissen kann bei verrauschtem, überlappendem Audio aus der Praxis dennoch deutlich schlechter abschneiden. Testen Sie mit Ihren eigenen Daten, bevor Sie sich für ein Diarisierungsprodukt entscheiden.
Erste Schritte mit ElevenAPI für Sprecherdiarisierung
Wenn Sie bereit sind, eine Transkriptionsfunktion mit Unterstützung mehrerer Sprecher zu entwickeln, Scribe v2 von ElevenLabs stellt Sprecherdiarisierung über eine einzige Speech to Text API bereit. Senden Sie Audio mit diarize=true an den Endpunkt. Die JSON-Antwort versieht jedes Wort mit einer Sprecher-ID – für bis zu 32 Sprecher, in mehr als 90 Sprachen und für Dateien mit einer Länge von bis zu 10 Stunden.
Zwei Optionen erweitern die Standardausgabe der Diarisierung. Für Anrufaufzeichnungen kennzeichnet detect_speaker_roles=true Sprecher als Agent und Kunde statt mit anonymen Nummern. Wenn Ihr Workspace registrierte Sprecherprofile enthält, kann use_speaker_library=true erkannte Sprecher mit registrierten Stimmen abgleichen und so Diarisierung und Identifizierung in einer Anfrage verbinden.
Ein Parameter für den Diarisierungsschwellenwert ermöglicht Ihnen, den Kompromiss zwischen zu starker Aufteilung und dem Zusammenführen von Sprechern anzupassen. Wenn Ihre Sprecher bereits auf getrennten Audiokanälen isoliert sind, etwa bei Stereo-Anrufaufzeichnungen, weist die Mehrkanaltranskription Sprecher nach Kanal zu und überspringt die Diarisierung vollständig.
Der Speech to Text-Schnellstart führt Sie Schritt für Schritt durch die erste Integration. Für regulierte Bereitstellungen erfüllt die Plattform SOC 2, ISO 27001, PCI DSS L1 und HIPAA. EU-Datenresidenz und ein Modus ohne Datenspeicherung sind verfügbar.
Möchten Sie Sprecherdiarisierung in Ihre Systeme integrieren? Beginnen Sie mit Ihrem API-Schlüssel oder werfen Sie einen Blick in die ElevenLabs-Dokumentation für weitere Informationen.
FAQ
Jack Limebear ist Teil des Growth-Teams und arbeitet als Content Writer und Stratege für Blog- und Insights-Seiten. Vor ElevenLabs leitete er über zehn Jahre die Content-Strategie für Unternehmen – von schnell wachsenden SaaS-Startups bis zu Fortune-500-Konzernen. Er hat einen Masterabschluss in Englischer Literatur von der University of Cambridge.



