Wie funktioniert Audiotranskription mit Zeitstempeln und Ereignis-Tags?
- Verfasst von
- Jack Limebear
- Veröffentlicht
AnhörenArtikel anhören
Ein natives Transkriptionsmodell auf Wortebene verarbeitet eine Audioaufnahme oder einen Echtzeitstream und gibt ein strukturiertes Array getaggter und mit Zeitstempeln versehener Token-Objekte für Sprache und nichtsprachliche Geräusche aus. Jedes Token gehört zu einem von drei Typen: word, spacing oder audio_event. Audioereignisse können Lachen, Applaus oder andere Hintergrundgeräusche sein.
In diesem Artikel erläutern wir, wie Audiotranskription mit Zeitstempeln funktioniert und warum sie flexibler und leistungsfähiger ist als herkömmliche Transkription, die auf Forced Alignment basiert.
Zusammenfassung
- Transkription auf Wortebene gibt strukturierte, mit Zeitstempeln versehene Arrays aus Sprachdaten und nichtsprachlichen Audioereignissen direkt aus.
- Das steht im Gegensatz zu herkömmlichen Modellen für automatische Spracherkennung, die vollständige Textblöcke ausgeben. Um diese mit dem Roh-Audio zu verknüpfen, ist ein zweiter Forced-Alignment-Prozess erforderlich, der länger dauert und zusätzlichen Rechenaufwand verursacht.
- Ereignis-Tags helfen Ihnen, nichtsprachliche Inhalte wie Lachen oder Applaus zu erfassen. Da diese Daten durchsuchbar sind, können Sie damit anhand von Publikumsreaktionen Highlights oder virale Momente identifizieren.
- Sie können die strukturierten Ausgabedaten für verschiedene Anwendungsfälle an Anwendungen übergeben, darunter präzise Untertitelung, durchsuchbare Audioarchive und automatisiertes Clipping für Social Media.
- Scribes Transkription auf Wortebene unterstützt bis zu 5 Kanäle, die jeweils unabhängig transkribiert werden.
Was ist Audiotranskription mit Zeitstempeln und Ereignis-Tags?
Transkription mit Zeitstempeln ist eine Form der automatischen Spracherkennung (ASR), die beim Transkribieren die exakten Start- und Endpunkte von Wörtern und anderen Audioereignissen wie Applaus erfasst. Die Ausgabe sind vollständig strukturierte, navigierbare Daten.
Herkömmliche ASR-Transkription analysiert Audio in großen Blöcken lesbaren Textes. Sie liefert Untertitel und ein Transkript für Leser, ist als Datenformat aber wenig nützlich.
Wenn Sie den Text mit Zeitstempeln strukturieren möchten, müssen Sie ihn durch einen zweiten Machine-Learning-Dienst führen, der den Text dem Audio zuordnet. Sie können damit zwar eine ähnliche Ausgabe erzeugen, benötigen aber mehrere Verarbeitungsschritte statt einer nativen Ausgabe durch die API. Das erhöht Latenz und Rechenaufwand.
Audio navigierbar machen
Der zentrale Vorteil von Transkription mit Zeitstempeln und Ereignis-Tags: Sie ist sowohl für Menschen als auch für Maschinen lesbar. Das ermöglicht wichtige Geschäftsanwendungen:
- Compliance-Audits: Sie können ein Transkript nach Schlüsselwörtern durchsuchen und erhalten exakte Zeitstempel für jede Erwähnung sensibler Daten.
- Videoproduktion und -bearbeitung: Videoproduktionssoftware kann Untertitel auf Millisekunden genau mit dem Gesagten auf dem Bildschirm synchronisieren. Sie kann auch Publikumsreaktionen passend kennzeichnen.
- Durchsuchbare Archive: Teams aus PR, Vertrieb und Schulung können unter anderem große Mengen an Kundeninterviews, Messevorträgen, Webinaren oder Townhall-Meetings in umfangreiche durchsuchbare Archive transkribieren.
- Marketinganalysen und Kundenstimmung: Ereignis-Tags können Publikumsreaktionen kennzeichnen, die in einer einfachen Texttranskription verloren gehen würden.
Welche Vorteile bieten native Zeitstempel auf Wortebene?
Standardmäßige Speech to Text-Modelle verarbeiten Sprache in Blöcken, meist ganzen Sätzen oder Absätzen. Für Zeitstempel für jedes einzelne Wort müssen Sie eine weitere Verarbeitungsschicht entwickeln, die in einem zweiten Durchlauf Forced Alignment ausführt. Das erhöht Infrastruktur und Latenz und schafft weitere potenzielle Fehlerquellen. Beispielsweise können die Zeitstempel bei schneller Sprache oder Sprache unter lauten Hintergrundgeräuschen abweichen oder ganz ausfallen.
Transkription mit Zeitstempeln, wie Scribe sie ausführt, umgeht dieses Problem durch eine detailliertere Transkription Wort für Wort. Das geschieht in einem einzigen API-Aufruf. Zusätzliche Infrastruktur oder Skripte sind nicht erforderlich. Das Modell berechnet die Zeitstempel während der Transkription, sodass die Sprachdaten das Audio stets exakt abbilden.

Wie funktioniert Transkription mit Zeitstempeln und Ereignis-Tags?
Nehmen wir Scribe als Beispiel.
Ein natives Transkriptionsmodell auf Wortebene ordnet die Sprachlaute eines Audiofeeds einem strukturierten Array von Token-Objekten zu. Es kennzeichnet jedes Token als einen von drei Typen: word, spacing oder audio_event.
- word: Ein erkanntes einzelnes gesprochenes Wort mit erfassten Start- und Endzeiten sowie einem speaker_id-Tag.
- spacing: Explizit gekennzeichnete Stille oder Pausen innerhalb der Sprache. Hilfreich, damit Untertitelungsdienste das richtige Tempo einhalten. Wird nicht für erkannte Sprachen verwendet, die keine Wortabstände nutzen, etwa Japanisch, Mandarin, Thai, Lao, Burmesisch und Kantonesisch.
- audio_event: Bedeutungsvolle nichtsprachliche Audiosignale wie Lachen oder Applaus. Das Modell strukturiert diese als separaten Ereignistyp und zwingt das Audio nicht in halluzinierte Sprache.

Parameter für Echtzeitstreaming
Transkriptionsmodelle auf Wortebene können auch spezielle Funktionen zur Unterstützung von Live-Audiotranskription über WebSocket enthalten. Zum Beispiel:
- include_timestamps=true: Dieser Parameter sorgt dafür, dass die Verbindung Zeitstempel auf Wortebene in die JSON-Nachrichten committed_transcript_with_timestamps einschließt, die am Ende jedes finalisierten Audio-Blocks gesendet werden. So erhalten Sie Zeitstempel, während der Stream noch läuft. Tags für Audioereignisse werden nur eingeschlossen, wenn auch tag_audio_events aktiviert ist.
- include_language_detection=true: Dieser Parameter weist die Verbindung an, erkannte gesprochene Sprachen zusammen mit dem Konfidenzwert des Modells für die Erkennung zu taggen. Damit können Sie mehrsprachige Untertitel live erstellen.
Wie kennzeichnet ein Speech-to-Text-Modell nichtsprachliche Ereignisse?
Scribe kennzeichnet Audioereignisse, wenn Sie den Parameter tag_audio_events aktiviert haben. Dann kennzeichnet es konkrete Start- und Endzeiten mit Zeitstempeln, genau wie bei Wörtern. Es kann verschiedene Reaktionen taggen, am häufigsten Lachen und Applaus, aber auch andere Umgebungsgeräusche mit möglicher kontextueller Bedeutung, etwa Schritte oder Hintergrundmusik.
Unmittelbar bereichert dies Transkripte und Untertitel durch wichtigen Kontext. Sarkasmus ist für Leser beim Lesen eines einfachen, flachen Textes möglicherweise schwerer zu erkennen. Ein [laughter]-Tag ergänzt das Transkript und verleiht ihm mehr emotionale Wirkung.
Bessere Analysen
Ereignis-Tagging macht auch nachgelagerte Analysen sauberer, da diese Tools nicht einen einzigen Block unstrukturierten Textes analysieren müssen. Native Transkription auf Wortebene trennt Audioereignisse als strukturierte Daten, sodass Ihre Tools sie bei Bedarf einfach herausfiltern und nur verbale Inhalte verarbeiten können.
Da Spacing-Tokens Pausen sichtbar machen, können Sie sie analysieren. Das kann für Stimmungsanalysen und QA-Anwendungsfälle wertvoll sein, etwa um zu messen, wie lange ein Kundenservicemitarbeiter während eines Anrufs geschwiegen hat.
Einfachere Suche nach Zeitstempeln
Sie können gezielt nach diesen Ereignissen suchen. Wenn Sie die Stimmung in einem Produktinterview analysieren, können Sie aussagekräftige emotionale Reaktionen gezielt herausfiltern. Oder Sie durchsuchen als Betreiber eines Social-Media-Accounts eine einstündige Rede schnell nach Lachen, um Clips zu finden, die Ihrer Einschätzung nach besonders viral gehen könnten.
Welche praktischen Anwendungen gibt es für strukturierte Transkripte mit Zeitstempeln?
Strukturierte Daten direkt aus Transkriptionen zu erhalten, ermöglicht mehrere wichtige Anwendungsfälle.
Erstellung von Bildunterschriften und Untertiteln
Sie können Transkripte mit Zeitstempeln ohne Zwischenverarbeitung direkt in Produktionsformate für Untertitel exportieren, darunter SRT und VTT. Ihr Videobearbeitungstool kann Wort-Timing nutzen, um Wörter in den Untertiteln während des Sprechens hervorzuheben.
Das Transkriptionsmodell kann schnelle Sprache problemlos analysieren, weil es Wort für Wort verarbeitet. Während ein herkömmliches Modell bei sehr schnellem Sprechen oder überlappenden Stimmen Schwierigkeiten haben kann, liefert ein Modell auf Wortebene wie Scribe eine saubere, strukturierte Transkription.
Audio- und Videosuche
Herkömmliche Transkription ermöglicht es Ihnen, Schlüsselwörter im Textblock abzugleichen. Ohne Forced Alignment können Sie jedoch nicht zu dem Moment springen, in dem eine Phrase gesprochen wurde. Eine Stichwortsuche in einer Transkription auf Wortebene ist vollständig indexiert und führt Sie direkt zu der Sekunde im Audio, in der eine Phrase gesprochen wurde. So wird Ihr Audioarchiv zu einem vollständig durchsuchbaren Referenzkatalog. Diese Funktion ist besonders nützlich für die Verwaltung großer Medienbibliotheken, Podcast-Netzwerke und Unternehmensarchive.
Compliance- und Risikoaudits
Oft möchten Sie Audio mit sensiblen Informationen aufzeichnen, etwa Kundenservice-Anrufe für die Qualitätssicherung. Gerade diese Anrufe enthalten häufig sensible oder regulierte personenbezogene Daten.
Um Vorschriften einzuhalten und dennoch Audiodaten für Analysen zu nutzen, benötigen Sie eine Möglichkeit, sensible Daten in Transkripten in Echtzeit zu schwärzen. Native Zeitstempel auf Wortebene ermöglichen Funktionen wie ElevenLabs' Entity Detection, die sensible Entitäten wie Kreditkartennummern oder Namen markiert und deren Offsets und Zeitstempel zurückgibt. So können Sie sie in Ihren eingehenden Transkripten ausblenden.
Sie können beispielsweise eine Kreditkartennummer, den Mädchennamen der Mutter, das Geburtsdatum und den Kundennamen erkennen und schwärzen, während sie in einem Anruf zur Identitätsprüfung genannt werden.
Automatisiertes Clipping für Social Media
Sie können Stichwortsuchen auch programmgesteuert automatisieren, um Highlights in längeren Inhalten zu finden. Beispielsweise können Sie wichtige Momente aus einer Wahlkampfrede oder einem Unternehmensseminar hervorheben. So verwandeln Sie aktuelle Inhalte in professionell bearbeitete Highlights für YouTube, LinkedIn oder TikTok.
Timing für mehrere Kanäle und Sprecher
Scribe kann bis zu fünf Kanäle unabhängig und parallel transkribieren. Jeder erhält eine Sprecher-ID und Zeitstempel. Das ist zuverlässiger als die standardmäßige akustische Sprecherdiarisierung, die bei Dialogen mit häufigem Sprecherwechsel oft Schwierigkeiten hat. Bei Mehrkanalaufnahmen erfolgt Scribes Sprecherzuweisung vollständig deterministisch. Das heißt: Kanal 0 wird speaker_0 zugeordnet, Kanal 1 speaker_1 und so weiter.
Scribe erkennt Sprecher, die gleichzeitig sprechen möchten, und kann dennoch unabhängige Zeitstempel für ihre Sprache erzeugen. Sie können auch unterschiedliche Sprachen sprechen.

Zeitstempeldaten im benötigten Format exportieren
Wenn Sie herkömmliche Transkripte in mehreren Formaten ausgeben möchten, müssen Sie die Parsing-Skripte wahrscheinlich selbst schreiben. Scribe kann Transkripte je nach Verwendungszweck in mehreren Formaten exportieren. Vollständige Schemadefinitionen finden Sie in der ElevenLabs Create Transcript API-Referenz.
Strukturierte Daten für Entwickler: JSON
Scribe unterstützt den Export nach JSON für Entwickler, die Daten in einem Schema benötigen, das sie an nachgelagerte Anwendungen übergeben können. Beispielsweise können Entwickler diese JSON-Daten nutzen, um interaktive Medien oder eine semantische Suchdatenbank für Ihre Organisation zu erstellen. Das vollständige Array aus word-, spacing- und audio_event-Tokens wird mit Start- und End-Offsets sowie Sprecher-IDs ausgegeben.
Medienuntertitelung: SRT und VTT
Scribe kann SRT- und VTT-Transkripte ausgeben, die Sie ohne manuelle Synchronisierung direkt in Adobe Premiere oder andere Produktionsanwendungen importieren können.
Lesbar für Menschen: TXT, DOCX und PDF
Scribe kann Transkripte auch in lesefreundlichen Formaten ausgeben. In diesen Formaten entfernt Scribe detaillierte Zeitmarkierungen, damit der Text besser lesbar und für Rechts- oder Auditdokumentationen geeignet ist. Das ist beispielsweise nützlich, wenn Sie Protokolle von Vorstandssitzungen direkt nach einer Sitzung effizient verteilen, Podcast-Transkripte für SEO veröffentlichen oder Rechtsunterlagen archivieren müssen.

Starten Sie mit ElevenLabs-Transkriptionen mit Zeitstempeln und Ereignis-Tags
Native Transkription auf Wortebene liefert Ihnen die strukturierten Daten, die Sie für Ihre Workflows benötigen – schnell und effizient.
Starten Sie noch heute mit der Transkription Ihrer Audiodaten mit Scribe in ElevenAPI oder erfahren Sie mehr über Transkription auf Wortebene.
FAQ zu Zeitstempeln und Transkription mit Ereignis-Tags
Jack Limebear ist Teil des Growth-Teams und arbeitet als Content Writer und Stratege für Blog- und Insights-Seiten. Vor ElevenLabs leitete er über zehn Jahre die Content-Strategie für Unternehmen – von schnell wachsenden SaaS-Startups bis zu Fortune-500-Konzernen. Er hat einen Masterabschluss in Englischer Literatur von der University of Cambridge.



