Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

So verwenden Sie eine API für die Meeting-Transkription: Echtzeit und Batch mit Scribe v2

Verfasst von
Jack Limebear
Veröffentlicht

AnhörenArtikel anhören

Meeting-Notizen manuell zu erstellen ist mühsam und fehleranfällig, besonders wenn ein Meeting länger als eine Stunde dauert. Das kostet Zeit und lenkt Teilnehmende von der Diskussion ab. Selbst mit einer Audioaufnahme ist es schwierig, bestimmte Gesprächsbeiträge einzelnen Sprechern zuzuordnen. 


Mit einer API für Meeting-Transkription können Sie Live- oder aufgezeichnete Meetings in Ihrem Produkt in Text mit Zeitstempeln und Sprecherkennzeichnung umwandeln. Sie senden Audio und erhalten ein strukturiertes Transkript zurück, ohne selbst ein Sprachmodell entwickeln zu müssen.

In diesem Artikel erfahren Sie, wie eine API für Meeting-Transkription funktioniert, wie sich Echtzeit- und Batch-Transkription unterscheiden und wie Sie mit Eleven Scribe v2 und Eleven Scribe v2 Realtime entwickeln.

Zusammenfassung

  • Eine API für Meeting-Transkription wandelt Meeting-Audio in Transkripte mit Zeitstempeln und Sprecherkennzeichnung um.
  • Echtzeit-Transkription ermöglicht Untertitel im Meeting mit niedriger Latenz, während die Batch-Transkription Audioaufnahmen nach Ende des Meetings verarbeitet.
  • Die Genauigkeit der Meeting-Transkription hängt von der Audioqualität, den Sprachmustern der Sprecher und dem zugrunde liegenden Sprachmodell ab. 
  • ElevenLabs bietet die Modelle Scribe v2 und Scribe v2 Realtime, mit denen Entwicklungsteams hochpräzise Produkte für Meeting-Transkription entwickeln können. 

Was eine API für Meeting-Transkription leistet und wer sie braucht

Eine API für Meeting-Transkription nimmt Meeting-Audio als Eingabe und gibt Text zurück. Sie übernimmt Spracherkennung, Sprecherdiarisierung und Zeitstempel und bietet Ihnen damit ein vollständiges Paket. Im Vergleich zu manuellen Notizen liefert Speech to Text für Meetings den Teilnehmenden eine durchsuchbare Aufzeichnung, die sie später erneut nutzen können.

Da immer mehr Teams KI-Agenten einsetzen, werden schriftliche Meeting-Protokolle zu durchsuchbarem Kontext. Ein interner Agent durchsucht Transkripte nach Details und macht Informationen sichtbar, die Datensilos reduzieren und den teamübergreifenden Informationszugang verbessern.

Viele kommerzielle Tools bieten Transkription, erfüllen jedoch möglicherweise nicht alle Anforderungen eines Unternehmens.


Für Produktentwicklungsteams ist es manchmal sinnvoller, eine STT-App für Meetings zu entwickeln oder die Funktion in ein bestehendes Tool zu integrieren. Mit eigener Software für Meeting-Transkription behalten Sie die Kontrolle über Folgendes:

  • Datenschutz: ElevenLabs bietet Enterprise-Nutzern den Zero Retention Mode und erfüllt damit zusätzliche Datenschutzanforderungen in bestimmten Regionen. 
  • Benutzerdefiniertes Vokabular: Sie geben dem Modell zusätzlichen Kontext, damit es Begriffe Ihres Unternehmens, Produkts und Ihrer Branche versteht und korrekt transkribiert. 
  • Individueller Workflow: Statt auf anbieterspezifische Workflows beschränkt zu sein, entwickeln Sie ein Tool für Meeting-Transkription, das sich mit Ihrer internen Datenbank, Ihrem CRM und Ihrer Unternehmenssoftware verbindet. 


ElevenLabs bietet führende Sprach- und Audiomodelle, mit denen Sie eine App für Meeting-Transkription entwickeln können. Mit unserer API für Meeting-Transkription erfassen Sie präzise, was in einem Meeting gesagt wird, und wandeln es in Textnotizen um. Unsere Modelle unterstützen über 90 Sprachen, sodass Sie Englisch, Französisch, Mandarin und Dutzende weitere Sprachen transkribieren können. 

Why teams build custom meeting transcription API: privacy, vocabulary, workflow, and searchable AI context.

Echtzeit- oder Batch-Speech to Text für Meetings: So wählen Sie

Die Echtzeit-Transkription erfasst Audiostreams während sie gesprochen werden und wandelt sie in Live-Untertitel um. Sie nutzen Echtzeit-Transkription, um während des Meetings Textunterstützung bereitzustellen oder mit einem Live-Bot Aktionen während der Sitzung auszulösen. Die Batch-Transkription verarbeitet dagegen die gesamte Aufnahme nach einem Meeting und liefert ein kompakteres, strukturiertes Transkript. Sie hilft beim Erstellen von Notizen nach dem Meeting, bei der Dokumentation und bei der Pflege prüfbarer Aufzeichnungen. 

Bei der Wahl zwischen Echtzeit- und Batch-Speech-to-Text-Transkription sollten Sie die technischen und finanziellen Auswirkungen verstehen. 

Hier sehen Sie auf einen Blick, wie sich beide Ansätze unterscheiden.

Merkmale

Echtzeit-Transkription

Batch-Transkription

Technischer Betrieb

Erfasst Audiostreams live während sie gesprochen werden. Erfordert eine aktive Verbindung mit dem Sprachmodell. 

Verarbeitet die gesamte Audioaufnahme nach einem Meeting. Kann asynchron erfolgen.  

Genauigkeit 

Standard. Verarbeitet Audio ohne vollständigen Kontext in Echtzeit.

Höher. Hat ausreichend Zeit, den gesamten Gesprächskontext zu analysieren.

Anwendungsfälle

Live-Untertitel im Meeting, Meeting-Bot. 

Notizen nach dem Meeting, Dokumentation.

Kosten

Höher, da eine dauerhafte Verbindung erforderlich ist.

Niedriger durch die Effizienz der Stapelverarbeitung. 

Letztlich hängt Ihre Wahl von Ihren Prioritäten ab. Wenn Sie einen Live-Meeting-Assistenten entwickeln, müssen Sie in Echtzeit transkribieren. Andernfalls nutzen Sie die Batch-Transkription, die Kosten- und Präzisionsvorteile bietet. 

So richten Sie eine API für Meeting-Transkription mit Scribe v2 ein

ElevenLabs Speech to Text ermöglicht Ihnen, Meetings mit Scribe v2 Realtime und Scribe v2 zu transkribieren. Beide Sprachmodelle sind darauf trainiert, Sprecher bei verschiedenen Akzenten, Dialekten und Audioqualitäten präzise zu kennzeichnen. Scribe v2 Realtime ermöglicht die sofortige Transkription gesprochener Sprache, während Scribe v2 Audioaufnahmen in hochpräzise Transkripte umwandelt. 

Sie können über unsere API auf beide Modelle zugreifen. Im Folgenden betrachten wir jedes Modell detailliert und zeigen die wichtigsten Funktionen, die API-Architektur sowie Integrationsmöglichkeiten für Ihre Transkriptionslösung. 

Option 1: Echtzeit-Transkription (live) 

Mit der Echtzeit-Transkription verarbeiten Sie Gespräche während eines Meetings und wandeln sie in Text um, während die Sprecher reden. Zwischen hörbarer und transkribierter Sprache gibt es kaum oder keine wahrnehmbaren Lücken. 

Für die Transkription in Echtzeit verwenden Sie Scribe v2 Realtime. Das Modell erreicht eine niedrige Latenz von 150 ms zwischen Audioeingabe und Textausgabe, einschließlich nahezu sofortiger Teiltranskripte. Bei der Integration in Ihre Transkriptions-App erhalten Sie dadurch lückenlose Untertitel. 

Scribe v2 Realtime wurde für Live-Gespräche entwickelt und eignet sich für Anwendungsfälle mit Live-Untertiteln, Echtzeit-Meeting-Notizen oder der Übergabe von Live-Text an einen KI-Assistenten für nachgelagerte Auslöser. Außerdem unterstützt das Modell bis zu 50 Schlüsselbegriffe für Prompting. 

So transkribieren Sie mit Scribe v2 Realtime


Für die Live-Transkription verbinden Sie Ihr Produkt über ElevenAPI mit Scribe v2 Realtime. 

  1. Öffnen Sie zuerst einen WebSocket, damit Ihr Produkt Transkripte vom Modell Scribe v2 Realtime empfangen kann. 
  2. Senden Sie anschließend Streams von Live-Meeting-Gesprächen an das Modell. 
  3. Empfangen Sie abschließend Teiltranskripte und finale Transkripte innerhalb von 150 ms. 


In Ihrem Code erstellen Sie Handler für API-Ereignisse, die während des gesamten Transkriptionsprozesses auftreten. Ihr Code verarbeitet beispielsweise Ereignisse beim Senden von Audiodaten und beim Empfangen eines bestätigten Transkripts. 

Live meeting transcription workflow: open WebSocket, stream audio, receive partial and final text.

Methoden für Live-Streaming mit Scribe v2 Realtime

Das folgende Beispiel erstellt ein Einmal-Token in Ihrem Backend. Ihr Client kann Meeting-Audio an die API für Meeting-Transkription streamen, ohne Ihren API-Key offenzulegen.

// Node.js server
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
  apiKey: process.env.ELEVENLABS_API_KEY,
});

app.get("/scribe-token", yourAuthMiddleware, async (req, res) => {
  const token = await elevenlabs.tokens.singleUse.create("realtime_scribe");

  res.json(token);
});

Abhängig von Ihrer App-Architektur können Sie Live-Gespräche mit Scribe v2 Realtime über die Client-App oder den Backend-Server streamen.

  • Clientseitiges Streaming: Bei dieser Methode übergeben Sie die Audioeingabe direkt vom Mikrofon oder durch manuelles Chunking an das Audiomodell. Für die Verbindung mit der API authentifizieren Sie sich mit einem Einmal-Token, sodass Ihr API-Key nicht offengelegt wird. 
  • Serverseitiges Streaming: Mit dieser Methode können Sie Audio direkt von einer URL, aus Datei-Uploads oder einem Audiostream streamen. Statt eines Einmal-Tokens verwenden Sie Ihren ElevenLabs API-Key. 

Commit-Strategie für Scribe v2 Realtime wählen

Das folgende Beispiel konfiguriert die Spracherkennung bei Aktivität. Die API bestätigt ein Transkriptsegment, sobald ein Sprecher pausiert.

import { Scribe, AudioFormat, CommitStrategy } from "@elevenlabs/client";

const connection = Scribe.connect({
  token: "sutkn_1234567890",
  modelId: "scribe_v2_realtime",
  audioFormat: AudioFormat.PCM_16000,
  commitStrategy: CommitStrategy.VAD,
  vadSilenceThresholdSecs: 1.5,
  vadThreshold: 0.4,
  minSpeechDurationMs: 100,
  minSilenceDurationMs: 100,
});

Das finale Transkript liefert beweiskräftige Aufzeichnungen, die präzise erfassen, was im Meeting gesagt wird. Es gibt zwei Möglichkeiten, finale Transkripte zu bestätigen: manuell oder mit Voice Activity Detection (VAD). 

  • Manueller Commit: Standardmäßig müssen Sie das Transkriptsegment in Ihrem Code manuell bestätigen. Für optimale Latenz empfehlen wir einen Commit alle 20 bis 30 Sekunden. Wenn Sie Kontextverlust befürchten, können Sie den vorherigen Text zusammen mit dem Audiosegment zur Verarbeitung senden.
  • Voice Activity Detection: Alternativ können Sie VAD verwenden. Die Funktion erkennt Stille im Audiostream und startet die Transkription. 

Option 2: Batch-Transkription (nach dem Meeting) 

Die Batch-Transkription ist eine effiziente Möglichkeit, stundenlange Meeting-Aufnahmen in Text umzuwandeln. Sie liefert prägnante, kontextrelevante und diarisierten Transkripte im großen Maßstab.

Scribe v2 ist ein Speech-to-Text-Modell von ElevenLabs, das dynamische Audio-Tags unterstützt. Sie können Gesprächsdaten zusammen mit nichtsprachlichen Ereignissen wie Lachen und Schritten präzise extrahieren. 

Im Gegensatz zur Echtzeit-Transkription wurde Scribe v2 für Meeting-Notizen nach der Aufnahme entwickelt. Sie zeichnen Meetings beispielsweise auf Plattformen wie Zoom, Teams und Google Meet auf. Anschließend laden Sie die Audiodateien nach der Sitzung zur Batch-Transkription in Scribe v2 hoch. 

Batch transcription workflow: upload recording, receive webhook, and verify its HMAC signature.

So transkribieren Sie mit Scribe v2 im Batch 

Die Transkription mit Scribe v2 erfolgt asynchron über eine REST API. Sie müssen keine aktive Verbindung mit dem Sprachmodell aufrechterhalten. Stattdessen benachrichtigt Sie ein Webhook, sobald das Transkript bereit ist.

Im Folgenden sehen Sie den logischen Ablauf, der Audioaufnahmen in ein Transkript umwandelt.

Create webhook dialog configuring callback URL, HMAC authentication, and event subscriptions.

 

  1. Erstellen Sie zuerst einen Webhook im ElevenLabs-Dashboard, um die Transkriptionsergebnisse zu empfangen.
  2. Erstellen Sie dann Event-Handler in Ihrem Code, um die zurückgegebene Transkription zu verarbeiten. 
  3. Laden Sie anschließend Audiodateien zum Scribe v2 REST-Endpunkt hoch. 


Sobald die Transkription abgeschlossen ist, wird der von Ihnen konfigurierte Event-Handler aufgerufen. 

Keyword-Prompting für Scribe v2

Scribe v2 (Batch) unterstützt bis zu 1.000 Begriffe für Keyword-Prompting. Wenn Sie eine Audiodatei zur Transkription senden, können Sie die Begriffe im API-Aufruf angeben. Anders als bei einer Vokabelliste vergleicht Scribe v2 die Schlüsselbegriffe mit dem Gesprächskontext, um die passende Transkription zu bestimmen.


Dadurch achtet das Modell besonders auf bestimmte Begriffe, wenn jemand sie sagt, und transkribiert sie korrekt. 

Das folgende Beispiel übergibt Unternehmens- und Produktbegriffe mit der Anfrage. Die API transkribiert sie dadurch im jeweiligen Kontext korrekt. 

connection = await elevenlabs.speech_to_text.realtime.connect(RealtimeUrlOptions(
    model_id="scribe_v2_realtime",
    keyterms=["ElevenLabs"],
))

So transkribiert es beispielsweise „ElevenLabs“, wenn Sie das Wort im Kontext als Marke oder Unternehmen aussprechen. 

Mehrkanal-Transkription für Scribe v2

Mehrkanal-Transkription ermöglicht dem Modell Scribe v2, einzelne Kanäle einer Audiodatei mit Sprache unterschiedlicher Sprecher zu transkribieren. Diese Funktion ist nützlich, wenn Sie ein Transkriptionstool für Konferenzen, Gerichtsaufzeichnungen oder Podcasts entwickeln. 

Jeder Kanal erhält eine eindeutige Kennung, die einen Sprecher repräsentiert.

Häufige Herausforderungen bei der Meeting-Transkription und wie die API sie löst 

Bei der Transkription von Meetings stehen Entwicklungsteams oft vor mehreren Herausforderungen.

Slide outlines four meeting transcription challenges, API solutions, and keyterm limits.

Überlappende Gespräche 

Wenn mehrere Sprecher gleichzeitig sprechen, ist schwer zu verstehen, was gesagt wird. Um Sprecher zu unterscheiden, nutzen Sie die von Scribe v2 angebotene Diarisierung oder Mehrkanal-Transkription. So erhalten Sie separate Transkriptionen mit Kennzeichnung des jeweiligen Sprechers.

Fehlinterpretationen

Eine weitere Herausforderung für Transkriptionstools ist die präzise Erkennung und Interpretation bestimmter Produkte, Marken oder Branchenbegriffe. Beispielsweise könnte „DevOps“, ein Softwareentwicklern vertrauter Begriff, fälschlicherweise als „dev ops“ transkribiert werden. Mit der ElevenLabs API für Meeting-Transkription können Sie das Modell durch Keyword-Prompting zur korrekten Interpretation anleiten.

Mehrsprachige Sprecher

Manche Meetings finden in verschiedenen Sprachen statt, wobei Sprecher zwischen zwei oder mehr Sprachen wechseln, die sie beherrschen. Standard-Sprachmodelle haben Schwierigkeiten, Kontext und Sprachinhalte zu interpretieren, was zu schlechter Transkriptionsqualität führt. Scribe v2 ermöglicht mehrsprachige Transkription in über 90 Sprachen und erfasst Gespräche präzise, während sie stattfinden. 

Live-Untertitel und Transkript nach der Aufnahme

Manche Teams müssen Live-Untertitel anzeigen und ein Transkript nach dem Meeting erstellen. Leider bietet nicht jedes Transkriptionstool von der Stange beide Funktionen. Mit der ElevenLabs API können Sie mit Scribe v2 und Scribe v2 Realtime beides umsetzen. 

Starten Sie mit der API für Meeting-Transkription

ElevenAPI bietet Ihnen Zugriff auf führende Speech-to-Text-Modelle, mit denen Sie Transkriptionstools für Meetings entwickeln können. Das Einrichten einer Entwicklungsumgebung ist einfach. Sie erhalten einen API-Key und installieren das SDK für Python oder Node.js. Anschließend integrieren Sie Scribe v2 oder Scribe v2 Realtime über die bereitgestellte API in Ihr Produkt. 

Erhalten Sie Zugriff auf ElevenLabs und senden Sie jetzt Ihre erste API-Anfrage. 

Entwickeln Sie mit ElevenAPI im großen Maßstab

Sie suchen etwas anderes? Besuchen Sie unser Hilfe-Center

FAQs 

Verfasst von

Jack Limebear ist Teil des Growth-Teams und arbeitet als Content Writer und Stratege für Blog- und Insights-Seiten. Vor ElevenLabs leitete er über zehn Jahre die Content-Strategie für Unternehmen – von schnell wachsenden SaaS-Startups bis zu Fortune-500-Konzernen. Er hat einen Masterabschluss in Englischer Literatur von der University of Cambridge.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio