Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

So funktioniert Scribe v2 Realtime

Verfasst von
Tadas Petra
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Scribe v2 Realtime ist ein extrem schnelles Speech-to-Text-Modell für Live-Transkriptionen. Die Kombination aus Geschwindigkeit und Qualität ermöglicht neue Anwendungsfälle.

So konnten wir beispielsweise mit Scribe v2 Realtime und der Chrome Translator API diesen Echtzeit-Sprachübersetzer entwickeln.

Live transcription on the left and committed transcripts on the right in a list

Wenn Sie die Schritt-für-Schritt-Anleitung für diese Demo möchten, finden Sie sie hier. Dieser Leitfaden erklärt Scribe v2 Realtime und seine Funktionsweise auf hoher Ebene.

Das Modell

ElevenLabs bietet zwei Modelle zur Audiotranskription: Scribe v2 und Scribe v2 Realtime.

Optimized For
Scribe v2
Accuracy
Scribe v2 Realtime
Ultra low latency
Use Case
Scribe v2
Batch transcription, subtitling, and captioning at scale.
Scribe v2 Realtime
Voice agents, meeting notetakers, and other live applications.

Scribe v2 eignet sich für asynchrone Transkriptionen, während Sie Scribe v2 Realtime nutzen, wenn die Transkription live erfolgen soll.

Für eine Anwendung zur Live-Sprachübersetzung ist Scribe v2 Realtime die naheliegende Wahl.

Die API

Um dieses Modell zu nutzen, benötigen Sie die Speech-to-Text-API. Für den Einstieg sind zwei Schritte nötig:

  1. Eine Scribe-Instanz initialisieren
  2. Mit der API verbinden

Je nachdem, von wo aus Sie diese API aufrufen, müssen Sie sie unterschiedlich initialisieren. Bei einem serverseitigen Aufruf können Sie sie direkt mit dem API-Key initialisieren und diese Instanz dann mit Scribe v2 Realtime verbinden.

Aber die Offenlegung eines API-Keys gegenüber dem Client stellt ein großes Sicherheitsrisiko dar. Wenn Sie also clientseitig streamen, müssen Sie mit einem Einmal-Token initialisieren.

Dieses Token muss serverseitig generiert werden, um den API-Key zu schützen.

Da wir eine React-Anwendung entwickeln, verwenden wir den Token-Ansatz. Das Token wird während der Verbindungsphase übergeben, daher ist das Erstellen einer Scribe-Instanz unkompliziert.

import { useScribe } from "@elevenlabs/react";

function MyComponent() {
  const scribe = useScribe({
    modelId: "scribe_v2_realtime",
  });
  
  //...
}

Mit Scribe v2 Realtime verbinden

Nach der korrekten Initialisierung können Sie sich mit Scribe v2 Realtime verbinden. Für das React-Projekt zur Sprachübersetzung haben wir clientseitiges Streaming verwendet und daher ein Einmal-Token vom Backend benötigt. Dieses Token muss bei jeder Verbindung zur API generiert und übergeben werden.

const handleStart = async () => {
  const token = await fetchTokenFromServer();

  await scribe.connect({
    token,
    microphone: {
	  echoCancellation: true,
	  noiseSuppression: true,
    },
  });
};


Commit-Strategie

Bei der Arbeit mit Scribe v2 Realtime gibt es zwei Arten von Transkripten: partielle und bestätigte.

Die partiellen Transkripte sind die „Live-Transkripte“. Sie werden über WebSocket erstellt und während Sie sprechen an Sie zurückgegeben. Wenn Sie also „Die Katze ist ...“ sagen, werden diese Wörter in Echtzeit gestreamt.

Die andere Art ist ein bestätigtes Transkript. Transkriptionen funktionieren in Segmenten. Wann und wie Sie Ihre Transkriptionen bestätigen, bestimmt deren Segmentierung. Dafür müssen Sie eine Commit-Strategie definieren.

Es gibt zwei Optionen für Commit-Strategien. Die erste ist manuell und gibt Ihnen volle Kontrolle darüber, wann Transkripte bestätigt werden. Am besten tun Sie dies bei Sprechpausen oder anderen logischen Punkten, etwa bei einem Sprecherwechsel.

Alternativ lässt du Scribe v2 Realtime mithilfe von Voice Activity Detection (VAD) selbstständig geeignete Segmente bestimmen. Dieser Ansatz erkennt Sprach- und Stillesegmente automatisch. Wird ein Schwellenwert für Stille erreicht, bestätigt die Transkriptions-Engine das Segment automatisch.

Warum benötigen Sie überhaupt eine Commit-Strategie?

Während Sie sprechen, transkribiert Scribe v2 Realtime jedes Wort. Wenn Sie auf Englisch „I scream ...“ sagen, kann das als „Ice cream ...“ erkannt werden. Mit dem vollständigen Kontext des Segments „I scream every time I see a spider in the bathroom“ ist die Ausgabe jedoch genauer.

Partielle Transkripte können somit in Echtzeit angezeigt werden, während bestätigte Transkripte eine genauere Transkription des Gesprächsverlaufs liefern können.

Transkriptionen anzeigen

Sobald Sie mit Scribe v2 Realtime verbunden sind, läuft die Transkription. Über die Eigenschaften partialTranscript und committedTranscripts erhalten Sie Zugriff auf die Transkripte.

<div>
  <button onClick={handleStart} disabled={scribe.isConnected}>
	Start Recording
  </button>
  <button onClick={scribe.disconnect} disabled={!scribe.isConnected}>
	Stop
  </button>

  {scribe.partialTranscript && <p>Live: {scribe.partialTranscript}</p>}

  <div>
	{scribe.committedTranscripts.map((t) => (
	  <p key={t.id}>{t.text}</p>
	))}
  </div>
</div>

partialTranscript ist das Echtzeit-Transkript des aktuellen Segments. committedTranscript enthält den Gesprächsverlauf als Liste der Segmente, die während der Verbindung mit Scribe v2 Realtime bestätigt wurden.

Mit KI übersetzen

Das ist alles, was Sie für Echtzeit-Transkripte Ihrer Gespräche benötigen. Jetzt können Sie die App mit einer ansprechenden Benutzeroberfläche gestalten oder Funktionen wie Live-Sprachübersetzung ergänzen.

Um den Echtzeit-Sprachübersetzer aus der Demo zu erstellen, übergeben Sie die Transkripte an die Chrome AI Translator API und zeigen die Ausgabe in Echtzeit an.

Jetzt entwickeln

Vielen Dank fürs Lesen. Bei ElevenLabs registrieren und mit der Entwicklung Ihrer Anwendungen beginnen.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio