Server-seitiges Streaming
Server-seitiges Streaming
Anleitung · Setzt voraus, dass Sie den Speech to Text Schnellstart abgeschlossen haben.
Überblick
Mit der ElevenLabs API für Echtzeit-Spracherkennung können Sie Audiostreams mit extrem niedriger Latenz und dem Modell Scribe Realtime v2 in Echtzeit transkribieren. Ob Sie Sprachassistenten, Transkriptionsdienste oder Anwendungen entwickeln, die Live-Spracherkennung benötigen: Diese WebSocket-basierte API liefert Teiltranskripte während des Sprechens und abgeschlossene Transkripte, sobald Sprachsegmente beendet sind.
Scribe v2 Realtime kann serverseitig implementiert werden, um Audio in Echtzeit zu transkribieren – über eine URL, eine Datei oder Ihren eigenen Audiostream.
Die serverseitige Implementierung unterscheidet sich in einigen Punkten von der clientseitigen:
- Verwendet einen ElevenLabs API-Schlüssel statt eines Einmal-Tokens.
- Unterstützt das Streaming direkt von einer URL, ohne dass Sie das Audio manuell in Abschnitte aufteilen müssen.
Informationen zum direkten Streaming von Audio über das Mikrofon finden Sie in der Anleitung Client-seitiges Streaming.
Schnellstart
In diesem Leitfaden wird vorausgesetzt, dass Sie Ihren API-Schlüssel und das SDK eingerichtet haben. Schließen Sie zuerst den Schnellstart ab, falls Sie dies noch nicht getan haben.
SDK konfigurieren
Das SDK bietet zwei Möglichkeiten, Audio in Echtzeit zu transkribieren: Streaming über eine URL oder manuelles Aufteilen des Audios aus einer Datei oder Ihrem eigenen Audiostream in Chunks.
Eine vollständige Liste der von der API unterstützten Parameter und Optionen finden Sie in der API-Referenz.
Von URL streamen
Audio manuell in Chunks aufteilen
Dieses Beispiel zeigt, wie Sie mit dem offiziellen SDK eine Audiodatei über eine URL streamen.
Das Tool ffmpeg ist beim Streaming über eine URL erforderlich. Installationsanweisungen finden Sie auf der Website.
Erstellen Sie je nach gewählter Sprache eine neue Datei mit dem Namen example.py oder example.mts und fügen Sie den folgenden Code hinzu: