Streaming côté serveur
Streaming côté serveur
Ce guide explique comment transcrire de l’audio en temps réel côté serveur avec ElevenLabs.
Guide pratique · Suppose que vous avez suivi le démarrage rapide de Speech to Text.
Vue d’ensemble
L’API ElevenLabs Realtime Speech to Text vous permet de transcrire des flux audio en temps réel avec une latence ultra-faible grâce au modèle Scribe Realtime v2. Que vous développiez des assistants vocaux, des services de transcription ou toute application nécessitant une reconnaissance vocale en direct, cette API basée sur WebSocket fournit des transcriptions partielles pendant que vous parlez et des transcriptions validées une fois les segments vocaux terminés.
Scribe v2 Realtime peut être implémenté côté serveur pour transcrire de l’audio en temps réel, à partir d’une URL, d’un fichier ou de votre propre flux audio.
L’implémentation côté serveur diffère de celle côté client à plusieurs égards :
- Utilise une clé API ElevenLabs au lieu d’un jeton à usage unique.
- Prend en charge le streaming direct depuis une URL, sans avoir à découper manuellement l’audio.
Pour diffuser de l’audio directement depuis le microphone, consultez le guide de streaming côté client.
Démarrage rapide
Ce guide suppose que vous avez configuré votre clé API et votre SDK. Terminez d’abord le démarrage rapide si ce n’est pas encore fait.
Configurer le SDK
Le SDK propose deux façons de transcrire de l’audio en temps réel : diffuser depuis une URL ou découper manuellement l’audio depuis un fichier ou votre propre flux audio.
Pour obtenir la liste complète des paramètres et options pris en charge par l’API, consultez le Guide de l’API.
Diffuser depuis une URL
Découpage manuel de l’audio
Cet exemple montre comment diffuser un fichier audio depuis une URL à l’aide du SDK officiel.
L’outil ffmpeg est requis pour diffuser depuis une URL. Consultez son site web pour les instructions d’installation.
Créez un fichier nommé example.py ou example.mts, selon le langage de votre choix, puis ajoutez le code suivant :