Streaming del lado del servidor
Esta guía te muestra cómo transcribir audio en tiempo real del lado del servidor con ElevenLabs.
Guía práctica · Da por hecho que has completado la guía de inicio rápido de Voz a Texto .
Descripción general
La API de Voz a Texto en Tiempo Real de ElevenLabs te permite transcribir transmisiones de audio en tiempo real con una latencia ultrabaja mediante el modelo Scribe Realtime v2. Tanto si creas asistentes de voz, servicios de transcripción o cualquier aplicación que requiera reconocimiento de voz en directo, esta API basada en WebSocket proporciona transcripciones parciales mientras hablas y transcripciones confirmadas cuando se completan los segmentos de voz.
Scribe v2 Realtime se puede implementar del lado del servidor para transcribir audio en tiempo real, ya sea mediante una URL, un archivo o tu propio flujo de audio.
La implementación del lado del servidor se diferencia de la del lado del cliente en algunos aspectos:
- Usa una clave de API de ElevenLabs en lugar de un token de un solo uso.
- Permite transmitir directamente desde una URL, sin necesidad de dividir manualmente el audio en fragmentos.
Para transmitir audio directamente desde el micrófono, consulta la guía de streaming del lado del cliente.
Inicio rápido
Esta guía da por hecho que has configurado tu clave de API y el SDK. Completa primero la guía de inicio rápido si aún no lo has hecho.
Configura el SDK
El SDK ofrece dos formas de transcribir audio en tiempo real: transmitir desde una URL o dividir manualmente el audio en fragmentos desde un archivo o tu propio flujo de audio.
Para consultar la lista completa de parámetros y opciones compatibles con la API, consulta la referencia de la API.
Transmitir desde una URL
Fragmentación manual de audio
Este ejemplo muestra cómo transmitir un archivo de audio desde una URL mediante el SDK oficial.
La herramienta ffmpeg es necesaria para transmitir desde una URL. Visita su sitio web para consultar las instrucciones de instalación.
Crea un archivo llamado example.py o example.mts, según el lenguaje que elijas, y añade el siguiente código: