Guía de inicio rápido de Voz a Texto

Descubre cómo convertir audio hablado en texto.

Esta guía te mostrará cómo convertir audio hablado en texto con la API de Voz a Texto.

Usa la skill de voz a texto de ElevenLabs para transcribir audio desde tu asistente de programación con IA:

npx skills add elevenlabs/skills --skill speech-to-text

Este tutorial mostrará cómo usar la API de Voz a Texto por Lotes. Para ver una guía sobre cómo usar la API de Voz a Texto en Tiempo Real, consulta las guías de streaming del lado del cliente o streaming del lado del servidor.

Uso de la API de Voz a Texto

1

Crea una clave de API

Crea una clave de API aquí, en el panel, que usarás para acceder a la API de forma segura.

Guarda la clave como un secreto gestionado y pásala a los SDK como variable de entorno mediante un archivo .env, o directamente en la configuración de tu aplicación, según prefieras.

.env
ELEVENLABS_API_KEY=<your_api_key_here>
2

Instala el SDK

También usaremos la biblioteca dotenv para cargar nuestra clave de API desde una variable de entorno.

pip install elevenlabs
pip install python-dotenv
3

Haz la solicitud a la API

Crea un archivo llamado example.py o example.mts, según el lenguaje que elijas, y añade el siguiente código:

# example.py
import os
from dotenv import load_dotenv
from io import BytesIO
import requests
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(
api_key=os.getenv("ELEVENLABS_API_KEY"),
)
audio_url = (
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
)
response = requests.get(audio_url)
audio_data = BytesIO(response.content)
transcription = elevenlabs.speech_to_text.convert(
file=audio_data,
model_id="scribe_v2", # Model to use
tag_audio_events=True, # Tag audio events like laughter, applause, etc.
language_code="eng", # Language of the audio file. If set to None, the model will detect the language automatically.
diarize=True, # Whether to annotate who is speaking
)
print(transcription)

Después, ejecútalo:

python example.py

Verás la transcripción del archivo de audio en la consola.

Para audio médico y clínico, establece model_id en scribe_v2_medical. La estructura de la solicitud es la misma que para scribe_v2 y se factura a la misma tarifa. Consulta Scribe v2 Medical.

Próximos pasos