API de Voz a Texto
Transcribe audio con ElevenLabs Scribe v2
La mayor precisión en Voz a Texto para aplicaciones a gran escala. Detecta entonación y efectos de sonido, y mejora la transcripción con prompts de palabras clave.
Eh, hola. Bueno, me preguntaba si te apetecería quedar para tomar un café. ¿Quizá mañana por la mañana? [nervous laugh] ¡No pasa nada si no!
Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!
- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
La API de Voz a Texto más precisa para grandes volúmenes
Crea subtítulos, transcripciones editables y captions para podcasts, vídeos, entrevistas y otros contenidos grabados, todo con la máxima precisión a través de la API.
Precisión de transcripción sin precedentes
Scribe v2 alcanza una precisión de transcripción líder en el sector y ofrece texto limpio y editable incluso en condiciones de audio difíciles o con acentos diversos.
Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!
Diseñada para cualquier escenario
Transcripción que funciona en entornos ruidosos, con música de fondo, acentos marcados y audio de baja calidad.
Control detallado del tiempo, hablantes y eventos no verbales.
La API de transcripción de ElevenLabs puede detectar risas, emociones y efectos de sonido. Usa prompts de términos clave para guiar la transcripción con términos específicos de un sector.
Transcribe audio y vídeo
.webp&w=3840&q=95)
Transcripciones limpias y editables
.webp&w=3840&q=95)
Prompts de términos clave

Etiquetado dinámico de audio
Captura eventos no verbales como risas, aplausos, música y ruido de fondo. Las transcripciones incluyen todo el contexto de tu audio, no solo las palabras.
Diarización inteligente de hablantes
Identifica y etiqueta automáticamente hasta 48 hablantes. Atribución clara de quién dijo qué, organizada en transcripciones fáciles de leer.
Detección de entidades
Identifica y etiqueta automáticamente 56 tipos de entidades, incluidos nombres, fechas, ubicaciones y organizaciones, en tus transcripciones.
Transcribe audio clínico con Scribe v2 Medical
Un modelo de Voz a Texto optimizado para transcripción médica y flujos de trabajo clínicos, con reconocimiento mejorado de nombres de medicamentos, anatomía y términos de patología.

Transcribe conversaciones clínicas
Convierte conversaciones entre profesionales sanitarios y pacientes, dictados médicos y admisiones de pacientes en texto preciso, listo para la revisión clínica y su uso en notas, codificación y flujos de documentación posteriores.

Mayor precisión en términos médicos
En term-WER, Scribe v2 Medical comete un 15 % menos de errores que Scribe v2 en la división de prueba Eka Medical ASR, con un reconocimiento de voz médica mejorado en todo el vocabulario clínico.

Scribe v2
Máxima precisión, diseñado para cargas de trabajo por lotes.
- >95 % de precisión
- Más de 90 idiomas
- Detección de eventos no verbales
- Detección de entidades
- Prompts de términos clave

Scribe v2 Realtime
Latencia mínima, para cargas de trabajo en tiempo real.
- Menos de 150 ms de latencia
- Más de 90 idiomas
- Transcripción en streaming
- Detección de actividad de voz
- Reconocimiento automático de idioma

Scribe v2 Medical
Finetune médico, para transcripción clínica.
- Ajuste de vocabulario médico
- Transcripción en más de 90 idiomas
- Iguala a Scribe v2 en habla cotidiana
- Mejor reconocimiento de nombres de medicamentos
- Compatible con HIPAA para clientes Enterprise
Transcribe voz en más de 90 idiomas y una amplia variedad de acentos
Ofrece una precisión excepcional en distintos acentos, dialectos y condiciones de grabación.
Cambia el languageCode para previsualizar idiomas
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // Seleccionar idioma
diarize: true
});
console.log(transcription);Impulsamos a las empresas y marcas líderes del mundo
“Desde doblar Reels a idiomas locales hasta generar música y voces de personajes en Horizon, la plataforma de ElevenLabs permite a creadores, empresas y grandes organizaciones de todo el mundo crear con voz, música y sonido a escala.”
“La precisión inigualable de Scribe en tantos idiomas permite a Fieldy entender cada conversación diaria y crecer fácilmente en todos los continentes. Fieldy ha aumentado la retención de usuarios un 50 % desde que adoptó ElevenLabs Scribe.”
“ElevenLabs nos facilitó incorporar rápidamente potentes capacidades de texto a voz a nuestro SDK, lo que permite a los agentes responder en tiempo real con voces expresivas a las preguntas de usuarios o dar feedback sobre lo que están viendo.”

“Twilio ha integrado la tecnología de voz con IA generativa de ElevenLabs en su CPaaS, mejorando ConversationRelay. Esta integración permite a empresas y desarrolladores crear interacciones de voz con IA conversacional que suenan humanas, resultan expresivas y responden en tiempo real directamente desde la plataforma CPaaS de Twilio. En ElevenLabs nos alegra que Twilio haya elegido ElevenLabs para mejorar ConversationRelay con las voces más expresivas y naturales disponibles. ”
APIs diseñadas para producción

Los datos se cifran durante la transmisión y en reposo, con compatibilidad con el cumplimiento de SOC 2, HIPAA y RGPD. Los modos de residencia de datos en la UE y de retención cero están disponibles para un control más estricto de los datos.
Los datos se cifran durante la transmisión y en reposo, con compatibilidad con el cumplimiento de SOC 2, HIPAA y RGPD. Los modos de residencia de datos en la UE y de retención cero están disponibles para un control más estricto de los datos.
SDK oficiales para Python y TypeScript con seguridad de tipos, compatibilidad con streaming y ejemplos claros.
SDK oficiales para Python y TypeScript con seguridad de tipos, compatibilidad con streaming y ejemplos claros.
Nuestro equipo garantiza un lanzamiento fluido y mantiene tus operaciones funcionando de forma fiable, con un rendimiento constante y tranquilidad.
Nuestro equipo garantiza un lanzamiento fluido y mantiene tus operaciones funcionando de forma fiable, con un rendimiento constante y tranquilidad.
Preguntas frecuentes
Preguntas frecuentes
Sí. Eleven Scribe v2 Medical es compatible con HIPAA para clientes Enterprise que tengan un Acuerdo de Socio Comercial (BAA) vigente y el modo de retención cero (ZRM) activado para las solicitudes de la API de Voz a Texto. Con ZRM activado, ElevenLabs no conserva el audio de entrada ni el resultado de la transcripción tras el procesamiento.
Scribe v2 Medical es una versión ajustada de Scribe v2, optimizada para el habla clínica y la transcripción médica, incluidos los nombres de medicamentos, la anatomía y la patología.
No. Scribe v2 Medical admite los mismos más de 90 idiomas que Scribe v2. Las mejoras de precisión médica se midieron en inglés, francés y alemán.
No. Scribe v2 Medical tiene el mismo precio que Scribe v2, con las mismas funciones y API. Para las integraciones existentes de Scribe v2, cambia el ID del modelo a scribe_v2_medical.
