API de Voz a Texto
Transcribe audio con ElevenLabs Scribe v2
La mayor precisión en Voz a Texto para aplicaciones a gran escala. Detecta entonación y efectos de sonido, y mejora la transcripción con prompts de palabras clave.
- Lovable
- Veed model
- Synthesia
- Stripe
- Perplexity
- Twilio
La API de Voz a Texto más precisa para grandes volúmenes
Crea subtítulos, transcripciones editables y captions para podcasts, vídeos, entrevistas y otros contenidos grabados, todo con la máxima precisión a través de la API.
Precisión de transcripción sin precedentes
Scribe v2 alcanza una precisión de transcripción líder en el sector y ofrece texto limpio y editable incluso en condiciones de audio difíciles o con acentos diversos.
Diseñada para cualquier escenario
Transcripción que funciona en entornos ruidosos, con música de fondo, acentos marcados y audio de baja calidad.
Control detallado del tiempo, hablantes y eventos no verbales.
La API de transcripción de ElevenLabs puede detectar risas, emociones y efectos de sonido. Usa prompts de términos clave para guiar la transcripción con términos específicos de un sector.
Transcribe audio y vídeo
.webp&w=3840&q=95)
Transcripciones limpias y editables
.webp&w=3840&q=95)
Prompts de términos clave

Etiquetado dinámico de audio
Captura eventos no verbales como risas, aplausos, música y ruido de fondo. Las transcripciones incluyen todo el contexto de tu audio, no solo las palabras.
Diarización inteligente de hablantes
Identifica y etiqueta automáticamente hasta 48 hablantes. Atribución clara de quién dijo qué, organizada en transcripciones fáciles de leer.
Detección de entidades
Identifica y etiqueta automáticamente 56 tipos de entidades, incluidos nombres, fechas, ubicaciones y organizaciones, en tus transcripciones.
Transcribe audio clínico con Scribe v2 Medical
Un modelo de Voz a Texto optimizado para transcripción médica y flujos de trabajo clínicos, con reconocimiento mejorado de nombres de medicamentos, anatomía y términos de patología.

Transcribe conversaciones clínicas
Convierte conversaciones entre profesionales sanitarios y pacientes, dictados médicos y admisiones de pacientes en texto preciso, listo para la revisión clínica y su uso en notas, codificación y flujos de documentación posteriores.

Menos errores en términos médicos
En term-WER, Scribe v2 Medical comete un 15 % menos de errores que Scribe v2 en la división de prueba Eka Medical ASR, con un reconocimiento de voz médica mejorado en todo el vocabulario clínico.

Scribe v2
Máxima precisión, diseñado para cargas de trabajo por lotes.
- >95 % de precisión
- Más de 90 idiomas
- Detección de eventos no verbales
- Detección de entidades
- Prompts de términos clave

Scribe v2 Realtime
Latencia mínima, para cargas de trabajo en tiempo real.
- Menos de 150 ms de latencia
- Más de 90 idiomas
- Transcripción en streaming
- Detección de actividad de voz
- Reconocimiento automático de idioma

Scribe v2 Medical
Finetune médico, para transcripción clínica.
- Ajuste de vocabulario médico
- Transcripción en más de 90 idiomas
- Iguala a Scribe v2 en habla cotidiana
- Mejor reconocimiento de nombres de medicamentos
- Compatible con HIPAA para clientes Enterprise
Transcribe voz en más de 90 idiomas y una amplia variedad de acentos
Ofrece una precisión excepcional en distintos acentos, dialectos y condiciones de grabación.
Cambia el languageCode para previsualizar idiomas
import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";
const elevenlabs = new ElevenLabsClient({
apiKey: "<your_api_key>"
});
const response = await fetch(
"https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });
const transcription = await elevenlabs
.speechToText.convert({
file: audioBlob,
modelId: "scribe_v2",
tagAudioEvents: true,
languageCode: , // Seleccionar idioma
diarize: true
});
console.log(transcription);

