Ir al contenido

API de Voz a Texto

Transcribe audio con ElevenLabs Scribe v2

La mayor precisión en Voz a Texto para aplicaciones a gran escala. Detecta entonación y efectos de sonido, y mejora la transcripción con prompts de palabras clave.

Eh, hola. Bueno, me preguntaba si te apetecería quedar para tomar un café. ¿Quizá mañana por la mañana? [nervous laugh] ¡No pasa nada si no!

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

  • Lovable
  • Veed model
  • Synthesia
  • Stripe
  • Perplexity
  • Twilio

La API de Voz a Texto más precisa para grandes volúmenes

Crea subtítulos, transcripciones editables y captions para podcasts, vídeos, entrevistas y otros contenidos grabados, todo con la máxima precisión a través de la API.

Scribe v2 alcanza una precisión de transcripción líder en el sector y ofrece texto limpio y editable incluso en condiciones de audio difíciles o con acentos diversos.

Precisión de transcripción sin precedentes

Scribe v2 alcanza una precisión de transcripción líder en el sector y ofrece texto limpio y editable incluso en condiciones de audio difíciles o con acentos diversos.

Uh, hi! So, um, I was wondering if you wanted to meet up for coffee? Maybe tomorrow morning? [nervous laugh] Totally fine if not!

Diseñada para cualquier escenario

Transcripción que funciona en entornos ruidosos, con música de fondo, acentos marcados y audio de baja calidad.

Control detallado del tiempo, hablantes y eventos no verbales.

La API de transcripción de ElevenLabs puede detectar risas, emociones y efectos de sonido. Usa prompts de términos clave para guiar la transcripción con términos específicos de un sector.

Transcribe audio y vídeo

Sube MP3, MP4, WAV, MOV y otros formatos habituales. Scribe procesa archivos de hasta 10 horas con procesamiento asíncrono y notificaciones por webhook para grandes lotes.
Transcription Formats

Transcripciones limpias y editables

Obtén texto bien puntuado y estructurado en párrafos, listo para editar, publicar o procesar posteriormente. No requiere limpieza.
Editable transcripts

Prompts de términos clave

Mejora la precisión de reconocimiento de hasta 100 términos específicos de un sector. Nombres de productos, jerga técnica y vocabulario especializado correctamente transcritos a la primera.
Keyterm Prompting

Etiquetado dinámico de audio

Captura eventos no verbales como risas, aplausos, música y ruido de fondo. Las transcripciones incluyen todo el contexto de tu audio, no solo las palabras.

Diarización inteligente de hablantes

Identifica y etiqueta automáticamente hasta 48 hablantes. Atribución clara de quién dijo qué, organizada en transcripciones fáciles de leer.

Detección de entidades

Identifica y etiqueta automáticamente 56 tipos de entidades, incluidos nombres, fechas, ubicaciones y organizaciones, en tus transcripciones.

Transcribe audio clínico con Scribe v2 Medical

Un modelo de Voz a Texto optimizado para transcripción médica y flujos de trabajo clínicos, con reconocimiento mejorado de nombres de medicamentos, anatomía y términos de patología.

Medication renewal message flags metformin 500mg and asks about continued levothyroxine.

Transcribe conversaciones clínicas

Convierte conversaciones entre profesionales sanitarios y pacientes, dictados médicos y admisiones de pacientes en texto preciso, listo para la revisión clínica y su uso en notas, codificación y flujos de documentación posteriores.

Mayor precisión en términos médicos

En term-WER, Scribe v2 Medical comete un 15 % menos de errores que Scribe v2 en la división de prueba Eka Medical ASR, con un reconocimiento de voz médica mejorado en todo el vocabulario clínico.

Abstract gray textured background with soft diagonal light and dark bands.

Scribe v2

Máxima precisión, diseñado para cargas de trabajo por lotes.

  • >95 % de precisión
  • Más de 90 idiomas
  • Detección de eventos no verbales
  • Detección de entidades
  • Prompts de términos clave
Abstract grayscale bands of soft light and shadow sweeping diagonally.

Scribe v2 Realtime

Latencia mínima, para cargas de trabajo en tiempo real.

  • Menos de 150 ms de latencia
  • Más de 90 idiomas
  • Transcripción en streaming
  • Detección de actividad de voz
  • Reconocimiento automático de idioma
Abstract grayscale texture with diagonal streaks and a soft gradient from dark to light.

Scribe v2 Medical

Finetune médico, para transcripción clínica.

  • Ajuste de vocabulario médico
  • Transcripción en más de 90 idiomas
  • Iguala a Scribe v2 en habla cotidiana
  • Mejor reconocimiento de nombres de medicamentos
  • Compatible con HIPAA para clientes Enterprise

Transcribe voz en más de 90 idiomas y una amplia variedad de acentos

Ofrece una precisión excepcional en distintos acentos, dialectos y condiciones de grabación.

Cambia el languageCode para previsualizar idiomas

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({
	apiKey: "<your_api_key>"
});
const response = await fetch(
  "https://storage.googleapis.com/eleven-public-cdn/audio/marketing/nicole.mp3"
);
const audioBlob = new Blob([await response.arrayBuffer()], { type: "audio/mp3" });

const transcription = await	elevenlabs
	.speechToText.convert({
	  file: audioBlob,
	  modelId: "scribe_v2",
	  tagAudioEvents: true,
	  languageCode: 
, // Seleccionar idioma diarize: true }); console.log(transcription);
Flag for en
Inglés
Flag for zh
Chino
Flag for es
Español
Flag for fr
Francés
Flag for pt
Portugués
Flag for de
Alemán
Flag for ja
Japonés
Flag for it
Italiano
Flag for hi
Hindi
Flag for en
InglésHaz clic para previsualizar

Impulsamos a las empresas y marcas líderes del mundo

  • Desde doblar Reels a idiomas locales hasta generar música y voces de personajes en Horizon, la plataforma de ElevenLabs permite a creadores, empresas y grandes organizaciones de todo el mundo crear con voz, música y sonido a escala.
    Meta Color Logo
  • La precisión inigualable de Scribe en tantos idiomas permite a Fieldy entender cada conversación diaria y crecer fácilmente en todos los continentes. Fieldy ha aumentado la retención de usuarios un 50 % desde que adoptó ElevenLabs Scribe.
    Fieldy logo
  • ElevenLabs nos facilitó incorporar rápidamente potentes capacidades de texto a voz a nuestro SDK, lo que permite a los agentes responder en tiempo real con voces expresivas a las preguntas de usuarios o dar feedback sobre lo que están viendo.
    Stream Color Logo
  • Twilio ha integrado la tecnología de voz con IA generativa de ElevenLabs en su CPaaS, mejorando ConversationRelay. Esta integración permite a empresas y desarrolladores crear interacciones de voz con IA conversacional que suenan humanas, resultan expresivas y responden en tiempo real directamente desde la plataforma CPaaS de Twilio. En ElevenLabs nos alegra que Twilio haya elegido ElevenLabs para mejorar ConversationRelay con las voces más expresivas y naturales disponibles.
    Twilio logo

APIs diseñadas para producción

Enterprise data protection developers

Los datos se cifran durante la transmisión y en reposo, con compatibilidad con el cumplimiento de SOC 2, HIPAA y RGPD. Los modos de residencia de datos en la UE y de retención cero están disponibles para un control más estricto de los datos.

Los datos se cifran durante la transmisión y en reposo, con compatibilidad con el cumplimiento de SOC 2, HIPAA y RGPD. Los modos de residencia de datos en la UE y de retención cero están disponibles para un control más estricto de los datos.

SDKs

SDK oficiales para Python y TypeScript con seguridad de tipos, compatibilidad con streaming y ejemplos claros.

Nuestro equipo garantiza un lanzamiento fluido y mantiene tus operaciones funcionando de forma fiable, con un rendimiento constante y tranquilidad.

Preguntas frecuentes

Preguntas frecuentes

Empresas y marcas líderes de todo el mundo confían en nosotros

Últimas novedades

Últimas novedades

    La plataforma de audio IA más realista