Voz a Texto

Una guía para transcribir audio con ElevenLabs

Función de producto Texto a Voz

Resumen

Con Voz a Texto, puedes transcribir audio hablado a texto con una precisión puntera. Gracias a la detección automática de idioma, puedes transcribir audio en multitud de idiomas.

Crear una transcripción

1

Sube audio

En el panel de control de ElevenLabs, ve a la página Voz a Texto y haz clic en el botón «Transcribir archivos». Desde la ventana modal, puedes subir un archivo de audio o vídeo para transcribirlo.

Subir a Voz a Texto

2

Selecciona las opciones

  • Selecciona el idioma principal del audio si lo conoces. Puedes dejarlo en «Detectar» y los idiomas del audio se detectarán automáticamente.

  • Elige si quieres etiquetar eventos de audio, como risas o aplausos, mediante el interruptor «Etiquetar eventos de audio».

  • Los prompts de términos clave te permiten añadir hasta 1000 palabras o frases para orientar al modelo a transcribirlas. Esto resulta útil para transcribir palabras o frases específicas que no son habituales en el audio, como nombres de productos, nombres propios u otros términos concretos.

Cuando estés listo, haz clic en el botón «Subir archivos» para enviarlos.

3

Consulta los resultados

Haz clic en el nombre del archivo de audio que has subido en el panel central para ver los resultados. Puedes hacer clic en una palabra para iniciar la reproducción del audio desde ese punto.

Haz clic en el botón «Exportar» de la esquina superior derecha para descargar los resultados en diversos formatos.

Editor de transcripciones

Cuando hayas creado una transcripción, puedes editarla en nuestro Editor de transcripciones. Obtén más información en esta guía.

Preguntas frecuentes

Sí, la herramienta permite subir archivos de audio y vídeo. El tamaño máximo de archivo para ambos es de 3 GB.

Renombrar hablantes

Sí, puedes renombrar a los hablantes haciendo clic en el botón «editar» junto a la etiqueta «Hablantes».

Voz a Texto convierte el audio hablado en texto escrito. En ElevenLabs, nuestro modelo de Voz a Texto es Scribe. Te permite transcribir con precisión el habla en más de 90 idiomas, lo que facilita convertir el audio en texto legible y con capacidad de búsqueda.

Características principales de Scribe

  • Precisión líder en el sector, con un 98 % de precisión en idiomas principales como inglés, francés, italiano, portugués, español y alemán.
  • Marcas de tiempo precisas a nivel de palabra, para que puedas ver exactamente cuándo se pronuncia cada palabra.
  • Diarización inteligente de hablantes, que identifica y separa automáticamente a los distintos hablantes.
  • Etiquetado dinámico de audio para detectar sonidos que no son habla.
  • Compatibilidad con hasta 32 hablantes sin perder precisión.

Novedades de Scribe v2

Scribe v2 se basa en el modelo principal e incorpora capacidades adicionales diseñadas para casos de uso más exigentes.

  • Prompting de términos clave. Puedes proporcionar hasta 100 palabras o frases para guiar al modelo y que transcriba correctamente términos importantes. El uso de prompting de términos clave aumenta el coste un 20 %.
  • Detección de entidades. Puedes elegir categorías específicas de información que detectar en la transcripción, como números de tarjeta de crédito, nombres o afecciones médicas. La detección de entidades solo está disponible a través de la API y aumenta el coste un 30 %.
  • Compatibilidad inteligente con varios idiomas. Puedes enviar audio que contenga varios idiomas y Scribe v2 detectará y transcribirá cada uno correctamente de forma automática.
  • Mayor estabilidad. Scribe v2 gestiona pausas, cambios de tono y silencios prolongados sin interrumpirse ni perder precisión.

¿Qué versión deberías usar?

Recomendamos Scribe v2 cuando se requiere una transcripción de alta precisión. Está disponible a través de nuestro sitio web y de la API. Al utilizar Voz a Texto desde nuestro sitio web, Scribe v2 es el modelo predeterminado.

Para audio médico y clínico, utiliza Scribe v2 Medical (scribe_v2_medical) mediante la misma API. Se factura a la misma tarifa que Scribe v2.

Para casos de uso en tiempo real, recomendamos Scribe v2 Realtime, disponible a través de ElevenAgents y mediante la API.

Para obtener más detalles, consulta nuestra documentación de Voz a Texto.

Voz a Texto admite más de 90 idiomas. 

Para ver un desglose completo de los idiomas compatibles, consulta la sección de compatibilidad de idiomas de nuestra documentación de Voz a Texto.

El límite de concurrencia (solicitudes simultáneas que se ejecutan en paralelo) depende de tu suscripción y de si utilizas Voz a Texto o Voz a Texto en Tiempo Real.

A continuación se muestran los límites de concurrencia actuales para Voz a Texto.

PlanLímite de concurrencia de Voz a TextoLímite de concurrencia de Voz a Texto en Tiempo Real
Gratis86
Starter129
Creator2015
Pro4030
Scale6045
Business6045
EnterpriseAmpliadoAmpliado

Si necesitas un mayor número de solicitudes simultáneas, contacta directamente con nuestro departamento de Enterprise a través de esta página web. Estaremos encantados de hablar sobre un plan a medida que se ajuste a tus necesidades específicas.

No results