Texto a Voz

Aprende a convertir texto en audio hablado natural con ElevenLabs.

Descripción general

La API de ElevenLabs Texto a Voz (TTS) convierte texto en audio natural con entonación, ritmo y sensibilidad emocional matizados. Nuestros modelos se adaptan a las señales textuales en 32 idiomas y a varios estilos de voz, y pueden usarse para:

  • Narrar campañas y anuncios globales
  • Producir audiolibros en varios idiomas con una entonación emocional compleja
  • Transmitir audio en tiempo real a partir de texto

Escucha un ejemplo:

Explora nuestra biblioteca de voces para encontrar la voz perfecta para tu proyecto.

La biblioteca de voces no está disponible a través de la API para usuarios del plan gratuito.

Calidad de voz

Para aplicaciones en tiempo real, Flash v2.5 ofrece una latencia ultrabaja de 75 ms, mientras que Multilingual v2 proporciona audio de la máxima calidad con una expresión más matizada.

Opciones de voz

ElevenLabs ofrece miles de voces en 32 idiomas mediante varios métodos de creación:

Descubre más sobre nuestras opciones de voz.

El formato de respuesta predeterminado es mp3, pero también hay disponibles otros formatos como pcm y ulaw.

  • MP3
    • Frecuencias de muestreo: 22.05kHz - 44.1kHz
    • Tasas de bits: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Frecuencias de muestreo: 16kHz - 44.1kHz
    • Tasas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Profundidad de 16 bits
  • μ-law
    • Frecuencia de muestreo de 8kHz
    • Optimizado para aplicaciones de telefonía
  • A-law
    • Frecuencia de muestreo de 8kHz
    • Optimizado para aplicaciones de telefonía
  • Opus
    • Frecuencia de muestreo: 48kHz
    • Tasas de bits: 32kbps - 192kbps

Las opciones de audio de mayor calidad solo están disponibles en los planes de pago; consulta nuestra página de precios para obtener más información.

Idiomas compatibles

Nuestros modelos multilingües v2 son compatibles con 29 idiomas:

Inglés (EE. UU., Reino Unido, Australia, Canadá), japonés, chino, alemán, hindi, francés (Francia, Canadá), coreano, portugués (Brasil, Portugal), italiano, español (España, México), indonesio, neerlandés, turco, filipino, polaco, sueco, búlgaro, rumano, árabe (Arabia Saudí, EAU), checo, griego, finés, croata, malayo, eslovaco, danés, tamil, ucraniano y ruso.

Flash v2.5 es compatible con 32 idiomas: todos los idiomas de los modelos v2, además de:

Húngaro, noruego y vietnamita

Solo tienes que introducir texto en cualquiera de nuestros idiomas compatibles y seleccionar una voz adecuada de nuestra biblioteca de voces. Para obtener resultados más naturales, elige una voz con un acento que se ajuste a tu idioma y región de destino.

Prompting

Los modelos interpretan el contexto emocional directamente a partir del texto de entrada. Por ejemplo, añadir texto descriptivo como «dijo emocionada» o usar signos de exclamación influirá en la emoción de la voz. Los ajustes de voz, como Estabilidad y Similitud, ayudan a controlar la coherencia, mientras que la emoción subyacente procede de las señales textuales.

Lee la guía de prompting para obtener más información.

El modelo pronunciará el texto descriptivo, por lo que debes recortarlo o eliminarlo manualmente del audio si lo deseas.

Preguntas frecuentes

Sí, puedes crear clones de voz instantáneos de tu propia voz a partir de clips de audio cortos. Para clones de alta fidelidad, consulta nuestra función de clonación de voz profesional.

Sí. Conservas la propiedad de cualquier audio que generes. Sin embargo, los derechos de uso comercial solo están disponibles con planes de pago. Con una suscripción de pago, puedes usar el audio generado con fines comerciales y monetizar los resultados si posees los derechos de propiedad intelectual del contenido de entrada.

Una regeneración gratuita te permite volver a generar el mismo contenido de texto a voz sin coste adicional, siempre que se cumplan estas condiciones:

  • Puedes regenerar cada contenido hasta 2 veces gratis
  • El contenido debe ser exactamente igual que el de la generación anterior. Cualquier cambio en el texto, los ajustes de voz u otros parámetros requerirá una nueva generación de pago

Las regeneraciones gratuitas son útiles si hay una ligera distorsión en el audio generado. Según los benchmarks internos de ElevenLabs, las regeneraciones resolverán aproximadamente la mitad de los problemas de calidad; los problemas restantes suelen deberse a datos de entrenamiento deficientes.

Usa los modelos Flash de baja latencia (Flash v2 o v2.5), optimizados para situaciones conversacionales o interactivas casi en tiempo real. Consulta nuestra guía de optimización de la latencia para obtener más información.

Los modelos no son deterministas. Para obtener mayor coherencia, usa el parámetro seed opcional, aunque pueden seguir produciéndose diferencias sutiles.

Divide los textos largos en segmentos y usa streaming para una reproducción en tiempo real y un procesamiento eficiente. Para mantener un flujo de prosodia natural entre fragmentos, incluye los parámetros de texto anterior/siguiente o ID de solicitud anterior/siguiente .

Datos clave

  • Determinismo: El resultado no es determinista — usa el parámetro seed para obtener resultados más coherentes
  • Regeneraciones gratuitas: Hasta 2 regeneraciones gratuitas por generación (solo el mismo contenido y parámetros)
  • Propiedad: Conservas la propiedad del audio generado; el uso comercial requiere un plan de pago
  • Casos de uso de baja latencia: Usa modelos Flash (eleven_flash_v2 o eleven_flash_v2_5) — consulta la guía de optimización de la latencia
  • Texto extenso: Divide los textos largos en segmentos; usa los parámetros previous_text / next_text para mantener una prosodia natural entre fragmentos