Texto a Voz
Descripción general
La API de ElevenLabs Texto a Voz (TTS) convierte texto en audio natural con entonación, ritmo y sensibilidad emocional matizados. Nuestros modelos se adaptan a las señales textuales en 32 idiomas y a varios estilos de voz, y pueden usarse para:
- Narrar campañas y anuncios globales
- Producir audiolibros en varios idiomas con una entonación emocional compleja
- Transmitir audio en tiempo real a partir de texto
Escucha un ejemplo:
Explora nuestra biblioteca de voces para encontrar la voz perfecta para tu proyecto.
Calidad de voz
Para aplicaciones en tiempo real, Flash v2.5 ofrece una latencia ultrabaja de 75 ms, mientras que Multilingual v2 proporciona audio de la máxima calidad con una expresión más matizada.
Opciones de voz
ElevenLabs ofrece miles de voces en 32 idiomas mediante varios métodos de creación:
- Biblioteca de voces con más de 3000 voces compartidas por la comunidad
- Clonación de voz profesional para réplicas de máxima fidelidad
- Clonación de voz instantánea para replicar voces rápidamente
- Diseño de voz para generar voces personalizadas a partir de descripciones de texto
Descubre más sobre nuestras opciones de voz.
Formatos de salida compatibles
El formato de respuesta predeterminado es mp3, pero también hay disponibles otros formatos como pcm y ulaw.
- MP3
- Frecuencias de muestreo: 22.05kHz - 44.1kHz
- Tasas de bits: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Frecuencias de muestreo: 16kHz - 44.1kHz
- Tasas de bits: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Profundidad de 16 bits
- μ-law
- Frecuencia de muestreo de 8kHz
- Optimizado para aplicaciones de telefonía
- A-law
- Frecuencia de muestreo de 8kHz
- Optimizado para aplicaciones de telefonía
- Opus
- Frecuencia de muestreo: 48kHz
- Tasas de bits: 32kbps - 192kbps
Las opciones de audio de mayor calidad solo están disponibles en los planes de pago; consulta nuestra página de precios para obtener más información.
Idiomas compatibles
Nuestros modelos multilingües v2 son compatibles con 29 idiomas:
Inglés (EE. UU., Reino Unido, Australia, Canadá), japonés, chino, alemán, hindi, francés (Francia, Canadá), coreano, portugués (Brasil, Portugal), italiano, español (España, México), indonesio, neerlandés, turco, filipino, polaco, sueco, búlgaro, rumano, árabe (Arabia Saudí, EAU), checo, griego, finés, croata, malayo, eslovaco, danés, tamil, ucraniano y ruso.
Flash v2.5 es compatible con 32 idiomas: todos los idiomas de los modelos v2, además de:
Húngaro, noruego y vietnamita
Solo tienes que introducir texto en cualquiera de nuestros idiomas compatibles y seleccionar una voz adecuada de nuestra biblioteca de voces. Para obtener resultados más naturales, elige una voz con un acento que se ajuste a tu idioma y región de destino.
Prompting
Los modelos interpretan el contexto emocional directamente a partir del texto de entrada. Por ejemplo, añadir texto descriptivo como «dijo emocionada» o usar signos de exclamación influirá en la emoción de la voz. Los ajustes de voz, como Estabilidad y Similitud, ayudan a controlar la coherencia, mientras que la emoción subyacente procede de las señales textuales.
Lee la guía de prompting para obtener más información.
El modelo pronunciará el texto descriptivo, por lo que debes recortarlo o eliminarlo manualmente del audio si lo deseas.
Preguntas frecuentes
¿Puedo clonar mi propia voz?
Sí, puedes crear clones de voz instantáneos de tu propia voz a partir de clips de audio cortos. Para clones de alta fidelidad, consulta nuestra función de clonación de voz profesional.
¿Soy propietario del audio generado?
Sí. Conservas la propiedad de cualquier audio que generes. Sin embargo, los derechos de uso comercial solo están disponibles con planes de pago. Con una suscripción de pago, puedes usar el audio generado con fines comerciales y monetizar los resultados si posees los derechos de propiedad intelectual del contenido de entrada.
¿Qué se considera una regeneración gratuita?
Una regeneración gratuita te permite volver a generar el mismo contenido de texto a voz sin coste adicional, siempre que se cumplan estas condiciones:
- Puedes regenerar cada contenido hasta 2 veces gratis
- El contenido debe ser exactamente igual que el de la generación anterior. Cualquier cambio en el texto, los ajustes de voz u otros parámetros requerirá una nueva generación de pago
Las regeneraciones gratuitas son útiles si hay una ligera distorsión en el audio generado. Según los benchmarks internos de ElevenLabs, las regeneraciones resolverán aproximadamente la mitad de los problemas de calidad; los problemas restantes suelen deberse a datos de entrenamiento deficientes.
¿Cómo reduzco la latencia en casos de uso en tiempo real?
Usa los modelos Flash de baja latencia (Flash v2 o v2.5), optimizados para situaciones conversacionales o interactivas casi en tiempo real. Consulta nuestra guía de optimización de la latencia para obtener más información.
¿Por qué mi resultado es a veces inconsistente?
Los modelos no son deterministas. Para obtener mayor coherencia, usa el parámetro seed opcional, aunque pueden seguir produciéndose diferencias sutiles.
¿Cuál es la mejor práctica para conversiones de texto extensas?
Divide los textos largos en segmentos y usa streaming para una reproducción en tiempo real y un procesamiento eficiente. Para mantener un flujo de prosodia natural entre fragmentos, incluye los parámetros de texto anterior/siguiente o ID de solicitud anterior/siguiente .
Datos clave
- Determinismo: El resultado no es determinista — usa el parámetro
seedpara obtener resultados más coherentes - Regeneraciones gratuitas: Hasta 2 regeneraciones gratuitas por generación (solo el mismo contenido y parámetros)
- Propiedad: Conservas la propiedad del audio generado; el uso comercial requiere un plan de pago
- Casos de uso de baja latencia: Usa modelos Flash (
eleven_flash_v2oeleven_flash_v2_5) — consulta la guía de optimización de la latencia - Texto extenso: Divide los textos largos en segmentos; usa los parámetros
previous_text/next_textpara mantener una prosodia natural entre fragmentos