Ir al contenido

API de Texto a Voz

Generación de voz ultrarrealista y de baja latencia

Desarrolla aplicaciones en tiempo real y a gran escala con Texto a Voz de alta calidad y controlable. Modelos optimizados para latencia, fidelidad y consistencia en contenidos largos.

En la antigua tierra de Eldoria, donde los cielos brillaban y los bosques susurraban secretos al viento, vivía un dragón llamado Zephyros. [sarcastically] No del tipo que “lo quema todo... [giggles] sino que era amable, sabio, con ojos como estrellas antiguas. [whispers] Incluso los pájaros guardaban silencio cuando él pasaba.
  • Lovable
  • Synthesia
  • Stripe
  • Perplexity
  • Twilio

Basado en los modelos de IA de voz más potentes

Elige el modelo adecuado para tu caso de uso: desde agentes con latencia ultrabaja hasta narraciones expresivas de formato largo.

Translate media step 5 background

Eleven v3

Nuestro modelo más expresivo y rico en emociones

  • Entonación e interpretación dramáticas
  • Compatible con más de 70 idiomas
  • Límite de 3000 caracteres
  • Diálogo entre varios hablantes
  • ~0,10 $ por minuto
Blurred background

v3 Conversational

Nuestro modelo más expresivo para voz en tiempo real.

  • Baja latencia (~280 ms)
  • Alta calidad y entonación expresiva
  • Compatible con más de 70 idiomas
  • Etiquetas de audio personalizadas
  • ~0,05 $ por minuto
Scribe 1

Flash v2.5

Nuestro modelo de síntesis de voz con menor latencia

  • Latencia ultrabaja (~75 ms)
  • Compatible con 32 idiomas
  • Límite de 40.000 caracteres
  • ~0,05 $ por minuto
Scribe background 4

Multilingual v2

Modelo de síntesis de voz realista y de calidad constante

  • Resultado con sonido natural
  • Compatible con 29 idiomas
  • Límite de 10.000 caracteres
  • Diseñado para generaciones de contenido largo
  • ~0,10 $ por minuto

Todo lo que necesitas para crear voz lista para producción

Genera voz expresiva y controlable con modelos diseñados para tiempo real, contenidos largos y producción.

Controla la emoción y la entonación

Crea voz expresiva y controlable, con capas de emoción, eventos de audio y paisajes sonoros inmersivos.
Control emotion and delivery

Accede a más de 11.000 voces

Explora una colección en constante crecimiento de voces expresivas y realistas para cualquier caso de uso.
10,000+ voices

Diseño y clonación de voz

Crea en más de 30 idiomas con voces naturales, acentos expresivos y audio localizado adaptado a tu audiencia.
Voice design and cloning

Diálogo entre varios hablantes

Crea conversaciones naturales entre varios hablantes en más de 70 idiomas con voces expresivas y controlables.
Multi-speaker dialogue

Eventos de audio y dirección

Controla la entonación con etiquetas de audio, indicaciones de tiempo y dirección narrativa integradas en la voz.
Audio events and direction

Diccionarios de pronunciación

Define pronunciaciones personalizadas para garantizar una voz coherente y precisa en nombres y terminología.
Pronunciation dictionary

Impulsando a las empresas y marcas líderes del mundo

  • Desde doblar Reels a idiomas locales hasta generar música y voces de personajes en Horizon, la plataforma de ElevenLabs permite a creadores, empresas y grandes organizaciones de todo el mundo crear con voz, música y sonido a gran escala.
    Meta Color Logo
  • Millones de personas aprenden ajedrez cada día de creadores como Hikaru, Levy y Magnus en YouTube y Twitch. Ahora puedes aprender de ellos dentro de Chess.com de una forma inmersiva, personal y llena de carácter. Nuestra misión es crear un entrenador de ajedrez que enseñe al nivel adecuado, dé la bienvenida a jugadores de todos los niveles y haga el ajedrez más accesible sin perder su diversión ni personalidad. Con ElevenLabs y estas increíbles voces nuevas, hemos dado un gran paso para hacer realidad esa visión.
    Chess.com logo
  • ElevenLabs nos facilitó incorporar rápidamente potentes funciones de Texto a Voz a nuestro SDK, lo que permite a los agentes responder en tiempo real con voces expresivas a las preguntas de usuarios o darles feedback sobre lo que están viendo.
    Stream Color Logo
  • Twilio ha integrado la tecnología de voz con IA generativa de ElevenLabs en su CPaaS, mejorando ConversationRelay. Esta integración permite a empresas y desarrolladores crear interacciones conversacionales de voz con IA que suenan humanas, resultan expresivas y responden en tiempo real directamente desde la plataforma CPaaS de Twilio. En ElevenLabs nos entusiasma que Twilio haya elegido ElevenLabs para mejorar ConversationRelay con las voces más expresivas y humanas disponibles.
    Twilio logo

API diseñadas para producción

Enterprise data protection developers

Los datos se cifran en tránsito y en reposo, con compatibilidad con SOC 2, HIPAA y cumplimiento del RGPD. Disponemos de residencia de datos en la UE y modos de retención cero para un control más estricto de los datos.

Los datos se cifran en tránsito y en reposo, con compatibilidad con SOC 2, HIPAA y cumplimiento del RGPD. Disponemos de residencia de datos en la UE y modos de retención cero para un control más estricto de los datos.

SDKs

SDK oficiales para Python y TypeScript con seguridad de tipos, compatibilidad con streaming y ejemplos claros.

Nuestro equipo garantiza un lanzamiento fluido y el funcionamiento fiable de tus operaciones, con un rendimiento constante y tranquilidad.

Preguntas frecuentes

Últimas novedades

La plataforma de audio con IA más realista