Nuestros modelos más expresivos hasta la fecha
y v4 Turbo
Crea voz expresiva y controlable con emoción, eventos de audio y paisajes sonoros envolventes.
Eleven v4
Nuestro modelo de voz más rápido y emotivomodelo de voz
Eleven v4 se basa en una arquitectura completamente nueva que interpreta un guion como lo haría un actor de doblaje. Sabe quién habla, qué acaba de pasar y cómo debe sonar cada frase.

John - presentador, teatral
Sia - conversacional, británica
John - presentador, teatral
John - presentador, teatralUn abanico de emociones y sonidos
Voz en más de 90 idiomas y con una extraordinaria gama emocional, varios hablantes y efectos de sonido integrados para crear la escena.

Basado en una nueva arquitectura
Añade indicaciones al guion
Añade indicaciones como [laughs], [whispers] y [door slams] directamente al guion. Eleven v4 sigue las secuencias de etiquetas con más fiabilidad que v3, incluidos los efectos de sonido.
Une audio de larga duración sin cortes
La unión por contexto mantiene el ritmo y la entonación en un guion de cualquier longitud. Un audiolibro completo suena como una única toma, de la primera página a la última.
Regenera sin que cambie la voz
Repite una frase una o cincuenta veces y seguirá hablando la misma persona. La estabilidad del hablante se mantiene en diálogos, narraciones y todo lo demás.
Usa un Clon de Voz Profesional
Los Clones de Voz Profesionales no eran compatibles con v3. En Eleven v4 vuelven y aprovechan toda la gama emocional del modelo en todos los idiomas que hablan.
Eleven v4 Turbo
Presentamos Eleven v4 Turbopara tiempo real y agentes
Nuestro modelo de voz en tiempo real más rápido, con la gama expresiva de Eleven v4, disponible a través de la API y ElevenAgents. Eleven v4 Turbo tiene una latencia de inferencia mediana de ~150 ms y mantiene la coherencia en interacciones largas.
Tiempos de respuesta que pasan desapercibidos
Con una mediana de 150 ms hasta la primera voz, la latencia desaparece y la conversación fluye con naturalidad.
Escúchalo en una llamada real
Descubre más sobre Eleven v4 Turbo con un agente impulsado por este modelo.
Optimizado para conversaciones en directo
Texto en streaming, audio en streaming
Envía texto a medida que lo genera tu LLM y el audio empieza a llegar antes de que termine la frase. Streaming bidireccional, diseñado para los bucles de agentes.
Expresividad a velocidad conversacional
Turbo conserva toda la gama expresiva de Eleven v4. Confirmaciones, escalados y esperas suenan de forma distinta, en lugar de leerse igual.
Una voz en cada turno
Los Clones de Voz Profesionales funcionan igual en ambos modelos, por lo que una misma voz de marca se mantiene coherente desde el primer turno de una llamada hasta el último.
Habla el idioma como un nativo
Úsalo con texto en japonés, español o portugués y la voz lo hablará con fluidez y acento nativo.





Elige entre más de 17.500 voces



Elige entre más de 17.500 voces



Voces de narración Un espacio para narradores. Voces cálidas, con autoridad y coherentes en cada proyecto.
Voces conversacionales Para las conversaciones del día a día necesitas una voz natural y cercana. Nuestras voces conversacionales están creadas para diálogos y podcasts que suenan improvisados.
Voces para redes sociales Voces que cobran vida en contenido breve. Capta la energía y personalidad necesarias para que alguien vea tu TikTok o Reel hasta el final.
Voces de personajes Un catálogo de voces para tu mundo de ficción. Elige entre un reparto dinámico que da vida a tu juego, audiolibro o animación.
Voces educativas Voces fiables y pacientes que guían a estudiantes por temas complejos. Ideales para cursos, tutoriales, simulaciones de formación y guías de cualquier nivel.
Voces para publicidad Voces pulidas y llenas de confianza para impulsar la venta de tu próximo producto. Perfectas para anuncios digitales o locuciones de televisión y radio.
Voces de entretenimiento Desde potentes tráilers de cine hasta voces cómicas pensadas para interpretar, estas voces desbordan personalidad. Para contenido en el que la entonación importa tanto como el mensaje.
Voces multilingües Voces creadas para contenido global. Ritmo natural, expresiones idiomáticas y acentos que conectan con audiencias en todos los mercados.
Hemos ampliado la adopción de Agentforce Voice mediante un control determinista, y nuestros clientes nos dicen de forma constante que confían en él porque cada acción de un agente se basa en información fundamentada y está gobernada, en vez de improvisarse. Una parte clave de esta estrategia es equilibrar ese determinismo con modelos de voz de gran calidad y alta inteligencia emocional. Ahí es precisamente donde vemos que Eleven v4 Turbo eleva el listón, con respuestas más rápidas y naturales que cumplen el nivel que esperan nuestros clientes y les permiten llevar Agentforce Voice a aún más casos de uso.
Al trabajar con cientos de medios para llevar su periodismo al audio, vemos de primera mano cuánto importa la calidad de la voz. Desde que colaboramos con ElevenLabs, muchos de nuestros medios han logrado mayor interacción y tiempos de escucha más largos. Eleven v4 ofrece a los medios más formas de garantizar que esas voces resulten atractivas, familiares e inconfundiblemente propias.
ElevenLabs v4 aporta un nuevo nivel de naturalidad a las conversaciones por voz. Las voces no solo son más expresivas, sino también más controlables, lo que nos permite crear experiencias de voz más ricas e inmersivas.
La primera vez que lo usé (Eleven v4), era tan limpio y realista que parecía que estaba dirigiendo una sesión con talento en la cabina.
Buscábamos un modelo de voz lo bastante rápido como para sentirse como una conversación real sin sacrificar calidad, y Eleven v4 Turbo es el primero que consigue ambas cosas. Para los workflows de ventas automatizados, este es el momento en que crear deja de parecer un experimento.
Elige cómo suenaantes de decir una palabra
Cada generación comienza con una voz. Clona una que ya tengas, diseña una a partir de una descripción o corrige cómo se dicen palabras concretas con compatibilidad con IPA.


Clonar Voz IA
Clona una voz a partir de diez segundos de audio o entrena un Clon de Voz Profesional para lograr una coincidencia casi perfecta.
Diseño de voz
Describe una voz en una frase y genérala, sin sesiones de grabación ni procesos de casting.
Diccionario de pronunciación
Define cómo se pronuncian nombres, acrónimos y términos técnicos. Configúralo una vez y todas las generaciones lo usarán.
Empieza a crear gratisCambia a un plan superior cuando necesites más
Disponible a través de la APILleva Eleven v4 a tu app
Crea experiencias en tiempo real y agentes de voz con Eleven v4 Turbo, todo a través de ElevenAPI.
Accede a la API de Eleven v4 y Eleven v4 Turbo
Añade voz expresiva a cualquier producto con nuestra API REST, rutas de streaming o SDK para TypeScript y Python.
- Cambia de modelo con un único model_id
- Envía texto por streaming y recibe audio en tiempo real
- Mantén la continuidad en generaciones de larga duración


