Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Ir al contenido

Presentamos Eleven v4, nuestro modelo más expresivo

Publicado

EscucharEscucha este artículo

Una misma frase puede cambiar mucho según cómo se diga. «Necesito que mantengas la calma» debería sonar diferente según quién la pronuncie: un médico diciéndoselo con suavidad a un paciente asustado o un personaje de un videojuego gritándoselo a su escuadrón antes de entrar en combate.

Hoy lanzamos Eleven v4, nuestro modelo de Texto a Voz más emotivo hasta la fecha, y su variante de baja latencia, Eleven v4 Turbo.

elevenv4 video cover

Clasificado en el n.º 1 por Artificial Analysis1, y preferido por aproximadamente el 75 % de los oyentes en pruebas comparativas a ciegas frente a modelos de la competencia2, Eleven v4 se ha diseñado para interpretar el tono, el ritmo, la emoción, el personaje y el contexto. Genera voces que pueden sonar dramáticas, tiernas, urgentes, cómicas o conversacionales, sin perder la identidad del hablante. Las dinámicas entre varios hablantes son más naturales, por lo que las conversaciones parecen ágiles en lugar de líneas independientes unidas entre sí. Los hablantes responden al contexto de la conversación, lo que genera diálogos e interacciones entre personajes más naturales.

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

Una nueva arquitectura diseñada para rendir

Basado en una arquitectura completamente nueva, Eleven v4 es nuestro modelo de Texto a Voz más emotivo y está clasificado en el n.º 1 por Artificial Analysis1. Eleven v4 Turbo lleva esa misma tecnología a casos de uso de baja latencia, como los agentes. Con una latencia de inferencia mediana de aproximadamente 100 ms, puede responder más rápido que la pausa media entre dos personas conversando.

Ambos modelos pueden generar voces que transmiten emoción en vez de sonar mecánicas. La fidelidad de audio subyacente también es mayor en todos los aspectos, con resultados más limpios y naturales. 

Las generaciones anteriores de modelos de texto a voz pueden leer texto en voz alta, pero Eleven v4 aporta a la voz una profundidad emocional mucho más natural. El modelo puede interpretar el tono deseado, el ritmo que debe llevar la voz, el carácter de la escritura y el contexto del texto para generar voces que conectan emocionalmente.

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

Usuarios también tienen un control detallado sobre los resultados y pueden describir en lenguaje natural cómo debe interpretarse una frase. También pueden añadir instrucciones específicas sobre cómo pronunciar determinadas expresiones, qué emoción deben transmitir e incluso efectos de sonido mediante etiquetas integradas como [laughs], [said angrily in French accent], [light rain] o [phone buzzing]. Eleven v4 sigue estas etiquetas de audio y prompts de dirección con más precisión que los modelos anteriores, para que la interpretación que describes sea la que obtengas. Esto facilita dirigir narraciones, dar profundidad a los personajes o sus diálogos, y cualquier otro caso en el que la entonación sea importante. 

La documentación para desarrolladores de ElevenLabs explica toda la sintaxis de las etiquetas y cómo aplicarlas mediante la API. También hemos mejorado considerablemente la compatibilidad con los fonemas del Alfabeto Fonético Internacional (AFI), para que las pronunciaciones personalizadas funcionen de forma más fiable.

Eleven v4 también mejora la consistencia y las conversaciones dinámicas entre varios hablantes. Mediante un nuevo método para capturar la identidad de los hablantes, Eleven v4 conserva las cualidades únicas de cada voz. Puede mantener una voz consistente en conversaciones con agentes, audiolibros o anuncios. Como el modelo entiende el contexto de toda una escena, genera diálogos naturales en los que los hablantes responden a lo que se acaba de decir, en vez de unir líneas aisladas.

Un modelo Turbo para casos de uso de baja latencia

Los modelos de voz de alta calidad solían tardar más en generar voz, por lo que usuarios tenían que elegir entre agentes de voz rápidos o expresivos. Muchos han optado por agentes eficaces pero monótonos, que pueden parecer robóticos a un cliente nervioso que solo quiere resolver su problema. 

Eleven v4 Turbo combina velocidad y emoción con un tiempo mediano hasta la primera voz de aproximadamente 150 ms3, lo que permite implementar agentes potentes en innumerables sectores: desde agentes cercanos y tranquilizadores que pronuncian con precisión términos médicos en el ámbito sanitario, hasta agentes que hablan rápido y usan jerga para entretener a jugadores de videojuegos.

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

El modelo Eleven v4 Turbo está diseñado para funcionar con ElevenAgents, la plataforma de agentes conversacionales de ElevenLabs. Otros creadores de agentes combinan modelos y software de distintos proveedores, por lo que usuarios no disponen de una forma de refinar o mejorar los resultados de los modelos para sus casos de uso concretos. Los equipos de investigación e ingeniería de ElevenLabs han optimizado Eleven v4 Turbo y ElevenAgents como un único sistema, con agentes más expresivos, fiables y de baja latencia.  

Una voz, infinidad de idiomas 

Nuestra forma de comunicarnos varía según el contexto, el lugar e incluso la hora del día. Crear voces expresivas que reflejen esas diferencias en todos los idiomas sigue siendo uno de los retos más difíciles de la IA de audio. 

Eleven v4 supone un avance en todos estos aspectos, y las mejoras van más allá de cómo el modelo pronuncia las frases. Eleven v4 capta mejor el ritmo, la emoción y la entonación en distintos idiomas, lo que ayuda a creadores a generar voces que resultan naturales para cada idioma y contexto. Por ejemplo, la forma de hablar con una persona mayor desconocida en Japón es muy diferente de la que usarías en Italia. 

Tanto Eleven v4 como Eleven v4 Turbo admiten más de 90 idiomas. Ahora, una voz grabada en un idioma también habla cualquier otro con fluidez, adoptando el acento de un hablante nativo y conservando la identidad de la voz original. La fidelidad al acento es notablemente mayor que antes, por lo que la voz ya no vuelve gradualmente a su acento de origen a lo largo de una generación.

Catalán

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

Español

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

Para doblaje y localización, esto significa que la voz de marca que has elegido —ya sea la de un actor famoso con quien trabajas o un tono que encaja mejor con el estilo de tu empresa— sonará genial en cualquier idioma compatible con Eleven v4.

Clonación de voz más auténtica y consistente

La clonación de voz es más auténtica, potente y consistente en Eleven v4 y Eleven v4 Turbo, con una similitud con la voz original significativamente mayor. Ahora, los Clones de Voz Instantáneos pueden capturar voces con alta fidelidad usando solo 10 segundos de audio. 

Voz real

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 también preserva la identidad del hablante de forma más fiable en generaciones, diálogos, narraciones y líneas regeneradas. Esto significa que, en proyectos de formato largo, los personajes, narradores y voces clonadas se mantienen consistentes durante toda la producción. Eleven v4 también añade compatibilidad con Clones de Voz Profesionales (PVC) para los casos de uso de clonación que requieren la máxima fidelidad.

El encadenamiento de solicitudes —unir generaciones para crear contenido de mayor duración— también es mucho más fiable en Eleven v4, lo que mejora la experiencia de trabajar en ElevenLabs Studio y la app ElevenLabs Reader.

Escucha la diferencia por ti mismo  

Eleven v4 y Eleven v4 Turbo son la culminación de nuestras últimas investigaciones sobre generación de voz expresiva. Están diseñados para contenido en el que la entonación importa tanto como las propias palabras, como audiolibros, interpretaciones de personajes, locuciones, doblaje o la localización de agentes conversacionales.

Ambos modelos ya están disponibles en ElevenAgents, ElevenCreative y a través de ElevenAPI. Crea una cuenta gratis para empezar a generar con Eleven v4 o Eleven v4 Turbo hoy mismo.

  1. Artificial Analysis, clasificación Provider Voice Arena, septiembre de 2026
  2. Basado en pruebas comparativas a ciegas de preferencia de usuarios frente a Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS y Google Gemini 3.8 Flash TTS, realizadas en septiembre de 2026. Para cada pareja, los evaluadores escucharon la misma frase de Eleven v4 y de un competidor, presentada a ciegas, y determinaron cuál era más expresiva y cuál sonaba más natural; los empates contaron como medio punto.
  3. Tiempo mediano desde la solicitud hasta la voz audible. Medido en septiembre de 2026 con guiones idénticos y ajustes predeterminados frente a Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS y OpenAI GPT-4o mini TTS; la latencia de red se midió y se eliminó en todos los sistemas. Eleven v4 Turbo mediante streaming por WebSocket.

Artículos relacionados

Crea con el audio IA de la más alta calidad