Ir al contenido

Presentamos Eleven v3 (alpha)

Publicado

EscucharEscucha este artículo

Eleven v3 is no longer in alpha, and is now generally available.


Nos complace presentar Eleven v3 (alpha), el modelo de Texto a Voz más expresivo.

Esta versión preliminar de investigación ofrece un control y un realismo sin precedentes en la generación de voz gracias a:

  • Más de 70 idiomas
  • Diálogo con varios interlocutores
  • Etiquetas de audio como [excited], [whispers] y [sighs]

Eleven v3 (alpha) requiere más prompt engineering que los modelos anteriores, pero los resultados son impresionantes.

Si trabajas en vídeos, audiolibros o herramientas multimedia, esto abre un nuevo nivel de expresividad. Por ahora, para casos de uso conversacionales y en tiempo real, recomendamos seguir usando v2.5 Turbo o Flash. Estamos desarrollando una versión de v3 en tiempo real.

Eleven v3 ya está disponible en nuestra web y en la API.

Por qué creamos v3

Desde el lanzamiento de Multilingual v2, hemos visto cómo la voz IA se ha adoptado en cine profesional, desarrollo de videojuegos, educación y accesibilidad. Pero la limitación constante no era la calidad del sonido, sino la expresividad. Era difícil conseguir emociones más marcadas, interrupciones naturales en las conversaciones e intercambios creíbles.

Eleven v3 resuelve esta carencia. Lo hemos creado desde cero para ofrecer voces que suspiran, susurran, ríen y reaccionan, generando una voz que responde de forma genuina y suena viva.

Novedades de Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Escucha v3 por ti mismo

Background
Background

Uso de etiquetas de audio

Las etiquetas de audio se incluyen directamente en el guion y se escriben entre corchetes y en minúsculas. Puedes consultar más información sobre las etiquetas de audio en nuestra guía de prompting para v3 en la documentación.

Actualmente, los Clones de Voz Profesionales (PVC) no están totalmente optimizados para Eleven v3, por lo que la calidad del clon podría ser inferior a la de modelos anteriores. Durante esta fase de vista previa de investigación, si necesitas usar las funciones de v3, te recomendamos buscar un clon de Voz Instantáneo (IVC) o una voz diseñada para tu proyecto. La optimización de PVC para v3 llegará próximamente.

Por ejemplo, puedes usar este prompt: «[whispers] Something’s coming… [sighs] I can feel it.». Para un control más expresivo, puedes combinar varias etiquetas:

“[happily][shouts] We did it! [laughs].”

Creación de diálogos con varios interlocutores

Eleven v3 es compatible con nuestra ruta de API de Texto a Voz actual. Además, presentamos una nueva ruta de API de Texto a Diálogo. Proporciona un array estructurado de objetos JSON —cada uno representa el turno de un interlocutor— y el modelo genera un archivo de audio cohesionado con solapamientos:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

La ruta de API gestiona automáticamente las transiciones entre interlocutores, los cambios emocionales y las interrupciones.

Más información aquí.

v3 es nuestro modelo más expresivo

Background
Background

Precios y disponibilidad

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Para activar v3:

  • Usa el Selector de modelo y selecciona Eleven v3 (alpha)

El acceso a la API y la compatibilidad con Studio llegarán próximamente. Para obtener acceso anticipado, contacta con ventas.

Cuándo no usar v3

Eleven v3 (alpha) requiere más prompt engineering que nuestros modelos anteriores. Cuando funciona, el resultado es impresionante, pero su menor fiabilidad y mayor latencia hacen que no sea adecuado para casos de uso conversacionales y en tiempo real. Para estos, recomendamos Eleven v2.5 Turbo/Flash.

Para más información, consulta la documentación completa de v3 y las preguntas frecuentes.

Pruébalo hoy

Background
Background
  1. Inicia sesión en la interfaz de ElevenLabs
  2. Selecciona v3 (alpha) en el menú desplegable de modelos
  3. Pega tu guion: usa etiquetas o diálogos 
  4. Genera audio

Tenemos muchas ganas de ver cómo das vida a v3 en nuevos casos de uso, desde narrativas inmersivas hasta flujos de producción cinematográfica.

Artículos relacionados

Crea con el audio IA de la más alta calidad