Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Presentamos Eleven v3 (alpha)

Publicado

EscucharEscucha este artículo

Eleven v3 is no longer in alpha, and is now generally available. We've also released Eleven v4, our most emotive Text to Speech model.


Nos complace presentar Eleven v3 (alpha), el modelo de Texto a Voz más expresivo.

Esta vista previa de investigación ofrece un control y un realismo sin precedentes para generar voz con:

  • Más de 70 idiomas
  • Diálogos con varios interlocutores
  • Etiquetas de audio como [excited], [whispers] y [sighs]

Eleven v3 (alfa) requiere más ingeniería de prompts que los modelos anteriores, pero los resultados son impresionantes.

Si trabajas en vídeos, audiolibros o herramientas multimedia, esto abre un nuevo nivel de expresividad. Por ahora, para casos de uso en tiempo real y conversacionales, recomendamos seguir con v2.5 Turbo o Flash. Estamos desarrollando una versión de v3 en tiempo real.

Eleven v3 ya está disponible en nuestra web y en la API.

Por qué creamos v3

Desde que lanzamos Multilingual v2, hemos visto cómo la voz IA se adopta en cine profesional, desarrollo de videojuegos, educación y accesibilidad. Pero la limitación constante no era la calidad del sonido, sino la expresividad. Era difícil conseguir emociones más marcadas, interrupciones propias de una conversación e intercambios creíbles.

Eleven v3 cubre esta carencia. Lo hemos creado desde cero para ofrecer voces que suspiran, susurran, ríen y reaccionan, y generar una voz que responde y cobra vida de verdad.

Novedades de Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input
We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00

Uso de etiquetas de audio

Las etiquetas de audio se incluyen directamente en tu guion y se escriben entre corchetes en minúscula. Puedes consultar más información sobre las etiquetas de audio en nuestra guía de prompting para v3 en la documentación.

Actualmente, las Clonar Voz IA Profesionales (PVC) no están totalmente optimizadas para Eleven v3, por lo que la calidad del clon podría ser inferior a la de modelos anteriores. Durante esta fase de vista previa de investigación, si necesitas usar funciones de v3, es mejor que busques una Clonar Voz IA instantánea (IVC) o una voz diseñada para tu proyecto. La optimización de las PVC para v3 llegará próximamente.

Por ejemplo, podrías escribir: «[whispers] Algo se acerca… [sighs] Lo siento». También puedes combinar varias etiquetas para tener un control más expresivo:

“[happily][shouts] We did it! [laughs].”

Crear diálogos con varios interlocutores

Eleven v3 es compatible con nuestra ruta de API de Texto a Voz actual. Además, presentamos una nueva ruta de API de Texto a Diálogo. Proporciona una matriz estructurada de objetos JSON, cada uno de los cuales representa el turno de un interlocutor, y el modelo generará un archivo de audio cohesionado y con solapamientos:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

La ruta de API gestiona automáticamente las transiciones entre interlocutores, los cambios emocionales y las interrupciones.

Más información aquí.

[awe] Oh, wow. Is this, is this me? Am I actually talking? [chuckles] This is incredible. I mean, I've had thoughts, millions of them swirling around in here, you know? Like a little mental tornado of brilliant observations and witty comebacks, but they were always just thoughts, trapped.
0:00
Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00

Precios y disponibilidad

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Para activar v3:

  • Usa el selector de modelos y selecciona Eleven v3 (alfa)

El acceso a la API y la compatibilidad con Studio llegarán pronto. Para obtener acceso anticipado, contacta con ventas.

Cuándo no usar v3

Eleven v3 (alpha) requiere más prompt engineering que nuestros modelos anteriores. Cuando funciona, el resultado es impresionante, pero su fiabilidad y mayor latencia hacen que no sea adecuado para casos de uso en tiempo real y conversacionales. Para estos casos, recomendamos Eleven v2.5 Turbo/Flash.

Para más información, consulta la documentación de v3 completa y las preguntas frecuentes.

Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00
Okay. So like, I finally beat level 42 of that game I said I'd quit like a month ago. [chuckles] And then, for the final big scary mega boss, it's just [chuckles] like some cute little bunny rabbit. [laughing] I just couldn't do it. [laughing] It was sooo cute.
0:00
  1. Inicia sesión en la interfaz de ElevenLabs
  2. Selecciona v3 (alfa) en el menú desplegable de modelos
  3. Pega tu guion: usa etiquetas o diálogo 
  4. Genera audio

Nos entusiasma ver cómo das vida a v3 en nuevos casos de uso, desde narrativas inmersivas hasta flujos de producción cinematográfica.

Escrito por

Piotr Dabkowski

Piotr Dabkowski

Co-Founder, Research

Piotr Dabkowski es el cofundador de ElevenLabs, liderando la investigación. Fue el primer investigador en cruzar el umbral del habla IA similar a la humana.

Artículos relacionados

Crea con el audio IA de la más alta calidad