Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Eleven v3 Audio Tags: Dando conciencia situacional al audio IA

Escrito por
Ryan Morrison
Publicado
Última actualización

EscucharEscucha este artículo

Audio Tags son una parte fundamental del nuevo modelo de Eleven v3 (alfa) de Texto a Voz. Te permiten controlar cómo se interpretan las líneas, cambiando el tono, la emoción y el ritmo para reflejar el contexto del mundo real.

En su forma más simple, los Audio Tags son palabras entre corchetes. El modelo las interpreta como indicaciones de interpretación. Esto significa que puedes ajustar la entonación a mitad de frase para reflejar momentos emocionales o cambios de situación, y dotar a la IA de cierto conocimiento del contexto.

¿Qué es el conocimiento del contexto en la voz IA?

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00

El conocimiento del contexto significa que la IA adapta su entonación al momento. Con Audio Tags, controlas no solo lo que dice el modelo, sino también cómo responde.

Tanto si añades urgencia con una etiqueta [SHOUTING], suavizas una advertencia con [WHISPER] o transmites dudas con [SIGH], las etiquetas transforman la narración en interpretación. Son especialmente útiles en escenas con mucho contexto o dinámicas.

Interpretación, no solo lectura

Imagina que estás escribiendo el guion de un vídeo de momentos destacados en Veo 3 sobre un partido de fútbol entre 11 United y 12 United. Quieres que la intensidad aumente con la acción: «Deja atrás a un defensa — [EXCITED] llega el centro — [SHOUTING] ¡GOOOOOL!»

O que pones voz a un momento de suspense en un audiolibro: «[WHISPERING] Creo que hay alguien en casa. [PAUSE] No hagas ruido».

No son simples añadidos estilísticos. Definen el momento y determinan cómo se siente. El modelo no lee: interpreta.

Etiquetas habituales para el uso situacional

Los Audio Tags te permiten simular una variedad de señales emocionales y físicas:

  • Tono emocional: [EXCITED], [NERVOUS], [FRUSTRATED], [TIRED]
  • Reacciones: [GASP], [SIGH], [LAUGHS], [GULPS]
  • Volumen y energía: [WHISPERING], [SHOUTING], [QUIETLY], [LOUDLY]
  • Ritmo y cadencia: [PAUSES], [STAMMERS], [RUSHED]

Puedes combinar etiquetas para añadir matices: «[NERVOUSLY] Yo... no estoy seguro de que esto vaya a funcionar. [GULPS] Pero probémoslo de todos modos».

Interpretación bajo tu control

Eleven v3 admite estas etiquetas con un modelo contextual más profundo. Puede cambiar el tono a mitad de frase, gestionar interrupciones y mantener la fluidez, para ofrecerte una entonación más natural sin tener que reescribir el guion.

Para profesionales del diseño de voz, desarrolladores de videojuegos y narradores, esto abre una nueva capa creativa. No solo escribes líneas: las diriges.

Elegir la voz adecuada

Actualmente, los clones de voz profesionales (PVC) no están totalmente optimizados para Eleven v3, por lo que la calidad del clon puede ser inferior a la de modelos anteriores. Durante esta fase de vista previa de investigación, si necesitas usar las funciones de v3, te recomendamos buscar un clon de voz instantáneo Clonar Voz IA (IVC) o una voz diseñada para tu proyecto. La optimización de los PVC para v3 llegará próximamente.

Artículos relacionados

Crea con el audio IA de la más alta calidad