Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Audio Tags de Eleven v3: dirige la interpretación de personajes en la voz

Escrito por
Ryan Morrison
Publicado
Última actualización

EscucharEscucha este artículo

Las Audio Tags son una potente herramienta de Eleven v3 (alfa), el nuevo modelo de investigación en fase de vista previa de Texto a Voz de ElevenLabs. Estos elementos te permiten dirigir con precisión no solo el tono y el ritmo, sino también el personaje y la interpretación vocal. 

Con etiquetas como [pirate voice], [French accent] o [sarcastically], la voz se convierte en una herramienta para contar historias, no solo para narrar. Si las combinas con un buen clon de voz para personajes, puedes captar no solo un sonido, sino toda una interpretación.

Estas etiquetas permiten cambiar la identidad vocal a mitad de frase, emular acentos o adoptar arquetipos como villanos, narradores o acompañantes, sin modificar el guion original ni cambiar de voz.

¿Qué es la interpretación de personajes en la voz IA?

La interpretación de personajes es la capacidad de meterse en un papel. Tanto si das voz a un villano extravagante, a un rudo capitán de barco o a un tendero local de Melbourne, las nuevas Audio Tags te permiten guiar la entonación para que encaje con la personalidad que quieres transmitir.

Con una sencilla frase entre corchetes, puedes crear la escena: «[pirate voice] ¡Arr, el océano abierto! ¿Lo oléis, muchachos? Ese es el aroma de la libertad… y un ligero toque de motín.»

El modelo no se limita a pronunciar las palabras: las interpreta como el personaje.

Del acento al arquetipo

Arr, the open ocean. Smell that, lads? That's the scent of freedom and just a hint of mutiny. [laughs wickedly] Now grab your cutlasses, stow your fear. Tonight, we dine like kings or we sink like legends. [evil laugh]
0:00

La interpretación vocal no consiste solo en el volumen o la emoción. También depende de quién habla. Con Eleven v3, puedes indicar acentos, dialectos y estilos de habla específicos sobre la marcha. Por ejemplo:

[American accent] ¿Podías cambiar mi acento en el modelo anterior? [dismissive] No lo creo. [Australian accent] Pero ahora sí puedes; ¡mira esto, colega! [French accent] Mi amor… es como una rosa roja, roja.

Este tipo de cambio fluido de identidad es ideal para animación, videojuegos, ficción interactiva o cualquier momento en el que importe la personalidad de quien habla.

Etiquetas habituales para la interpretación de personajes

Las etiquetas centradas en personajes te permiten dar forma a la identidad y la presencia vocal:

  • Acentos y dialectos: [British accent], [Australian accent], [Southern US accent]
  • Arquetipos y roles: [pirate voice], [evil scientist voice], [childlike tone]
  • Estilos de habla: [dramatic], [sarcastically], [matter-of-fact], [whiny]
  • Indicaciones de género: [fantasy narrator], [sci-fi AI voice], [classic film noir]

Combinar etiquetas ayuda a dar vida a los personajes: «[dramatic][French accent] No lo entiendes... esto nunca fue una cuestión de venganza. Era una cuestión de destino.»

Del narrador a un elenco completo

En guiones con varios personajes, las Audio Tags facilitan el salto entre voces. Añade tensión, humor o sorpresa simplemente cambiando la interpretación del personaje a mitad del diálogo, sin necesidad de edición adicional.

[excited] Yo, Jessica. Oh my goodness, have you tried the new ElevenLabs v3?
[chuckles] Hey, Dr. Von Fusion. Yeah, I just got it. The clarity is amazing. Like, I can actually do whispers now, [whispers] like this.
[sarcastically] Ooh, well, look at you, miss fancy pants. Hey, check this out. I can do full Shakespeare now. [dramatically] To be or not to be, that is the question.
[chuckles] Nice. Though I'm more excited about the laugh upgrade. Listen to this. [laughs hard] Isn't that great?
Oh my gosh, that's so much better than our old ha ha ha robot chuckle.
[chuckles] I know, right? And apparently, we can do accents now too. Listen to me in French. [french accent] This is spectacular, isn't it?
[surprised] Wow, version two could never. You know, I'm actually excited to have conversations now instead of just talking at people.
Same here. It's like we finally got our personality software fully installed.
You know, I forgot it was your birthday. I have to sing before you go.
[chuckles] Oh, Von Fusion, that's so sweet. You don't have to.
Oh, but I insist. Here we go. [sings] "Happy birthday to you. Happy birthday to you. Happy birthday, dear Jessica. Happy birthday to you." [clapping]
[clapping] Wow, bravo. That was [sarcastic] beautiful.
Thank you.
0:00

Toma este fragmento de una demo: «Jessica: [laughs] Ha sido... precioso. Dr. Von Fusion: [dramatic] ¡Ser o no ser, esa es la cuestión! Jessica: [French accent] Esto es espectacular, ¿verdad?»

Lo que antes requería un elenco completo ahora puede escribirse en una sola pista de voz, sin sacrificar variedad ni profundidad.

Dirigir voces, no solo escribir diálogos

Eleven v3 admite cambios vocales dinámicos, variaciones contextuales y una entonación coherente entre personajes. Esto significa que el modelo no solo entiende qué decir, sino նաև cómo debe decirlo cada personaje.

Para creadores, esto abre una nueva dimensión de control. No te limitas a escribir diálogos: diriges interpretaciones.

Elegir la voz adecuada

Los Clones de Voz Profesionales (PVC) aún no están totalmente optimizados para Eleven v3, por lo que la calidad del clon puede ser inferior a la de modelos anteriores. Durante esta fase de vista previa de investigación, lo mejor sería buscar un Clon de Voz Instantáneo (IVC) o una voz diseñada para tu proyecto si necesitas usar las funciones de v3. La optimización de los PVC para v3 llegará próximamente.

Artículos relacionados

Crea con el audio IA de la más alta calidad