Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Lista de Audio Tags de Eleven v4: pruébalas y luego crea las tuyas

Escrito por
Jack Limebear
Publicado

EscucharEscucha este artículo

Eleven v4 es un modelo revolucionario de Texto a Voz que convierte texto en una interpretación. Las Audio Tags te permiten dirigir esa interpretación con un control detallado de su expresión emocional. Añade una indicación en lenguaje natural entre corchetes, como [whispers] o [excited], y escucha cómo v4 adapta la entonación.

Esta lista de Audio Tags de ElevenLabs abarca todas las emociones del completo rango emocional de Eleven v4, junto con etiquetas para la entonación, el ritmo, las reacciones, los acentos y los efectos de sonido. Cuando conozcas lo básico, también te mostraremos cómo escribir tus propias etiquetas en lenguaje sencillo.

Descubre las emociones de Eleven v4

Escucha el rango
ExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTired

Resumen

  • Las Audio Tags son señales en lenguaje natural entre corchetes que Eleven v4 interpreta como indicaciones de interpretación y que cambian cómo pronuncia las palabras que vienen después.
  • Eleven v4 es el modelo mejor clasificado en la Artificial Analysis Speech Arena [September 2026], y las Audio Tags te permiten dirigir esa interpretación línea a línea.
  • La rueda del rango emocional de Eleven v4 te permite escuchar distintas emociones para obtener una visión rápida de las capacidades del modelo.
  • Las etiquetas no se limitan a una lista fija, así que puedes crear las tuyas combinando cualidades, como [whispering, fearful], o describiendo la situación o el personaje detrás de una línea.
  • Las Audio Tags funcionan a través de ElevenAPI en Eleven v4, Eleven v4 Turbo y Eleven v3.

¿Qué son las Audio Tags de ElevenLabs?

Las Audio Tags son indicaciones en lenguaje natural que puedes incluir entre corchetes en tus textos. Eleven v4 las interpreta como marcadores de interpretación y las usa como instrucciones que cambian cómo pronuncia ciertas palabras o frases. Las escribes directamente en tu guion en la app de Texto a Voz de ElevenLabs y ves cómo nuestros modelos les dan vida.

Eleven v4 es el modelo TTS mejor clasificado en la Artificial Analysis Speech Arena, donde oyentes votan por el texto a voz que suena más natural.1 Las Audio Tags te permiten llevar esa interpretación aún más lejos, dirigiendo exactamente cómo se pronuncia cada línea.

Así puedes usar Audio Tags en un guion:

  • Coloca una etiqueta antes de las palabras a las que afecta: Cuando escribes «[shouts] No puedo creer que me hayas dicho eso», se grita toda la línea.
  • La emoción se mantiene: Cuando añades una etiqueta, su emoción se mantiene a lo largo de la línea, por lo que solo necesitas incluir otra cuando quieras cambiar la entonación. Por ejemplo: «[proud] Llevo más de una década cocinando. Sé cocer un huevo. [startled] ¿Qué es ese olor a quemado?»
  • Combina etiquetas para superponer indicaciones: Separa las Audio Tags con una coma dentro de los mismos corchetes, como [whispering, playful], para aportar matices a tu interpretación TTS.
  • Combina etiquetas con puntuación: Aunque las Audio Tags definen el tono y la entonación, puedes controlar el ritmo de forma natural usando puntuación en tu guion. Añade puntos suspensivos, guiones o mayúsculas para dar forma a la prosodia de una línea.

Para una explicación más detallada de cómo funcionan las etiquetas y cómo sustituyen a SSML, hemos preparado una guía completa sobre Audio Tags.

Text-to-speech leaderboard: Eleven v4 leads with 1319 Elo, ahead of Sonic 3.6. Take this further by selecting from the ElevenLabs Audio Tags list

Lista de Audio Tags de emociones

La rueda de emociones de Eleven v4 incluye decenas de emociones, interpretadas por v4 para que puedas escuchar la diferencia antes de escribir una sola etiqueta. 

Haz clic en cualquier emoción de abajo para escucharla en la rueda, o prueba directamente con la frase y la emoción para escuchar cómo Eleven v4 da vida a las Audio Tags emocionales.

Aunque aquí hemos mostrado unas cuantas emociones, puedes usar lenguaje natural para aplicar cualquier emoción que quieras. En el ejemplo de abajo, hemos usado varias Audio Tags que no aparecen arriba para mostrar lo que puedes hacer con indicaciones en lenguaje natural.

[jittery] Okay, final question of the pub quiz, and we're tied for first. [intrigued] "Which planet has the most moons?" Hmm. [smug] Easy. It's Saturn, everyone knows that. [puzzled] Wait, why is Priya shaking her head? [disgusted] Jupiter? You want to write down Jupiter? [frazzled] We only have ten seconds, just pick one, pick one! [hopeful] [nervous] Fine. Saturn. Hand it in. [long pause] [triumphant] YES! Saturn! We won! [mischievous] [slightly pause] Priya, I believe you owe me a drink.
0:00

Esta muestra cobró vida con Jonathan Livingston.

Lista de Audio Tags de entonación y volumen

Las etiquetas de entonación y volumen controlan lo alta o intensa que suena una línea, independientemente de la emoción que elijas añadirle. Si quieres que v4 siga una visión más específica, combina etiquetas de entonación y emoción para lograr un control más detallado.

Estos son algunos ejemplos:

  • [whispers] No te muevas, está justo detrás de ti.
  • [shouts] ¡Todo el mundo fuera del edificio, ya! 
  • [softly] Hiciste todo lo que pudiste. 
  • [quietly] Creo que se han ido. 
  • [low, threatening] No deberías haber venido.

Veamos el control de volumen y entonación en acción.

[hushed] Eighteenth hole. One putt to win the championship, and the crowd has gone completely silent. [barely audible] He's lining it up now. The ball is rolling... still rolling... [booming] IT'S IN! HE'S DONE IT! The championship is his, and this place has gone absolutely wild! [disbelief] Twenty years I've been calling golf, and I have never seen anything like that.
0:00

La muestra anterior cobró vida con Rod.

Lista de Audio Tags de ritmo

Las Audio Tags de ritmo cambian la velocidad de una línea. Añádelas para crear suspense o preparar el momento cómico perfecto. Cuando el ritmo importa tanto como las propias palabras, debes usar etiquetas de ritmo.

Como consejo extra, la puntuación ayuda de forma natural a la interpretación de texto a voz, así que combínalas para tener un control total de la frase: 

  • [slowly] Y el ganador es... 
  • [rushed] Perdón por llegar tarde, el tren se averió y vine corriendo todo el camino. 
  • [pause] Entonces sonó el teléfono. 
  • [drawn out] Nooo puede ser.
[slowly] Ten... nine... eight... seven... [rushed] Wait, wait, wait, hold the countdown, someone left their coffee on the console! [snappy] Can you get that out of here? [long pause] [drawn out] Okaaay, thank you. It's been moved. [excited] Resume the count! [speedy] Three... two... one... LIFTOFF!
0:00

Adam fue la voz que dio vida a esta muestra.

Lista de Audio Tags de reacciones humanas

Las etiquetas de reacción añaden a tus frases sonidos como risas, jadeos, llantos, toses y suspiros. Dan vida a tu texto y hacen que una muestra de audio TTS suene natural, como una persona hablando de forma improvisada en lugar de seguir un guion.

Estas son algunas Audio Tags de reacciones:

  • [laughs] ¿De verdad has caído en eso? 
  • [sighs] Vale. Yo lavo los platos. 
  • [gasps] ¿Es un diamante de verdad? 
  • [clears throat] Si pudiera tener la atención de todos. 
  • [crying] No pensé que volverías.

Eleven v4 también añade pequeños toques humanos cuando la emoción lo requiere. Escucha la rueda de emociones y oirás líneas como «T-tú has vuelto?» y «Uf, ¿esto es real?», donde v4 añadió por sí solo un tartamudeo o un gemido.

[clears throat] Hi, everyone. For those who don't know me, I'm the best man. [laughs] Well, I'm the only man Tom could find at short notice. [sighs] When Tom first told me about Adam, I thought, there's no way he’s real. [gasps] Sorry, is that the cake? It's enormous. Anyway. [starts crying] I've never seen him this happy. [laughs] Okay, I'm fine. I'm fine. To Tom and Adam!
0:00

Para usar esta voz en tus propias producciones, busca Jack John. 

Lista de Audio Tags de acentos y personajes

Crear escenas ricas con distintos acentos o voces de personajes es más fácil que nunca con Eleven v4. Con unas pocas Audio Tags, puedes transformar una voz en una nueva personalidad sin perder sus cualidades fundamentales. Una voz puede interpretar a todo un reparto en una sola generación.

  • [British accent] ¿Te apetece una taza de té?
  • [French accent] Bienvenido a mi pequeño café.
  • [Australian accent] No te preocupes, colega, lo arreglaremos.
  • [pirate voice] Izad las velas y pasad el ron.
Let's visit four stops in thirty seconds. First, London. [British accent] Mind the gap. Lovely weather we're having. [excited] Next, Dublin! [Irish accent] Grand day for it, isn't it? Sure, a bit of rain never hurt anyone. [rushed] No time, no time, on to Sydney! [Australian accent] G'day! Watch out for the seagulls, they'll nick your chips. [pirate voice] Arg, now the high seas, where the tour ends and the treasure begins!
0:00

Lauren ayudó a dar vida a esta muestra.

Lista de Audio Tags de efectos de sonido

Las Audio Tags de efectos de sonido introducen eventos no verbales directamente en tus generaciones. Por ejemplo, si estás creando una escena narrativa o una pista para un videojuego, puedes usarlas para dramatizarla sin necesidad de una pista de efectos independiente. Dicho esto, siempre puedes usar el generador de efectos de sonido con IA si buscas algo específico. 

  • [thunder rumbling] Se está acercando.
  • [footsteps] Alguien está subiendo las escaleras.
  • [door creaking] ¿Hola? ¿Hay alguien en casa?
  • [clapping] Gracias, gracias, sois demasiado amables.
[owl hooting] [nervous] Did you hear that? [gulp] It's just an owl, right? [twig snapping] [nervous] Okay, owls don't do that. [many footsteps] [scared] Something's walking around the tent. [zipper opening] [startled] Wait, who just opened the tent? [dog barking] [laughs] Biscuit! You scared me half to death. [sighs] Fine, you can sleep in here too.
0:00

La voz del clip anterior es Siren.

Escribe tus propias Audio Tags en lenguaje natural

Cualquiera de las Audio Tags que hemos mostrado arriba es un buen punto de partida. Pero la magia del TTS de ElevenLabs es que puedes escribir cualquier Audio Tag nueva en lenguaje natural para aportar al modelo contexto adicional que pueda utilizar. 

Como alternativa, si ninguna etiqueta de una sola palabra expresa lo que buscas, escribe una indicación más completa.

  • Combina emociones y cualidades: [tense, cautious] o [whispering, fearful]
  • Describe la manera: [like a sports commentator, speeding up]
  • Describe la situación: [out of breath after running up the stairs]
  • Describe el personaje: [a tired detective who has heard it all before]
  • Describe el cambio: [starting calm, then losing patience]
[hushed and reverent, like a nature documentary narrator] Here, in the quiet of the office kitchen, a rare creature emerges. [barely containing excitement] The intern. [slow and suspenseful] He approaches the last slice of birthday cake. He has been waiting for this moment all afternoon. [speeding up, like a sports commentator] He's going for it, he's reaching, he's almost there, he's- [sudden, crushed disappointment] Someone from accounts got there first. [hushed and reverent] Nature, as always, is cruel.
0:00

Da vida a tu escena con Spuds Oxley. 

Consejos para elegir Audio Tags 

Escribir en lenguaje natural te ofrece una gran flexibilidad al crear muestras de audio de texto a voz, pero también implica que conseguir el resultado perfecto puede requerir varios intentos.

Para que tu experiencia TTS con Eleven v4 sea lo más fluida posible, aquí tienes algunos consejos para trabajar con Audio Tags:

  • Escucha antes de escribir: Reproduce varias emociones en la rueda de emociones para escuchar cómo interpreta v4 cada una de ellas (o úsala como inspiración) y luego elige la que mejor encaje con tu línea.
  • Cambia la etiqueta antes de reescribir la línea: Si una entonación no funciona, prueba con una emoción cercana, como [let down] en vez de [despair], y vuelve a generar.
  • Usa una etiqueta por cláusula: Las etiquetas contradictorias aplicadas a las mismas palabras pueden difuminar la interpretación. Añade una nueva etiqueta en el punto donde quieras que cambie la emoción.
  • Da al modelo una escena completa: Eleven v4 funciona mejor con contexto. Con una ventana de hasta 10.000 caracteres por generación en la app de Texto a Voz, tienes espacio para crear indicaciones por capas que hagan magia en tu escena.
  • Empieza con un ajuste predefinido y luego concreta. Si [nervous] se acerca pero no es del todo correcto, escribe qué le falta: [nervous, trying to sound confident].

Pero, sobre todo, entrar en la app TTS de ElevenLabs y experimentar es la mejor forma de familiarizarte con ella y empezar a producir audio TTS de alta calidad.

Guide to six ElevenLabs audio tag list types and layering multiple cues with comma-separated tags.

Empieza a crear audio inmersivo con Eleven v4

No existe una lista definitiva de Audio Tags de ElevenLabs porque puedes crear cualquier combinación que quieras escribiendo en lenguaje natural. Todas las etiquetas de esta lista funcionan en Eleven v4, pero también funcionarán las que se te ocurran mientras escribes tu escena.

Elige una de las más de 17.500 voces de la Biblioteca de voces, pega tu guion y añade tu primera Audio Tag para empezar. 

Más información sobre Eleven v4 o regístrate para crear interpretaciones de audio impresionantes.

Preguntas frecuentes sobre las Audio Tags de ElevenLabs

  1. Artificial Analysis, Provider Voice Arena Preference Elo, 30 de septiembre de 2026

Artículos relacionados

Crea con el audio IA de la más alta calidad