¿Qué son las Audio Tags? La guía completa del TTS emocional
- Escrito por
- Jack Limebear
- Publicado
- Última actualización
Los Audio Tags son indicaciones entre corchetes y en lenguaje natural, como [laughs], [gasps], [excited] y [worried], que Eleven v3 interpreta como indicaciones de interpretación en lugar de palabras que debe pronunciar. Al escribir un guion para un modelo de Texto a Voz, insertar estos Audio Tags te da un control preciso sobre la expresión emocional de tu texto.
Eleven v3 estuvo disponible públicamente en marzo de 2026. Antes de v3, conseguir una interpretación emocional concreta de un modelo de Texto a Voz implicaba regenerar contenido y esperar lo mejor. Los Audio Tags eliminan esa incertidumbre y te dan control total sobre una interpretación emocional de texto a voz.
Esta guía explica qué son los Audio Tags, cómo funcionan, todas las categorías de tags disponibles y cómo se comparan con SSML (Speech Synthesis Markup Language). También veremos casos de uso habituales, cada uno con su propia guía detallada.
Resumen
- Los Audio Tags son indicaciones entre corchetes como [shouts] o [excited] que dirigen la emoción, el ritmo, la entonación y el tono del TTS en Eleven v3.
- Eleven v3 no admite SSML, pero lo sustituye por Audio Tags para ofrecer una experiencia de escritura más natural.
- Los tags abarcan distintas categorías, como emociones, entonación y ritmo, reacciones humanas, acentos y efectos de sonido.
- La puntuación y el uso de mayúsculas en el texto te permiten definir el ritmo de la interpretación de una voz IA.
- Puedes acceder a los Audio Tags de ElevenLabs desde la interfaz o mediante la API.
¿Cómo funcionan los Audio Tags?
Los Audio Tags se integran en la transcripción y van entre corchetes. Siempre que quieras cambiar la entonación, por ejemplo, de normal a [worried], solo tienes que añadir un audio tag.
También puedes usar más de un tag en una sola frase y combinarlos para crear una interpretación con más matices, por ejemplo: [tired] Ha sido un día muy largo… [upset] ¿Cuántos días más podré aguantar?
La arquitectura de Eleven v3 permite al modelo interpretar el contexto con mayor profundidad que los modelos anteriores, por lo que puede seguir indicaciones emocionales, cambios de tono, transiciones entre hablantes y pistas de contexto sin necesidad de un parámetro o ajuste independiente. Solo tienes que decirle al modelo qué requiere el momento y reproducirá la línea tal y como la habías planeado.
Eleven v3 también gestiona diálogos entre varios hablantes que suenan espontáneos, con interrupciones, cambios de humor y el intercambio natural de una conversación real, todo a partir de los tags y la estructura del guion.
Audio Tags frente a SSML
Si has trabajado con otros sistemas de TTS, seguramente te hayas encontrado con Speech Synthesis Markup Language. Plataformas como Amazon Polly y Microsoft Azure Speech usan tags de SSML como <break> o <emphasis> para aportar contexto adicional a un guion de TTS.
Eleven v3 no admite los tags de pausa de SSML ni el resto de tags de SSML. En su lugar, Audio Tags, la puntuación y la propia estructura del texto asumen esa función, al tiempo que ofrecen un control preciso sobre la entonación.
Puedes usar la tabla siguiente para relacionar los tags de SSML más comunes con su equivalente en Eleven v3.
Desde la perspectiva de quien escribe, añadir [whispers] a una línea requiere mucho menos esfuerzo que configurar una velocidad de prosodia.
Las categorías de Audio Tags en v3: dirige la interpretación con Audio Tags
Puedes colocar Audio Tags en cualquier parte del guion para definir la entonación en tiempo real. También puedes combinar tags en un guion o incluso dentro de una misma frase.
Los tags se agrupan en las siguientes categorías principales.
Emociones
Estos tags te ayudan a establecer el tono emocional de la voz, ya sea sombrío, intenso o animado. Por ejemplo, puedes usar uno o combinar [sad], [angry], [happily] y [sorrowful].
Entonación y ritmo
Estos tags se centran más en el tono y la interpretación. Puedes usarlos para ajustar el volumen y la energía en escenas que requieren contención o fuerza. Algunos ejemplos son [whispers], [shouts] y [softly].
Reacciones humanas
El habla realmente natural incluye reacciones. Por ejemplo, puedes añadir realismo incorporando al habla momentos naturales y no guionizados. Tags como [laughs], [clears throat] y [sighs] ayudan a crear un modelo de TTS capaz de transmitir emoción humana.
Otros ejemplos de categorías de audio tags son:
- Acentos y voces de personajes: Los tags de acento cambian la voz a una región o personaje concretos sin cambiar de modelo, como [French accent], [British accent] o [pirate voice]. Úsalos para convertir una sola voz en un reparto flexible en lugar de una interpretación fija.
- Efectos de sonido: Los tags de efectos de sonido añaden audio no verbal directamente a la generación, como [gunshot], [explosion] y [clapping]. Funcionan muy bien para audio inmersivo, juegos y narraciones dramatizadas en las que la escena necesita más que una voz. También puedes usar el generador de efectos de sonido con IA ElevenCreative.
Aunque los tags te ofrecen un gran nivel de control, también puedes usar la puntuación para definir el ritmo y el énfasis. Por ejemplo, añade puntos suspensivos para una pausa natural o usa comas para crear patrones de respiración naturales. Prueba a escribir una palabra totalmente en mayúsculas para añadir énfasis: «Lo quiero AHORA MISMO».
¿Qué puedes hacer con los Audio Tags?
Los Audio Tags desbloquean la complejidad emocional de los guiones de forma intuitiva. Escribe con naturalidad y añade tags sobre la marcha.
Aquí tienes una breve muestra de algunos casos de uso de TTS emocional con Audio Tags.
Conciencia situacional en audio creado con IA
Tags como [whisper] o [shouting] permiten a Eleven v3 reaccionar al momento. Desde suavizar una advertencia hasta mantener una pausa prolongada para crear suspense, puedes incorporar conciencia situacional dinámica a tu guion.
Para ver un análisis completo, consulta nuestra guía sobre conciencia situacional en audio creado con IA.
Dirigir la interpretación de personajes en el habla
Al crear un guion con varios personajes, querrás mostrar claramente en qué se diferencia cada voz. Desde ajustar su personalidad con [sarcastically] hasta definir cómo hablan con [British accent], puedes transmitir toda una gama de emociones con nuestro motor de TTS.
Descubre más detalles sobre cómo dirigir la interpretación de personajes en el habla creada con IA.
Expresar el contexto emocional en el habla
Los Audio Tags te permiten definir la expresión emocional de una línea a medida que avanza. Puedes desarrollar las emociones a lo largo de un discurso hasta alcanzar un clímax en el momento en que imaginas a tu personaje en su máximo potencial. Tags como [awe], [booming] y [big laugh] ayudan a incorporar toda una gama emocional a la interpretación de tu voz IA.
Lee más sobre cómo usar el contexto emocional en el habla creada con IA.
Dar vida a diálogos entre varios personajes
Al crear interpretaciones de diálogos entre varios personajes, puedes comenzar cada línea con un audio tag para desarrollar conversaciones ricas entre personajes.
Toma el siguiente ejemplo: Tom: [coughing] [beginning to speak] perdona, hoy estoy un poco enfermo— Emma: [interrupting] —¿Enfermo? ¡Sabes cuánto odio que tosas, Tom! Tom: [surprised] Solo es un poco de tos, no es nada grave. ¿Cómo te sentirías si— Emma: [overlapping] [annoyed] —Creo que tienes que irte a casa.
Descubre qué más puedes hacer con diálogos entre varios personajes en Eleven v3.
Control preciso de la entonación para el habla creada con IA
Puedes controlar el ritmo del habla con Eleven v3 mediante Audio Tags o puntuación. Tags como [pause], [rushed] o [drawn out] te permiten dar forma a la línea con precisión. También puedes añadir puntos suspensivos, puntos y signos de exclamación para integrar emoción de forma natural en tu interpretación de TTS.
Hemos escrito una guía detallada sobre el control preciso de la entonación en Eleven v3.
El TTS emocional está disponible en la API
Los Audio Tags funcionan igual a través de la API de Texto a Voz que en la interfaz de ElevenLabs. Escribe el tag integrado en el texto del guion y la API devolverá la interpretación etiquetada en el audio generado, desde flujos de trabajo para audiolibros hasta locuciones publicitarias.
Obtén más información sobre Eleven v3 o contacta con ventas para empezar hoy.



