¿Qué son las etiquetas de audio? Guía completa para Texto a Voz emocional
- Escrito por
- Jack Limebear
- Publicado
- Última actualización
Las etiquetas de audio son indicaciones entre corchetes en lenguaje natural, como [laughs], [gasps], [excited] y [worried], que Eleven v3 interpreta como instrucciones de interpretación, no como palabras que debe pronunciar. Al escribir un guion para un modelo de texto a voz, incluir estas etiquetas de audio te permite controlar con precisión la expresión emocional de tu texto.
Eleven v3 estuvo disponible públicamente en marzo de 2026. Antes de v3, conseguir una interpretación emocional concreta de un modelo de Texto a Voz implicaba regenerar contenido y esperar lo mejor. Las etiquetas de audio eliminan esa incertidumbre y te dan control total sobre una interpretación emocional de texto a voz.
Esta guía explica qué son las etiquetas de audio, cómo funcionan, todas las categorías disponibles y cómo se comparan con SSML (Speech Synthesis Markup Language). También veremos casos de uso habituales, cada uno con un enlace a su guía específica.
Resumen:
- Las etiquetas de audio son indicaciones entre corchetes, como [shouts] o [excited], que dirigen la emoción, el ritmo, la entonación y el tono en TTS con Eleven v3.
- Eleven v3 no admite SSML, pero lo sustituye por etiquetas de audio para que la experiencia de escritura sea más natural.
- Las etiquetas abarcan varias categorías, como emociones, entonación y ritmo, reacciones humanas, acentos y efectos de sonido.
- La puntuación y las mayúsculas de tu texto te permiten dar forma al ritmo de una interpretación de voz IA.
- Puedes acceder a las etiquetas de audio en ElevenLabs desde la interfaz o a través de la API.
¿Cómo funcionan las etiquetas de audio?
Las etiquetas de audio se insertan en el texto de tu transcripción y se escriben entre corchetes. Siempre que quieras cambiar la entonación, por ejemplo de normal a [worried], solo tienes que añadir una etiqueta de audio.
También puedes usar más de una etiqueta en una misma frase y combinarlas para lograr una interpretación con más matices, como [tired] Ha sido un día largo… [upset] ¿Cuántos días más podré aguantar?
La arquitectura de Eleven v3 permite al modelo interpretar el contexto a un nivel más profundo que los modelos anteriores, por lo que puede seguir indicaciones emocionales, cambios de tono, transiciones entre hablantes y pistas contextuales sin necesidad de un parámetro o ajuste independiente. Solo tienes que indicarle al modelo qué requiere el momento y reproducirá la frase exactamente como la habías imaginado.
Eleven v3 también gestiona diálogos entre varios hablantes que suenan espontáneos, con interrupciones, cambios de ánimo y el intercambio natural de una conversación real, todo a partir de las etiquetas y la estructura del guion.
Etiquetas de audio frente a SSML
Si has trabajado con otros sistemas TTS, seguramente conoces Speech Synthesis Markup Language. Plataformas como Amazon Polly y Microsoft Azure Speech usan etiquetas SSML como <break> o <emphasis> para aportar contexto adicional a un guion TTS.
Eleven v3 no admite las etiquetas de pausa de SSML ni el resto de etiquetas SSML. En su lugar, las etiquetas de audio, la puntuación y la propia estructura del texto asumen esa función y ofrecen un control preciso de la entonación.
Puedes usar la tabla siguiente para relacionar las etiquetas SSML habituales con su equivalente en Eleven v3.
Desde la perspectiva de quien escribe, añadir [whispers] a una frase requiere mucho menos esfuerzo que configurar una velocidad de prosodia.
Las categorías de etiquetas de audio en v3: dirige la interpretación con etiquetas de audio
Puedes colocar etiquetas de audio en cualquier parte del guion para dar forma a la entonación en tiempo real. También puedes combinar etiquetas dentro de un guion o incluso en una misma frase.
Las etiquetas se agrupan en las siguientes categorías principales.
Emociones
Estas etiquetas te ayudan a definir el tono emocional de la voz, ya sea sombrío, intenso o alegre. Por ejemplo, puedes usar una o combinar [sad], [angry], [happily] y [sorrowful].
Entonación y ritmo
Estas se centran más en el tono y la interpretación. Puedes usar estas etiquetas para ajustar el volumen y la energía en escenas que requieren contención o intensidad. Algunos ejemplos son [whispers], [shouts] y [softly].
Reacciones humanas
El habla natural de verdad incluye reacciones. Por ejemplo, puedes añadir realismo incorporando al habla momentos naturales y no guionizados. Etiquetas como [laughs], [clears throat] y [sighs] ayudan a crear un modelo TTS capaz de transmitir emoción humana.
Otros ejemplos de categorías de etiquetas de audio son:
- Acentos y voces de personajes: Las etiquetas de acento cambian la voz a una región o personaje concretos sin cambiar de modelo, como [French accent], [British accent] o [pirate voice]. Úsalas para convertir una sola voz en un reparto flexible, en lugar de una interpretación fija.
- Efectos de sonido: Las etiquetas de efectos de sonido añaden audio no verbal directamente a la generación, como [gunshot], [explosion] y [clapping]. Funcionan muy bien en audio inmersivo, juegos y narraciones dramatizadas en las que la escena necesita más que una voz. Como alternativa, usa el generador de efectos de sonido con IA ElevenCreative.
Aunque las etiquetas te ofrecen un alto grado de control, también puedes usar la puntuación para definir el ritmo y el énfasis. Por ejemplo, añade puntos suspensivos para una pausa natural o usa comas para crear patrones de respiración naturales. Prueba a escribir una palabra en mayúsculas para darle énfasis: «Lo quiero AHORA mismo».
¿Qué puedes hacer con las etiquetas de audio?
Las etiquetas de audio desbloquean la complejidad emocional de los guiones de forma intuitiva. Escribe con naturalidad y añade etiquetas sobre la marcha.
Aquí tienes un vistazo rápido a algunos casos de uso de TTS emocional con etiquetas de audio.
Conciencia situacional en audio creado con IA
Etiquetas como [whisper] o [shouting] permiten a Eleven v3 reaccionar al momento. Desde suavizar una advertencia hasta mantener una pausa prolongada para crear suspense, puedes incorporar conciencia situacional dinámica a tu guion.
Para verlo en detalle, consulta nuestra guía sobre conciencia situacional en audio creado con IA.
Dirigir la interpretación de personajes en el habla
Al desarrollar un guion con varios personajes, querrás mostrar claramente qué diferencia a cada voz. Desde ajustar su personalidad con [sarcastically] hasta definir cómo hablan con [British accent], puedes plasmar toda una gama de emociones con nuestro motor TTS.
Descubre más sobre cómo dirigir la interpretación de personajes en habla creada con IA.
Expresar el contexto emocional en el habla
Las etiquetas de audio te permiten dar forma a la expresión emocional de una frase a medida que avanza. Puedes desarrollar emociones a lo largo de un discurso y alcanzar un clímax justo en el momento en que imaginas que tu personaje despliega todo su potencial. Etiquetas como [awe], [booming] y [big laugh] ayudan a incorporar toda una gama emocional a la interpretación de tu voz IA.
Lee más sobre cómo usar el contexto emocional en habla creada con IA.
Dar vida a diálogos entre varios personajes
Al crear interpretaciones de diálogos entre varios personajes, puedes empezar cada frase con una etiqueta de audio para construir conversaciones ricas entre personajes.
Toma el siguiente ejemplo: Tom: [coughing] [beginning to speak] perdona, hoy estoy un poco enfermo— Emma: [interrupting] —¿Enfermo? ¡Sabes cuánto odio que tosas, Tom! Tom: [surprised] Es solo un poco de tos, no es nada grave. ¿Cómo te sentirías si— Emma: [overlapping] [annoyed] —Creo que tienes que irte a casa.
Descubre qué más puedes hacer con diálogos entre varios personajes en Eleven v3.
Control preciso de la entonación para habla creada con IA
Puedes controlar el ritmo del habla en Eleven v3 con etiquetas de audio o mediante la puntuación. Etiquetas como [pause], [rushed] o [drawn out] te permiten dar forma a la frase con precisión. Como alternativa, añade puntos suspensivos, puntos y signos de exclamación para incorporar emoción de forma natural a tu interpretación TTS.
Hemos escrito una guía en profundidad sobre el control preciso de la entonación en Eleven v3.
El TTS emocional está disponible en la API
Las etiquetas de audio funcionan igual a través de la API de Texto a Voz que en la interfaz de ElevenLabs. Escribe la etiqueta integrada en el texto del guion y la API devolverá la interpretación etiquetada en el audio generado, desde flujos de trabajo de audiolibros hasta locuciones publicitarias.
Descubre más sobre Eleven v3 o contacta con ventas para empezar hoy mismo.










