Ir al contenido

¿Qué son las etiquetas de audio? Guía completa para Texto a Voz emocional

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Las etiquetas de audio son indicaciones entre corchetes en lenguaje natural, como [laughs], [gasps], [excited] y [worried], que Eleven v3 interpreta como instrucciones de interpretación, no como palabras que debe pronunciar. Al escribir un guion para un modelo de texto a voz, incluir estas etiquetas de audio te permite controlar con precisión la expresión emocional de tu texto. 

Eleven v3 estuvo disponible públicamente en marzo de 2026. Antes de v3, conseguir una interpretación emocional concreta de un modelo de Texto a Voz implicaba regenerar contenido y esperar lo mejor. Las etiquetas de audio eliminan esa incertidumbre y te dan control total sobre una interpretación emocional de texto a voz.

Esta guía explica qué son las etiquetas de audio, cómo funcionan, todas las categorías disponibles y cómo se comparan con SSML (Speech Synthesis Markup Language). También veremos casos de uso habituales, cada uno con un enlace a su guía específica.

Resumen:

  • Las etiquetas de audio son indicaciones entre corchetes, como [shouts] o [excited], que dirigen la emoción, el ritmo, la entonación y el tono en TTS con Eleven v3.
  • Eleven v3 no admite SSML, pero lo sustituye por etiquetas de audio para que la experiencia de escritura sea más natural.
  • Las etiquetas abarcan varias categorías, como emociones, entonación y ritmo, reacciones humanas, acentos y efectos de sonido.
  • La puntuación y las mayúsculas de tu texto te permiten dar forma al ritmo de una interpretación de voz IA.
  • Puedes acceder a las etiquetas de audio en ElevenLabs desde la interfaz o a través de la API.

¿Cómo funcionan las etiquetas de audio?

Las etiquetas de audio se insertan en el texto de tu transcripción y se escriben entre corchetes. Siempre que quieras cambiar la entonación, por ejemplo de normal a [worried], solo tienes que añadir una etiqueta de audio.

También puedes usar más de una etiqueta en una misma frase y combinarlas para lograr una interpretación con más matices, como [tired] Ha sido un día largo… [upset] ¿Cuántos días más podré aguantar?

La arquitectura de Eleven v3 permite al modelo interpretar el contexto a un nivel más profundo que los modelos anteriores, por lo que puede seguir indicaciones emocionales, cambios de tono, transiciones entre hablantes y pistas contextuales sin necesidad de un parámetro o ajuste independiente. Solo tienes que indicarle al modelo qué requiere el momento y reproducirá la frase exactamente como la habías imaginado.

Eleven v3 también gestiona diálogos entre varios hablantes que suenan espontáneos, con interrupciones, cambios de ánimo y el intercambio natural de una conversación real, todo a partir de las etiquetas y la estructura del guion. 

Etiquetas de audio frente a SSML

Si has trabajado con otros sistemas TTS, seguramente conoces Speech Synthesis Markup Language. Plataformas como Amazon Polly y Microsoft Azure Speech usan etiquetas SSML como <break> o <emphasis> para aportar contexto adicional a un guion TTS. 

Eleven v3 no admite las etiquetas de pausa de SSML ni el resto de etiquetas SSML. En su lugar, las etiquetas de audio, la puntuación y la propia estructura del texto asumen esa función y ofrecen un control preciso de la entonación.

Puedes usar la tabla siguiente para relacionar las etiquetas SSML habituales con su equivalente en Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Desde la perspectiva de quien escribe, añadir [whispers] a una frase requiere mucho menos esfuerzo que configurar una velocidad de prosodia.

Las categorías de etiquetas de audio en v3: dirige la interpretación con etiquetas de audio

Puedes colocar etiquetas de audio en cualquier parte del guion para dar forma a la entonación en tiempo real. También puedes combinar etiquetas dentro de un guion o incluso en una misma frase.

Las etiquetas se agrupan en las siguientes categorías principales.

Emociones

Estas etiquetas te ayudan a definir el tono emocional de la voz, ya sea sombrío, intenso o alegre. Por ejemplo, puedes usar una o combinar [sad], [angry], [happily] y [sorrowful].

Background
Background

Entonación y ritmo

Estas se centran más en el tono y la interpretación. Puedes usar estas etiquetas para ajustar el volumen y la energía en escenas que requieren contención o intensidad. Algunos ejemplos son [whispers], [shouts] y [softly].

Background
Background

Reacciones humanas

El habla natural de verdad incluye reacciones. Por ejemplo, puedes añadir realismo incorporando al habla momentos naturales y no guionizados. Etiquetas como [laughs], [clears throat] y [sighs] ayudan a crear un modelo TTS capaz de transmitir emoción humana.

Otros ejemplos de categorías de etiquetas de audio son:

  • Acentos y voces de personajes: Las etiquetas de acento cambian la voz a una región o personaje concretos sin cambiar de modelo, como [French accent], [British accent] o [pirate voice]. Úsalas para convertir una sola voz en un reparto flexible, en lugar de una interpretación fija.
  • Efectos de sonido: Las etiquetas de efectos de sonido añaden audio no verbal directamente a la generación, como [gunshot], [explosion] y [clapping]. Funcionan muy bien en audio inmersivo, juegos y narraciones dramatizadas en las que la escena necesita más que una voz. Como alternativa, usa el generador de efectos de sonido con IA ElevenCreative.

Aunque las etiquetas te ofrecen un alto grado de control, también puedes usar la puntuación para definir el ritmo y el énfasis. Por ejemplo, añade puntos suspensivos para una pausa natural o usa comas para crear patrones de respiración naturales. Prueba a escribir una palabra en mayúsculas para darle énfasis: «Lo quiero AHORA mismo».

Background
Background

¿Qué puedes hacer con las etiquetas de audio?

Las etiquetas de audio desbloquean la complejidad emocional de los guiones de forma intuitiva. Escribe con naturalidad y añade etiquetas sobre la marcha.

Aquí tienes un vistazo rápido a algunos casos de uso de TTS emocional con etiquetas de audio.

Conciencia situacional en audio creado con IA

Etiquetas como [whisper] o [shouting] permiten a Eleven v3 reaccionar al momento. Desde suavizar una advertencia hasta mantener una pausa prolongada para crear suspense, puedes incorporar conciencia situacional dinámica a tu guion.

Para verlo en detalle, consulta nuestra guía sobre conciencia situacional en audio creado con IA.

Dirigir la interpretación de personajes en el habla

Al desarrollar un guion con varios personajes, querrás mostrar claramente qué diferencia a cada voz. Desde ajustar su personalidad con [sarcastically] hasta definir cómo hablan con [British accent], puedes plasmar toda una gama de emociones con nuestro motor TTS.

Descubre más sobre cómo dirigir la interpretación de personajes en habla creada con IA.

Expresar el contexto emocional en el habla

Las etiquetas de audio te permiten dar forma a la expresión emocional de una frase a medida que avanza. Puedes desarrollar emociones a lo largo de un discurso y alcanzar un clímax justo en el momento en que imaginas que tu personaje despliega todo su potencial. Etiquetas como [awe], [booming] y [big laugh] ayudan a incorporar toda una gama emocional a la interpretación de tu voz IA.

Lee más sobre cómo usar el contexto emocional en habla creada con IA

Dar vida a diálogos entre varios personajes

Al crear interpretaciones de diálogos entre varios personajes, puedes empezar cada frase con una etiqueta de audio para construir conversaciones ricas entre personajes. 

Toma el siguiente ejemplo: Tom: [coughing] [beginning to speak] perdona, hoy estoy un poco enfermo— Emma: [interrupting] —¿Enfermo? ¡Sabes cuánto odio que tosas, Tom! Tom: [surprised] Es solo un poco de tos, no es nada grave. ¿Cómo te sentirías si— Emma: [overlapping] [annoyed] —Creo que tienes que irte a casa. 

Descubre qué más puedes hacer con diálogos entre varios personajes en Eleven v3.

Control preciso de la entonación para habla creada con IA

Puedes controlar el ritmo del habla en Eleven v3 con etiquetas de audio o mediante la puntuación. Etiquetas como [pause], [rushed] o [drawn out] te permiten dar forma a la frase con precisión. Como alternativa, añade puntos suspensivos, puntos y signos de exclamación para incorporar emoción de forma natural a tu interpretación TTS.

Hemos escrito una guía en profundidad sobre el control preciso de la entonación en Eleven v3.

El TTS emocional está disponible en la API

Las etiquetas de audio funcionan igual a través de la API de Texto a Voz que en la interfaz de ElevenLabs. Escribe la etiqueta integrada en el texto del guion y la API devolverá la interpretación etiquetada en el audio generado, desde flujos de trabajo de audiolibros hasta locuciones publicitarias. 

Descubre más sobre Eleven v3 o contacta con ventas para empezar hoy mismo.

Preguntas frecuentes sobre las etiquetas de audio y el TTS emocional

Artículos relacionados

Crea con el audio IA de la más alta calidad