Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Texto a Voz emocional: cómo dirigir interpretaciones de voces IA con Eleven v4

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

El texto a voz emocional (TTS) transforma un guion en una interpretación. En lugar de una lectura monótona, un modelo TTS expresivo transmite cada palabra con sentimiento y da vida a una escena con ira, alegría, tristeza, frustración y mucho más.

Al integrar Audio Tags en tu guion, das forma a la interpretación de texto a voz como lo haría un director. Añade [furious] para aumentar la intensidad de una frase, [sarcastic] para darle un toque de humor seco, o cualquier otra etiqueta para indicar al modelo cómo quieres que interprete una frase. 

Con Eleven v4, tienes un TTS emocional que puedes dirigir frase a frase. Así puedes crear guiones que den vida a tus textos.

¿Qué es el texto a voz emocional?

El texto a voz emocional es voz generada por IA que interpreta una frase en lugar de limitarse a leerla. Expresa emoción, entiende los tiempos y el ritmo, enfatiza las palabras adecuadas y añade sonidos no verbales como suspiros y risas.

Eleven v4 es un modelo revolucionario que transforma texto en una auténtica interpretación. Con descripciones integradas, una misma frase puede susurrarse, gritarse o pronunciarse entre lágrimas, según lo que imagines.

Tanto si escribes una campaña publicitaria para tu próximo lanzamiento como si das vida a los capítulos de tu novela, Eleven v4 te acompaña con el Texto a Voz de mayor calidad.

Cómo interpreta Eleven v4 la dirección emocional

Eleven v4 toma las indicaciones emocionales de las Audio Tags de tu guion y las convierte en una interpretación de audio natural.

Estas son algunas formas de añadir dirección emocional a un texto con Eleven v4 para mejorar el resultado final:

  • Audio Tags: Escribe Audio Tags en tus indicaciones, como [whispers] o [cries], para incluir instrucciones dentro de tu guion. Podrás crear escenas con profundidad emocional dirigiendo v4 como dirigirías a cualquier intérprete de teatro.
  • Puntuación: Usa la puntuación para dar forma al ritmo y la entonación junto con tus Audio Tags. Los puntos suspensivos ralentizan una frase, los guiones interrumpen al hablante a mitad de frase y los signos de exclamación añaden intensidad, ofreciéndote otra capa de dirección sin añadir una etiqueta.
  • Continuidad emocional: Empieza una frase con una emoción y Eleven v4 mantendrá ese tono durante toda la frase. Crea tus escenas de forma iterativa y desarrolla guiones ricos y contextuales con Audio Tags en v4.

Para mostrar lo eficaces que son las Audio Tags al dar vida al texto con v4, veamos como ejemplo la diferencia entre audio con etiquetas y sin ellas.

En esta primera muestra, solo usamos una frase predeterminada. Como referencia, usamos Siren en estos ejemplos.

Párrafo narrativo sin Audio Tags en Eleven v4

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

Este segundo ejemplo contiene la misma frase, pero con Audio Tags añadidas. Incluye indicaciones emocionales, efectos de sonido e incluso sonidos que van más allá del texto, como una risa malvada.

Párrafo narrativo con Audio Tags en Eleven v4

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Cinco interpretaciones de texto a voz emocional con Eleven v4

La mejor forma de mostrar todo el potencial de Eleven v4 es probarlo tú mismo. Al crear una cuenta, podrás empezar a usar Eleven v4 en cuestión de minutos.

Para mostrarte brevemente lo que es posible con este modelo de Texto a Voz expresivo, aquí tienes una misma frase generada cinco veces. Cada una tiene una indicación escénica distinta, que muestra exactamente lo que puedes hacer con el modelo.

Las cinco tarjetas siguientes usan como texto «No creía que fueras a volver de verdad», modificado con una Audio Tag cargada de emoción. Como referencia, estos ejemplos también usan Siren.

Añadir [furious]

Las consonantes se endurecen y las oclusivas se hacen más marcadas. La frase suena enfadada y se percibe como una acusación.

[furious]

[furious] I didn't think you'd actually come back
0:00

Añadir [excited]

El tono sube y el ritmo se acelera, transformando la misma frase en una bienvenida alegre.

[excited]

[excited] I didn't think you'd actually come back.
0:00

Añadir [sarcastic] 

El tono se aplana y las vocales de las palabras se alargan. El sarcasmo es un gran uso de las Audio Tags, ya que el tono contradice directamente las palabras escritas.

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

Añadir [crying]

Esta te hará llorar. La entonación se ralentiza y se quiebra a mitad de frase. Notarás que la respiración juega un papel muy importante aquí.

[crying]

[crying] I didn't think you'd actually come back.
0:00

Añadir [worried]

Más baja y ligeramente vacilante, [worried] le quita seguridad a la frase.

[worried] I didn't think you'd actually come back.
0:00

Consejos para escribir guiones que la IA pueda interpretar

Hemos creado la app de Texto a Voz de ElevenLabs para que sea lo más intuitiva posible. Entra en la página y empieza a escribir, o añade Audio Tags descriptivas para integrar sonidos o emociones específicos en tu escena

Aquí tienes algunos consejos más para obtener los mejores resultados con el Texto a Voz emocional de Eleven v4:

  1. Perfecciona tus indicaciones: Si una frase no funciona, cambia la etiqueta en lugar de reescribir el texto. Prueba [worried] en vez de [sad], o [sarcastic] en vez de [annoyed], y vuelve a generar el audio hasta que la entonación coincida con lo que tenías en mente.
  2. Genera escenas completas de una vez: Aunque las frases aisladas pueden dar lugar a una interpretación matizada (como hemos mostrado antes), Eleven v4 funciona mejor con párrafos o pasajes de texto. Dar al modelo suficiente texto para establecer el contexto de una escena ayudará a mejorar la interpretación en todo el pasaje. Con Eleven v4, puedes escribir hasta 10.000 caracteres por generación en la app de TTS.
  3. Usa una emoción por frase: Aunque puedes combinar varias Audio Tags a lo largo de una frase, es mejor usar una para cada segmento de la oración y así evitar confusiones. Añadir emociones contrapuestas como indicaciones puede producir un resultado menos preciso. También puedes añadir una etiqueta antes de la cláusula exacta que quieras y otra después si quieres cambiar la emoción a mitad de frase. 

Con estos consejos, transformarás tu texto en una interpretación en muy poco tiempo.

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

Empieza con Eleven v4 para crear texto a voz emocional

Todo lo que has visto en este artículo se ha generado en la app de Texto a Voz de ElevenLabs con un guion, una voz y unas cuantas Audio Tags en Eleven v4.

Para crear tus propias escenas, solo tienes que seleccionar una voz, pegar una frase que hayas escrito y dirigir tu primera interpretación.

Descubre más sobre Eleven v4 o regístrate para empezar con tu primera generación.

Preguntas frecuentes sobre la IA de texto a voz emocional

Artículos relacionados

Crea con el audio IA de la más alta calidad