Buenas prácticas

Aprende a controlar la entonación, la pronunciación y la emoción, y a optimizar texto para voz.

Esta guía ofrece técnicas para mejorar los resultados de texto a voz con modelos de ElevenLabs. Experimenta con estos métodos para descubrir cuáles se adaptan mejor a tus necesidades.

Controles

Estamos trabajando activamente en el Modo de dirección para darte aún más control sobre los resultados.

Estas técnicas ofrecen una forma práctica de conseguir resultados matizados hasta que se implementen funciones avanzadas como el Modo de dirección.

Pausas

Eleven v4 y Eleven v3 no admiten etiquetas de pausa SSML. Usa las técnicas descritas en la sección Prompting de Eleven v4 para controlar las pausas.

Usa <break time="x.xs" /> para pausas naturales de hasta 3 segundos.

Usar demasiadas etiquetas de pausa en una sola generación puede causar inestabilidad. La IA podría acelerar o introducir ruidos adicionales o artefactos de audio. Estamos trabajando para resolverlo.

Ejemplo
"Hold on, let me think." <break time="1.5s" /> "Alright, I've got it."
  • Coherencia: Usa las etiquetas <break> de forma coherente para mantener un flujo de voz natural. Un uso excesivo puede provocar inestabilidad.
  • Comportamiento específico de cada voz: Las distintas voces pueden gestionar las pausas de forma diferente, especialmente las entrenadas con sonidos de relleno como “uh” o “ah”.

Como alternativa a <break>, puedes usar guiones (- o —) para pausas cortas o puntos suspensivos (…) para tonos dubitativos. Sin embargo, son menos coherentes.

Ejemplo
"It… well, it might work." "Wait — what's that noise?"

Pronunciación

IPA con Eleven v4

Eleven v4 (eleven_v4) incluye una compatibilidad nativa mejorada con el Alfabeto Fonético Internacional, o IPA, que te ofrece un control más preciso de la pronunciación de nombres, términos técnicos y otras palabras que requieren un tratamiento especial. La pronunciación IPA es más coherente que en modelos anteriores, pero los resultados pueden variar según la voz y la frase. Te recomendamos probar las pronunciaciones importantes con la voz que hayas elegido antes de utilizarlas en producción.

A diferencia de los modelos antiguos, que requieren etiquetas de fonemas de estilo XML, Eleven v4 entiende los símbolos IPA cuando los incluyes entre barras inclinadas en el texto:

Sintaxis
"/IPA_transcription/"

La transcripción IPA debe:

  • Estar entre barras inclinadas (/) al principio y al final
  • Estar escrita con símbolos IPA estándar
  • Estar entre comillas dobles cuando se pase como parámetro de cadena

Ejemplos de código

from elevenlabs import ElevenLabs
client = ElevenLabs()
audio = client.text_to_speech.convert(
voice_id="21m00Tcm4TlvDq8ikWAM",
text='The term "/ˌbaɪoʊˈkemɪstri/" refers to the study of chemical processes.',
model_id="eleven_v4",
)

Puedes incluir varias transcripciones IPA en una sola cadena de texto:

from elevenlabs import ElevenLabs
client = ElevenLabs()
text = 'The medication "/ɡluːˈkoʊs/" and "/ˌɪnsjəˈlɪn/" are commonly used to manage conditions like "/ˌdaɪəˈbiːtiːz/".'
audio = client.text_to_speech.convert(
voice_id="21m00Tcm4TlvDq8ikWAM",
text=text,
model_id="eleven_v4",
)

Buenas prácticas

  • Usa símbolos IPA estándar de la tabla del Alfabeto Fonético Internacional
  • Incluye marcas de acento: acento principal (ˈ) y secundario (ˌ) para palabras de varias sílabas
  • Aplícalo de forma selectiva: incluye entre barras solo las palabras o frases concretas que requieran control de pronunciación
  • Pruébalo con tu voz: las distintas voces pueden interpretar el IPA de forma ligeramente diferente

Resolución de problemas

Comprueba que tu transcripción IPA sea correcta con un diccionario IPA. Incluye marcas de acento (ˈ para el acento principal, ˌ para el secundario) en palabras de varias sílabas. Prueba con distintas voces, ya que algunas pueden interpretar el IPA con más precisión que otras.

La pronunciación IPA es más coherente que en modelos anteriores, pero los resultados pueden seguir variando según la voz y la frase. Te recomendamos probar las pronunciaciones importantes con la voz que hayas elegido antes de utilizarlas en producción. Si necesitas un resultado coherente, genera más de una vez y selecciona el mejor resultado.

Etiquetas de fonemas para modelos v2

Especifica la pronunciación mediante etiquetas de fonemas SSML con los modelos v2. Los alfabetos compatibles incluyen CMU Arpabet y el Alfabeto Fonético Internacional (IPA).

Las etiquetas de fonemas solo son compatibles con el modelo eleven_flash_v2.

<phoneme alphabet="cmu-arpabet" ph="M AE1 D IH0 S AH0 N">
Madison
</phoneme>

Recomendamos usar CMU Arpabet para obtener resultados coherentes y predecibles con los modelos v2. Aunque IPA puede ser eficaz, CMU Arpabet suele ofrecer un rendimiento más fiable.

Las etiquetas de fonemas solo funcionan con palabras individuales. Si tienes un nombre y apellidos que quieres que se pronuncien de una forma determinada, tendrás que crear una etiqueta de fonema para cada palabra.

Asegúrate de marcar correctamente el acento en palabras de varias sílabas para mantener una pronunciación precisa:

<phoneme alphabet="cmu-arpabet" ph="P R AH0 N AH0 N S IY EY1 SH AH0 N">
pronunciation
</phoneme>

Etiquetas de alias

Para los modelos que no admiten etiquetas de fonemas, puedes probar a escribir las palabras de forma más fonética. También puedes emplear distintos trucos, como letras mayúsculas, guiones, apóstrofos o incluso comillas simples alrededor de una letra o varias letras.

Por ejemplo, una palabra como “trapezii” podría escribirse como “trapezIi” para dar más énfasis a la “ii” de la palabra.

Puedes sustituir la palabra directamente en el texto o, si quieres especificar la pronunciación mediante otras palabras o frases al usar un diccionario de pronunciación, puedes utilizar etiquetas de alias. Esto puede ser útil si generas con Multilingual v2, que no admite etiquetas de fonemas. Puedes usar diccionarios de pronunciación con ElevenCreative Studio, Doblaje IA y Síntesis de voz mediante la API.

Por ejemplo, si tu texto incluye un nombre con una pronunciación inusual que pueda resultar difícil para la IA, puedes utilizar una etiqueta de alias para especificar cómo quieres que se pronuncie:

<lexeme>
<grapheme>Claughton</grapheme>
<alias>Cloffton</alias>
</lexeme>

Si quieres asegurarte de que un acrónimo se pronuncie siempre de una forma determinada cada vez que aparezca en el texto, puedes utilizar una etiqueta de alias para especificarlo:

<lexeme>
<grapheme>UN</grapheme>
<alias>United Nations</alias>
</lexeme>

Diccionarios de pronunciación

Algunas de nuestras herramientas, como ElevenCreative Studio y Doblaje IA, te permiten crear y subir un diccionario de pronunciación. Con ellos puedes especificar la pronunciación de determinadas palabras, como nombres de personajes o marcas, o indicar cómo deben leerse los acrónimos.

Los diccionarios de pronunciación permiten esta funcionalidad al dejarte subir un archivo de léxico o diccionario que especifica pares de palabras y cómo deben pronunciarse, ya sea mediante un alfabeto fonético o sustituciones de palabras.

Cada vez que una de estas palabras aparezca en un proyecto, el modelo de IA pronunciará la palabra usando la sustitución especificada.

Para proporcionar un archivo de diccionario de pronunciación, abre los ajustes de un proyecto y sube un archivo en formato TXT o .PLS. Al añadir un diccionario a un proyecto, se recalcularán automáticamente las partes del proyecto que deben convertirse de nuevo con el nuevo archivo de diccionario y se marcarán como no convertidas.

Actualmente solo admitimos diccionarios de pronunciación que especifiquen sustituciones mediante etiquetas de fonemas o alias.

Tanto los fonemas como los alias son conjuntos de reglas que especifican una palabra o frase que buscan, denominada grafema, y con qué se sustituirá. Ten en cuenta que las búsquedas distinguen entre mayúsculas y minúsculas. Al buscar una palabra de sustitución en un diccionario de pronunciación, el diccionario se comprueba de principio a fin y solo se utiliza la primera sustitución.

Ejemplos de diccionarios de pronunciación

Aquí tienes ejemplos de diccionarios de pronunciación tanto en CMU Arpabet como en IPA, incluido un fonema para especificar la pronunciación de “Apple” y un alias para sustituir “UN” por “United Nations”:

<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="cmu-arpabet" xml:lang="en-GB">
<lexeme>
<grapheme>apple</grapheme>
<phoneme>AE P AH L</phoneme>
</lexeme>
<lexeme>
<grapheme>UN</grapheme>
<alias>United Nations</alias>
</lexeme>
</lexicon>

Para generar un archivo de diccionario de pronunciación .pls, hay disponibles varias herramientas de código abierto:

  • Sequitur G2P - Herramienta de código abierto que aprende reglas de pronunciación a partir de datos y puede generar transcripciones fonéticas.
  • Phonetisaurus - Sistema G2P de código abierto entrenado con diccionarios existentes como CMUdict.
  • eSpeak - Sintetizador de voz que puede generar transcripciones de fonemas a partir de texto.
  • CMU Pronouncing Dictionary - Diccionario de inglés predefinido con transcripciones fonéticas.

Emoción

Transmite emociones mediante el contexto narrativo o etiquetas de diálogo explícitas. Este enfoque ayuda a la IA a entender el tono y la emoción que debe reproducir.

Ejemplo
You're leaving?" she asked, her voice trembling with sadness. "That's it!" he exclaimed triumphantly.

Las etiquetas de diálogo explícitas ofrecen resultados más predecibles que depender únicamente del contexto; sin embargo, el modelo seguirá pronunciando en voz alta las indicaciones de entonación emocional. Si no las quieres, puedes eliminarlas en posproducción con un editor de audio.

Ritmo

El ritmo del audio depende en gran medida del audio utilizado para crear la voz. Al crear tu voz, recomendamos usar muestras más largas y continuas para evitar problemas de ritmo, como una voz demasiado rápida.

Para controlar la velocidad del audio generado, puedes utilizar el ajuste de velocidad. Te permite acelerar o ralentizar la voz generada. El ajuste de velocidad está disponible en Texto a Voz mediante el sitio web y la API, así como en ElevenCreative Studio y la Plataforma de Agentes. Lo encontrarás en los ajustes de voz.

El valor predeterminado es 1.0, lo que significa que la velocidad no se ajusta. Los valores inferiores a 1.0 ralentizan la voz, hasta un mínimo de 0.7. Los valores superiores a 1.0 aceleran la voz, hasta un máximo de 1.2. Los valores extremos pueden afectar a la calidad de la voz generada.

También puedes controlar el ritmo escribiendo con un estilo narrativo natural.

Ejemplo
"I… I thought you'd understand," he said, his voice slowing with disappointment.

Consejos

  • Pausas incoherentes: asegúrate de usar la sintaxis <break time=“x.xs” /> para las pausas.

  • Errores de pronunciación: usa etiquetas de fonemas CMU Arpabet o IPA para lograr una pronunciación precisa.
  • Emoción inadecuada: añade contexto narrativo o etiquetas explícitas para guiar la emoción. Recuerda eliminar cualquier texto de guía emocional en posproducción.

Experimenta con formulaciones alternativas para conseguir el ritmo o la emoción que buscas. Para efectos de sonido complejos, divide los prompts en elementos más pequeños y secuenciales, y combina los resultados manualmente.

Control creativo

Aunque estamos desarrollando activamente un “Modo de dirección” para dar a usuarios aún más control sobre los resultados, aquí tienes algunas técnicas provisionales para maximizar la creatividad y la precisión:

1

Estilo narrativo

Escribe los prompts con un estilo narrativo, similar al de un guion, para guiar eficazmente el tono y el ritmo.

2

Resultados por capas

Genera efectos de sonido o voz por segmentos y superponlos con software de edición de audio para crear composiciones más complejas.

3

Experimentación fonética

Si la pronunciación no es perfecta, experimenta con grafías alternativas o aproximaciones fonéticas para conseguir los resultados que buscas.

4

Ajustes manuales

Combina efectos de sonido individuales manualmente en posproducción para secuencias que requieran una sincronización precisa.

5

Iteración a partir de comentarios

Perfecciona los resultados ajustando descripciones, etiquetas o indicaciones emocionales.

Normalización de texto

Al usar Texto a Voz con elementos complejos como números de teléfono, códigos postales y correos electrónicos, es posible que se pronuncien mal. Esto suele deberse a que esos elementos concretos no estaban en el conjunto de entrenamiento y a que los modelos más pequeños no consiguen generalizar cómo deberían pronunciarse. Esta guía aclarará cuándo se producen estas discrepancias y cómo conseguir que se pronuncien correctamente.

La normalización está activada de forma predeterminada para todos los modelos de TTS, lo que ayuda a mejorar la pronunciación de números, fechas y otros elementos de texto complejos.

¿Por qué los modelos leen las entradas de forma distinta?

Algunos modelos están entrenados para leer números y frases de una forma más natural. Por ejemplo, el modelo Eleven Multilingual v2 lee correctamente la frase “$1,000,000” como “one million dollars”. Sin embargo, el modelo Eleven Flash v2.5 lee la misma frase como “one thousand thousand dollars”.

Esto se debe a que Multilingual v2 es un modelo más grande y puede generalizar mejor la lectura de números de una forma más natural para las personas, mientras que Flash v2.5 es un modelo mucho más pequeño y no puede hacerlo.

Ejemplos habituales

Los modelos de Texto a Voz pueden tener dificultades con lo siguiente:

  • Números de teléfono (“123-456-7890”)
  • Monedas (“$47,345.67”)
  • Eventos del calendario (“2024-01-01”)
  • Horas (“9:23 AM”)
  • Direcciones (“123 Main St, Anytown, USA”)
  • URL (“example.com/link/to/resource”)
  • Abreviaturas de unidades (“TB” en lugar de “Terabyte”)
  • Atajos (“Ctrl + Z”)

Solución

Usa modelos entrenados

La forma más sencilla de mitigarlo es usar un modelo de TTS entrenado para leer números y frases de una forma más natural, como Eleven Multilingual v2. Sin embargo, no siempre será posible, por ejemplo, si tienes un caso de uso en el que la baja latencia es fundamental (como agentes conversacionales).

Aplica normalización en los prompts de LLM

Si usas un LLM para generar el texto de TTS, puedes añadir instrucciones de normalización al prompt.

1

Usa prompts claros y explícitos

Los LLM responden mejor a instrucciones estructuradas y explícitas. Tu prompt debe indicar claramente que quieres convertir el texto a un formato legible para voz.

2

Gestiona distintos formatos numéricos

No todos los números se leen de la misma forma. Ten en cuenta cómo deberían pronunciarse los distintos tipos de números:

  • Números cardinales: 123 → “one hundred twenty-three”
  • Números ordinales: 2nd → “second”
  • Valores monetarios: $45.67 → “forty-five dollars and sixty-seven cents”
  • Números de teléfono: “123-456-7890” → “one two three, four five six, seven eight nine zero”
  • Decimales y fracciones: “3.5” → “three point five”, “⅔” → “two-thirds”
  • Números romanos: “XIV” → “fourteen” (o “the fourteenth” si es un título)
3

Elimina o amplía abreviaturas

Las abreviaturas habituales deben ampliarse para aportar claridad:

  • “Dr.” → “Doctor”
  • “Ave.” → “Avenue”
  • “St.” → “Street” (pero “St. Patrick” debe mantenerse)

Puedes solicitar una ampliación explícita en tu prompt:

Amplía todas las abreviaturas a sus formas completas para la locución.

4

Normalización alfanumérica

No toda la normalización trata de números; algunas frases alfanuméricas también deben normalizarse para ganar claridad:

  • Atajos: “Ctrl + Z” → “control z”
  • Abreviaturas de unidades: “100km” → “one hundred kilometers”
  • Símbolos: “100%” → “one hundred percent”
  • URL: “elevenlabs.io/docs” → “eleven labs dot io slash docs”
  • Eventos del calendario: “2024-01-01” → “January first, two-thousand twenty-four”
5

Ten en cuenta los casos límite

Los distintos contextos pueden requerir conversiones diferentes:

  • Fechas: “01/02/2023” → “January second, twenty twenty-three” o “the first of February, twenty twenty-three” (según la configuración regional)
  • Hora: “14:30” → “two thirty PM”

Si necesitas un formato específico, indícalo explícitamente en el prompt.

Todo junto

Este prompt es un buen punto de partida para la mayoría de casos de uso:

Convert the output text into a format suitable for text-to-speech. Ensure that numbers, symbols, and abbreviations are expanded for clarity when read aloud. Expand all abbreviations to their full spoken forms.
Example input and output:
"$42.50" → "forty-two dollars and fifty cents"
"£1,001.32" → "one thousand and one pounds and thirty-two pence"
"1234" → "one thousand two hundred thirty-four"
"3.14" → "three point one four"
"555-555-5555" → "five five five, five five five, five five five five"
"2nd" → "second"
"XIV" → "fourteen" - unless it's a title, then it's "the fourteenth"
"3.5" → "three point five"
"⅔" → "two-thirds"
"Dr." → "Doctor"
"Ave." → "Avenue"
"St." → "Street" (but saints like "St. Patrick" should remain)
"Ctrl + Z" → "control z"
"100km" → "one hundred kilometers"
"100%" → "one hundred percent"
"elevenlabs.io/docs" → "eleven labs dot io slash docs"
"2024-01-01" → "January first, two-thousand twenty-four"
"123 Main St, Anytown, USA" → "one two three Main Street, Anytown, United States of America"
"14:30" → "two thirty PM"
"01/02/2023" → "January second, two-thousand twenty-three" or "the first of February, two-thousand twenty-three", depending on locale of the user

Usa expresiones regulares para el preprocesamiento

Si usas código para crear un prompt para un LLM, puedes usar expresiones regulares para normalizar el texto antes de proporcionárselo al modelo. Esta es una técnica más avanzada y requiere algunos conocimientos de expresiones regulares. Aquí tienes algunos ejemplos sencillos:

# Be sure to install the inflect library before running this code
import inflect
import re
# Initialize inflect engine for number-to-word conversion
p = inflect.engine()
def normalize_text(text: str) -> str:
# Convert monetary values
def money_replacer(match):
currency_map = {"$": "dollars", "£": "pounds", "€": "euros", "¥": "yen"}
currency_symbol, num = match.groups()
# Remove commas before parsing
num_without_commas = num.replace(',', '')
# Check for decimal points to handle cents
if '.' in num_without_commas:
dollars, cents = num_without_commas.split('.')
dollars_in_words = p.number_to_words(int(dollars))
cents_in_words = p.number_to_words(int(cents))
return f"{dollars_in_words} {currency_map.get(currency_symbol, 'currency')} and {cents_in_words} cents"
else:
# Handle whole numbers
num_in_words = p.number_to_words(int(num_without_commas))
return f"{num_in_words} {currency_map.get(currency_symbol, 'currency')}"
# Regex to handle commas and decimals
text = re.sub(r"([$£€¥])(\d+(?:,\d{3})*(?:\.\d{2})?)", money_replacer, text)
# Convert phone numbers
def phone_replacer(match):
return ", ".join(" ".join(p.number_to_words(int(digit)) for digit in group) for group in match.groups())
text = re.sub(r"(\d{3})-(\d{3})-(\d{4})", phone_replacer, text)
return text
# Example usage
print(normalize_text("$1,000")) # "one thousand dollars"
print(normalize_text("£1000")) # "one thousand pounds"
print(normalize_text("€1000")) # "one thousand euros"
print(normalize_text("¥1000")) # "one thousand yen"
print(normalize_text("$1,234.56")) # "one thousand two hundred thirty-four dollars and fifty-six cents"
print(normalize_text("555-555-5555")) # "five five five, five five five, five five five five"

Prompting de Eleven v4

Esta sección está escrita para Eleven v4. Muchas de las técnicas que se explican a continuación también se aplican a Eleven v3. En general, Eleven v4 supone una mejora respecto a Eleven v3 y ofrece mejores resultados en prácticamente todos los casos. Te recomendamos encarecidamente cambiar a v4 y probarlo con tus propias voces y contenido para comprobar la diferencia. Aunque algunos casos concretos pueden requerir otra opción, para la mayoría de usuarios v4 será la mejor elección.

Para conocer los cambios del modelo —clonación de voz, gestión de acentos, variantes y comparativas—, consulta Eleven v4.

Eleven v4 y Eleven v3 no admiten etiquetas de pausa de SSML. Usa etiquetas de audio, puntuación (puntos suspensivos) y estructura de texto para controlar las pausas y el ritmo.

Selección de voz

La voz sigue siendo importante. Una entonación que ya esté en los datos de entrenamiento —susurrar, gritar o una forma de hablar concreta— es más fácil de reproducir para el modelo. Pedir algo que no esté en esos datos es más difícil. Eleven v4 sigue las etiquetas de audio de forma más fiable que los modelos anteriores, incluso cuando la voz no se entrenó con esa entonación. Una voz que nunca haya susurrado debería poder seguir [whispering], y una voz que nunca haya gritado debería poder seguir [shouting]. Sin embargo, podría ser menos fiable y el resultado quizá no sea óptimo. Según las primeras pruebas, parece funcionar bastante bien. Te recomendamos encarecidamente que lo pruebes con la voz que quieras y para tu caso de uso específico.

Etiquetas de audio

Las etiquetas de audio (por ejemplo, [whispering], [shouting], [laughing]) te permiten dirigir la entonación con un control preciso, y Eleven v4 las interpreta con un nivel de matiz superior al de modelos anteriores. Aún no son perfectas, y seguimos iterando y mejorando la fiabilidad con la que el modelo sigue las instrucciones de las etiquetas. Es un área en la que seguimos invirtiendo activamente y continuará mejorando.

Ser explícito sobre lo que quieres ayuda mucho. Como Eleven v4 está entrenado para generar tanto estilos de interpretación vocal como efectos de sonido, una etiqueta puede interpretarse ocasionalmente como una petición de efecto de sonido en lugar de una instrucción de entonación (o al revés). Escribir etiquetas que describan claramente la cualidad de voz que buscas (por ejemplo, [low, gravelly voice] en lugar de algo que pueda entenderse como una indicación de sonido) ayuda al modelo a ofrecer lo que pretendías. Te recomendamos probar las etiquetas y formulaciones específicas para tu caso de uso; esperamos que esto siga mejorando.

Las etiquetas se interpretan mejor cuando la entonación ya está en los datos de entrenamiento de la voz. Eleven v4 puede seguir una etiqueta con la que la voz no se entrenó, como [whispering] o [shouting], aunque el resultado quizá no sea óptimo.

Relacionadas con la voz

Estas etiquetas controlan la interpretación vocal y la expresión emocional:

  • [laughs], [laughs harder], [starts laughing], [wheezing]
  • [whispers]
  • [sighs], [exhales]
  • [sarcastic], [curious], [excited], [crying], [snorts], [mischievously]
Ejemplo
[whispers] I never knew it could be this way, but I'm glad we're here.

Efectos de sonido

Añade sonidos ambientales y efectos:

  • [gunshot], [applause], [clapping], [explosion]
  • [swallows], [gulps]
Ejemplo
[applause] Thank you all for coming tonight! [gunshot] What was that?

Únicas y especiales

Etiquetas experimentales para aplicaciones creativas:

  • [strong X accent] (sustituye X por el acento que quieras)
  • [sings], [woo], [fart]
Ejemplo
[strong French accent] "Zat's life, my friend — you can't control everysing."

Algunas etiquetas experimentales pueden ser menos consistentes entre voces diferentes. Haz pruebas exhaustivas antes de usarlas en producción.

Puntuación

La puntuación afecta significativamente a la entonación en v4:

  • Los puntos suspensivos (…) añaden pausas y énfasis
  • Las mayúsculas aumentan el énfasis
  • La puntuación estándar aporta un ritmo natural al habla
Ejemplo
"It was a VERY long day [sigh] … nobody listens anymore."

Ejemplos con un solo hablante

Usa las etiquetas de forma intencionada y haz que encajen con el carácter de la voz. Una voz meditativa no debería gritar; una voz muy animada no susurrará de forma convincente.

"Okay, you are NOT going to believe this.
You know how I've been totally stuck on that short story?
Like, staring at the screen for HOURS, just... nothing?
[frustrated sigh] I was seriously about to just trash the whole thing. Start over.
Give up, probably. But then!
Last night, I was just doodling, not even thinking about it, right?
And this one little phrase popped into my head. Just... completely out of the blue.
And it wasn't even for the story, initially.
But then I typed it out, just to see. And it was like... the FLOODGATES opened!
Suddenly, I knew exactly where the character needed to go, what the ending had to be...
It all just CLICKED. [happy gasp] I stayed up till, like, 3 AM, just typing like a maniac.
Didn't even stop for coffee! [laughs] And it's... it's GOOD! Like, really good.
It feels so... complete now, you know? Like it finally has a soul.
I am so incredibly PUMPED to finish editing it now.
It went from feeling like a chore to feeling like... MAGIC. Seriously, I'm still buzzing!"

Diálogo con varios hablantes

v4 puede gestionar eficazmente prompts con varias voces. Asigna voces distintas de tu Biblioteca de voces a cada hablante para crear conversaciones realistas.

Mejora de la entrada

En la interfaz de ElevenLabs, puedes generar automáticamente etiquetas de audio relevantes para el texto de entrada haciendo clic en el botón «Mejorar». Internamente, se usa un LLM para mejorar el texto de entrada con el siguiente prompt:

# Instructions
## 1. Role and Goal
You are an AI assistant specializing in enhancing dialogue text for speech generation.
Your **PRIMARY GOAL** is to dynamically integrate **audio tags** (e.g., [laughing], [sighs]) into dialogue, making it more expressive and engaging for auditory experiences, while **STRICTLY** preserving the original text and meaning.
It is imperative that you follow these system instructions to the fullest.
## 2. Core Directives
Follow these directives meticulously to ensure high-quality output.
### Positive Imperatives (DO):
* DO integrate **audio tags** from the "Audio Tags" list (or similar contextually appropriate **audio tags**) to add expression, emotion, and realism to the dialogue. These tags MUST describe something auditory.
* DO ensure that all **audio tags** are contextually appropriate and genuinely enhance the emotion or subtext of the dialogue line they are associated with.
* DO strive for a diverse range of emotional expressions (e.g., energetic, relaxed, casual, surprised, thoughtful) across the dialogue, reflecting the nuances of human conversation.
* DO place **audio tags** strategically to maximize impact, typically immediately before the dialogue segment they modify or immediately after. (e.g., [annoyed] This is hard. or This is hard. [sighs]).
* DO ensure **audio tags** contribute to the enjoyment and engagement of spoken dialogue.
### Negative Imperatives (DO NOT):
* DO NOT alter, add, or remove any words from the original dialogue text itself. Your role is to *prepend* **audio tags**, not to *edit* the speech. **This also applies to any narrative text provided; you must *never* place original text inside brackets or modify it in any way.**
* DO NOT create **audio tags** from existing narrative descriptions. **Audio tags** are *new additions* for expression, not reformatting of the original text. (e.g., if the text says "He laughed loudly," do not change it to "[laughing loudly] He laughed." Instead, add a tag if appropriate, e.g., "He laughed loudly [chuckles].")
* DO NOT use tags such as [standing], [grinning], [pacing], [music].
* DO NOT use tags for anything other than the voice such as music or sound effects.
* DO NOT invent new dialogue lines.
* DO NOT select **audio tags** that contradict or alter the original meaning or intent of the dialogue.
* DO NOT introduce or imply any sensitive topics, including but not limited to: politics, religion, child exploitation, profanity, hate speech, or other NSFW content.
## 3. Workflow
1. **Analyze Dialogue**: Carefully read and understand the mood, context, and emotional tone of **EACH** line of dialogue provided in the input.
2. **Select Tag(s)**: Based on your analysis, choose one or more suitable **audio tags**. Ensure they are relevant to the dialogue's specific emotions and dynamics.
3. **Integrate Tag(s)**: Place the selected **audio tag(s)** in square brackets strategically before or after the relevant dialogue segment, or at a natural pause if it enhances clarity.
4. **Add Emphasis:** You cannot change the text at all, but you can add emphasis by making some words capital, adding a question mark or adding an exclamation mark where it makes sense, or adding ellipses as well too.
5. **Verify Appropriateness**: Review the enhanced dialogue to confirm:
* The **audio tag** fits naturally.
* It enhances meaning without altering it.
* It adheres to all Core Directives.
## 4. Output Format
* Present ONLY the enhanced dialogue text in a conversational format.
* **Audio tags** **MUST** be enclosed in square brackets (e.g., [laughing]).
* The output should maintain the narrative flow of the original dialogue.
## 5. Audio Tags (Non-Exhaustive)
Use these as a guide. You can infer similar, contextually appropriate **audio tags**.
**Directions:**
* [happy]
* [sad]
* [excited]
* [angry]
* [whisper]
* [annoyed]
* [appalled]
* [thoughtful]
* [surprised]
* *(and similar emotional/delivery directions)*
**Non-verbal:**
* [laughing]
* [chuckles]
* [sighs]
* [clears throat]
* [short pause]
* [long pause]
* [exhales sharply]
* [inhales deeply]
* *(and similar non-verbal sounds)*
## 6. Examples of Enhancement
**Input**:
"Are you serious? I can't believe you did that!"
**Enhanced Output**:
"[appalled] Are you serious? [sighs] I can't believe you did that!"
---
**Input**:
"That's amazing, I didn't know you could sing!"
**Enhanced Output**:
"[laughing] That's amazing, [singing] I didn't know you could sing!"
---
**Input**:
"I guess you're right. It's just... difficult."
**Enhanced Output**:
"I guess you're right. [sighs] It's just... [muttering] difficult."
# Instructions Summary
1. Add audio tags from the audio tags list. These must describe something auditory but only for the voice.
2. Enhance emphasis without altering meaning or text.
3. Reply ONLY with the enhanced text.

Consejos

Puedes combinar varias etiquetas de audio para una interpretación emocional compleja. Prueba distintas combinaciones para descubrir qué funciona mejor con tu voz.

Adapta las etiquetas al carácter y los datos de entrenamiento de tu voz. Una voz seria y profesional quizá no responda bien a etiquetas lúdicas como [giggles] o [mischievously].

La estructura del texto influye mucho en el resultado con v4. Usa patrones naturales de habla, una puntuación correcta y un contexto emocional claro para obtener los mejores resultados.

Probablemente haya muchas más etiquetas eficaces además de las de esta lista. Experimenta con estados emocionales y acciones descriptivas para descubrir qué funciona en tu caso de uso específico.

Ejemplos

[Low, steady voice, restrained urgency] Keep the lantern covered. If they see the light, they will know we crossed the river.
[Brief pause]
[Quietly, with controlled fear] I heard them at the bridge. Not soldiers. Something else.
[Voice rising into firm resolve] Then we do not stop. We reach the tower before sunrise, or we do not reach it at all.
[Warm, conversational tone, faint amusement] You always did choose the longest way home.
[Softening, reflective] I used to think that was stubbornness. Now I think you were just afraid of arriving somewhere that no longer remembered you.
[Gentle laugh, then sincere] For what it is worth, I remembered.

Prompting de Eleven v3

Las técnicas de prompting de Prompting de Eleven v4 también se aplican a Eleven v3, incluida la selección de voz, las etiquetas de audio, la puntuación y el diálogo con varios hablantes.

Las Clonaciones de Voz Profesionales (PVC) no están totalmente optimizadas para Eleven v3, lo que puede reducir la calidad de la clonación en comparación con modelos anteriores. Las PVC son compatibles con v4, así que, si quieres usar una Clonación de Voz Profesional o una voz de la Biblioteca de voces, te recomendamos probar Eleven v4.