Buenas prácticas
Buenas prácticas
Aprende a controlar la entonación, la pronunciación y la emoción, y a optimizar texto para voz.
Esta guía ofrece técnicas para mejorar los resultados de texto a voz con modelos de ElevenLabs. Experimenta con estos métodos para descubrir cuáles se adaptan mejor a tus necesidades.
Controles
Estamos trabajando activamente en el Modo de dirección para darte aún más control sobre los resultados.
Estas técnicas ofrecen una forma práctica de conseguir resultados matizados hasta que se implementen funciones avanzadas como el Modo de dirección.
Pausas
Eleven v4 y Eleven v3 no admiten etiquetas de pausa SSML. Usa las técnicas descritas en la sección Prompting de Eleven v4 para controlar las pausas.
Usa <break time="x.xs" /> para pausas naturales de hasta 3 segundos.
Usar demasiadas etiquetas de pausa en una sola generación puede causar inestabilidad. La IA podría acelerar o introducir ruidos adicionales o artefactos de audio. Estamos trabajando para resolverlo.
- Coherencia: Usa las etiquetas
<break>de forma coherente para mantener un flujo de voz natural. Un uso excesivo puede provocar inestabilidad. - Comportamiento específico de cada voz: Las distintas voces pueden gestionar las pausas de forma diferente, especialmente las entrenadas con sonidos de relleno como “uh” o “ah”.
Como alternativa a <break>, puedes usar guiones (- o —) para pausas cortas o puntos suspensivos (…) para tonos dubitativos. Sin embargo, son menos coherentes.
Pronunciación
IPA con Eleven v4
Eleven v4 (eleven_v4) incluye una compatibilidad nativa mejorada con el Alfabeto Fonético Internacional, o IPA, que te ofrece un control más preciso de la pronunciación de nombres, términos técnicos y otras palabras que requieren un tratamiento especial. La pronunciación IPA es más coherente que en modelos anteriores, pero los resultados pueden variar según la voz y la frase. Te recomendamos probar las pronunciaciones importantes con la voz que hayas elegido antes de utilizarlas en producción.
A diferencia de los modelos antiguos, que requieren etiquetas de fonemas de estilo XML, Eleven v4 entiende los símbolos IPA cuando los incluyes entre barras inclinadas en el texto:
La transcripción IPA debe:
- Estar entre barras inclinadas (
/) al principio y al final - Estar escrita con símbolos IPA estándar
- Estar entre comillas dobles cuando se pase como parámetro de cadena
Ejemplos de código
Puedes incluir varias transcripciones IPA en una sola cadena de texto:
Buenas prácticas
- Usa símbolos IPA estándar de la tabla del Alfabeto Fonético Internacional
- Incluye marcas de acento: acento principal (ˈ) y secundario (ˌ) para palabras de varias sílabas
- Aplícalo de forma selectiva: incluye entre barras solo las palabras o frases concretas que requieran control de pronunciación
- Pruébalo con tu voz: las distintas voces pueden interpretar el IPA de forma ligeramente diferente
Resolución de problemas
La pronunciación sigue siendo incorrecta
Comprueba que tu transcripción IPA sea correcta con un diccionario IPA. Incluye marcas de acento (ˈ para el acento principal, ˌ para el secundario) en palabras de varias sílabas. Prueba con distintas voces, ya que algunas pueden interpretar el IPA con más precisión que otras.
Resultados incoherentes con el mismo IPA
La pronunciación IPA es más coherente que en modelos anteriores, pero los resultados pueden seguir variando según la voz y la frase. Te recomendamos probar las pronunciaciones importantes con la voz que hayas elegido antes de utilizarlas en producción. Si necesitas un resultado coherente, genera más de una vez y selecciona el mejor resultado.
Etiquetas de fonemas para modelos v2
Especifica la pronunciación mediante etiquetas de fonemas SSML con los modelos v2. Los alfabetos compatibles incluyen CMU Arpabet y el Alfabeto Fonético Internacional (IPA).
Las etiquetas de fonemas solo son compatibles con el modelo eleven_flash_v2.
Recomendamos usar CMU Arpabet para obtener resultados coherentes y predecibles con los modelos v2. Aunque IPA puede ser eficaz, CMU Arpabet suele ofrecer un rendimiento más fiable.
Las etiquetas de fonemas solo funcionan con palabras individuales. Si tienes un nombre y apellidos que quieres que se pronuncien de una forma determinada, tendrás que crear una etiqueta de fonema para cada palabra.
Asegúrate de marcar correctamente el acento en palabras de varias sílabas para mantener una pronunciación precisa:
Etiquetas de alias
Para los modelos que no admiten etiquetas de fonemas, puedes probar a escribir las palabras de forma más fonética. También puedes emplear distintos trucos, como letras mayúsculas, guiones, apóstrofos o incluso comillas simples alrededor de una letra o varias letras.
Por ejemplo, una palabra como “trapezii” podría escribirse como “trapezIi” para dar más énfasis a la “ii” de la palabra.
Puedes sustituir la palabra directamente en el texto o, si quieres especificar la pronunciación mediante otras palabras o frases al usar un diccionario de pronunciación, puedes utilizar etiquetas de alias. Esto puede ser útil si generas con Multilingual v2, que no admite etiquetas de fonemas. Puedes usar diccionarios de pronunciación con ElevenCreative Studio, Doblaje IA y Síntesis de voz mediante la API.
Por ejemplo, si tu texto incluye un nombre con una pronunciación inusual que pueda resultar difícil para la IA, puedes utilizar una etiqueta de alias para especificar cómo quieres que se pronuncie:
Si quieres asegurarte de que un acrónimo se pronuncie siempre de una forma determinada cada vez que aparezca en el texto, puedes utilizar una etiqueta de alias para especificarlo:
Diccionarios de pronunciación
Algunas de nuestras herramientas, como ElevenCreative Studio y Doblaje IA, te permiten crear y subir un diccionario de pronunciación. Con ellos puedes especificar la pronunciación de determinadas palabras, como nombres de personajes o marcas, o indicar cómo deben leerse los acrónimos.
Los diccionarios de pronunciación permiten esta funcionalidad al dejarte subir un archivo de léxico o diccionario que especifica pares de palabras y cómo deben pronunciarse, ya sea mediante un alfabeto fonético o sustituciones de palabras.
Cada vez que una de estas palabras aparezca en un proyecto, el modelo de IA pronunciará la palabra usando la sustitución especificada.
Para proporcionar un archivo de diccionario de pronunciación, abre los ajustes de un proyecto y sube un archivo en formato TXT o .PLS. Al añadir un diccionario a un proyecto, se recalcularán automáticamente las partes del proyecto que deben convertirse de nuevo con el nuevo archivo de diccionario y se marcarán como no convertidas.
Actualmente solo admitimos diccionarios de pronunciación que especifiquen sustituciones mediante etiquetas de fonemas o alias.
Tanto los fonemas como los alias son conjuntos de reglas que especifican una palabra o frase que buscan, denominada grafema, y con qué se sustituirá. Ten en cuenta que las búsquedas distinguen entre mayúsculas y minúsculas. Al buscar una palabra de sustitución en un diccionario de pronunciación, el diccionario se comprueba de principio a fin y solo se utiliza la primera sustitución.
Ejemplos de diccionarios de pronunciación
Aquí tienes ejemplos de diccionarios de pronunciación tanto en CMU Arpabet como en IPA, incluido un fonema para especificar la pronunciación de “Apple” y un alias para sustituir “UN” por “United Nations”:
Para generar un archivo de diccionario de pronunciación .pls, hay disponibles varias herramientas de código abierto:
- Sequitur G2P - Herramienta de código abierto que aprende reglas de pronunciación a partir de datos y puede generar transcripciones fonéticas.
- Phonetisaurus - Sistema G2P de código abierto entrenado con diccionarios existentes como CMUdict.
- eSpeak - Sintetizador de voz que puede generar transcripciones de fonemas a partir de texto.
- CMU Pronouncing Dictionary - Diccionario de inglés predefinido con transcripciones fonéticas.
Emoción
Transmite emociones mediante el contexto narrativo o etiquetas de diálogo explícitas. Este enfoque ayuda a la IA a entender el tono y la emoción que debe reproducir.
Las etiquetas de diálogo explícitas ofrecen resultados más predecibles que depender únicamente del contexto; sin embargo, el modelo seguirá pronunciando en voz alta las indicaciones de entonación emocional. Si no las quieres, puedes eliminarlas en posproducción con un editor de audio.
Ritmo
El ritmo del audio depende en gran medida del audio utilizado para crear la voz. Al crear tu voz, recomendamos usar muestras más largas y continuas para evitar problemas de ritmo, como una voz demasiado rápida.
Para controlar la velocidad del audio generado, puedes utilizar el ajuste de velocidad. Te permite acelerar o ralentizar la voz generada. El ajuste de velocidad está disponible en Texto a Voz mediante el sitio web y la API, así como en ElevenCreative Studio y la Plataforma de Agentes. Lo encontrarás en los ajustes de voz.
El valor predeterminado es 1.0, lo que significa que la velocidad no se ajusta. Los valores inferiores a 1.0 ralentizan la voz, hasta un mínimo de 0.7. Los valores superiores a 1.0 aceleran la voz, hasta un máximo de 1.2. Los valores extremos pueden afectar a la calidad de la voz generada.
También puedes controlar el ritmo escribiendo con un estilo narrativo natural.
Consejos
Problemas habituales
Pausas incoherentes: asegúrate de usar la sintaxis
<break time=“x.xs” />para las pausas.- Errores de pronunciación: usa etiquetas de fonemas CMU Arpabet o IPA para lograr una pronunciación precisa.
Emoción inadecuada: añade contexto narrativo o etiquetas explícitas para guiar la emoción. Recuerda eliminar cualquier texto de guía emocional en posproducción.
Consejos para mejorar el resultado
Experimenta con formulaciones alternativas para conseguir el ritmo o la emoción que buscas. Para efectos de sonido complejos, divide los prompts en elementos más pequeños y secuenciales, y combina los resultados manualmente.
Control creativo
Aunque estamos desarrollando activamente un “Modo de dirección” para dar a usuarios aún más control sobre los resultados, aquí tienes algunas técnicas provisionales para maximizar la creatividad y la precisión:
Estilo narrativo
Escribe los prompts con un estilo narrativo, similar al de un guion, para guiar eficazmente el tono y el ritmo.
Resultados por capas
Genera efectos de sonido o voz por segmentos y superponlos con software de edición de audio para crear composiciones más complejas.
Experimentación fonética
Si la pronunciación no es perfecta, experimenta con grafías alternativas o aproximaciones fonéticas para conseguir los resultados que buscas.
Normalización de texto
Al usar Texto a Voz con elementos complejos como números de teléfono, códigos postales y correos electrónicos, es posible que se pronuncien mal. Esto suele deberse a que esos elementos concretos no estaban en el conjunto de entrenamiento y a que los modelos más pequeños no consiguen generalizar cómo deberían pronunciarse. Esta guía aclarará cuándo se producen estas discrepancias y cómo conseguir que se pronuncien correctamente.
La normalización está activada de forma predeterminada para todos los modelos de TTS, lo que ayuda a mejorar la pronunciación de números, fechas y otros elementos de texto complejos.
¿Por qué los modelos leen las entradas de forma distinta?
Algunos modelos están entrenados para leer números y frases de una forma más natural. Por ejemplo, el modelo Eleven Multilingual v2 lee correctamente la frase “$1,000,000” como “one million dollars”. Sin embargo, el modelo Eleven Flash v2.5 lee la misma frase como “one thousand thousand dollars”.
Esto se debe a que Multilingual v2 es un modelo más grande y puede generalizar mejor la lectura de números de una forma más natural para las personas, mientras que Flash v2.5 es un modelo mucho más pequeño y no puede hacerlo.
Ejemplos habituales
Los modelos de Texto a Voz pueden tener dificultades con lo siguiente:
- Números de teléfono (“123-456-7890”)
- Monedas (“$47,345.67”)
- Eventos del calendario (“2024-01-01”)
- Horas (“9:23 AM”)
- Direcciones (“123 Main St, Anytown, USA”)
- URL (“example.com/link/to/resource”)
- Abreviaturas de unidades (“TB” en lugar de “Terabyte”)
- Atajos (“Ctrl + Z”)
Solución
Usa modelos entrenados
La forma más sencilla de mitigarlo es usar un modelo de TTS entrenado para leer números y frases de una forma más natural, como Eleven Multilingual v2. Sin embargo, no siempre será posible, por ejemplo, si tienes un caso de uso en el que la baja latencia es fundamental (como agentes conversacionales).
Aplica normalización en los prompts de LLM
Si usas un LLM para generar el texto de TTS, puedes añadir instrucciones de normalización al prompt.
Usa prompts claros y explícitos
Los LLM responden mejor a instrucciones estructuradas y explícitas. Tu prompt debe indicar claramente que quieres convertir el texto a un formato legible para voz.
Gestiona distintos formatos numéricos
No todos los números se leen de la misma forma. Ten en cuenta cómo deberían pronunciarse los distintos tipos de números:
- Números cardinales: 123 → “one hundred twenty-three”
- Números ordinales: 2nd → “second”
- Valores monetarios: $45.67 → “forty-five dollars and sixty-seven cents”
- Números de teléfono: “123-456-7890” → “one two three, four five six, seven eight nine zero”
- Decimales y fracciones: “3.5” → “three point five”, “⅔” → “two-thirds”
- Números romanos: “XIV” → “fourteen” (o “the fourteenth” si es un título)
Elimina o amplía abreviaturas
Las abreviaturas habituales deben ampliarse para aportar claridad:
- “Dr.” → “Doctor”
- “Ave.” → “Avenue”
- “St.” → “Street” (pero “St. Patrick” debe mantenerse)
Puedes solicitar una ampliación explícita en tu prompt:
Amplía todas las abreviaturas a sus formas completas para la locución.
Normalización alfanumérica
No toda la normalización trata de números; algunas frases alfanuméricas también deben normalizarse para ganar claridad:
- Atajos: “Ctrl + Z” → “control z”
- Abreviaturas de unidades: “100km” → “one hundred kilometers”
- Símbolos: “100%” → “one hundred percent”
- URL: “elevenlabs.io/docs” → “eleven labs dot io slash docs”
- Eventos del calendario: “2024-01-01” → “January first, two-thousand twenty-four”
Ten en cuenta los casos límite
Los distintos contextos pueden requerir conversiones diferentes:
- Fechas: “01/02/2023” → “January second, twenty twenty-three” o “the first of February, twenty twenty-three” (según la configuración regional)
- Hora: “14:30” → “two thirty PM”
Si necesitas un formato específico, indícalo explícitamente en el prompt.
Todo junto
Este prompt es un buen punto de partida para la mayoría de casos de uso:
Usa expresiones regulares para el preprocesamiento
Si usas código para crear un prompt para un LLM, puedes usar expresiones regulares para normalizar el texto antes de proporcionárselo al modelo. Esta es una técnica más avanzada y requiere algunos conocimientos de expresiones regulares. Aquí tienes algunos ejemplos sencillos:
Prompting de Eleven v4
Esta sección está escrita para Eleven v4. Muchas de las técnicas que se explican a continuación también se aplican a Eleven v3. En general, Eleven v4 supone una mejora respecto a Eleven v3 y ofrece mejores resultados en prácticamente todos los casos. Te recomendamos encarecidamente cambiar a v4 y probarlo con tus propias voces y contenido para comprobar la diferencia. Aunque algunos casos concretos pueden requerir otra opción, para la mayoría de usuarios v4 será la mejor elección.
Para conocer los cambios del modelo —clonación de voz, gestión de acentos, variantes y comparativas—, consulta Eleven v4.
Eleven v4 y Eleven v3 no admiten etiquetas de pausa de SSML. Usa etiquetas de audio, puntuación (puntos suspensivos) y estructura de texto para controlar las pausas y el ritmo.
Selección de voz
La voz sigue siendo importante. Una entonación que ya esté en los datos de entrenamiento —susurrar, gritar o una forma de hablar concreta— es más fácil de reproducir para el modelo. Pedir algo que no esté en esos datos es más difícil. Eleven v4 sigue las etiquetas de audio de forma más fiable que los modelos anteriores, incluso cuando la voz no se entrenó con esa entonación. Una voz que nunca haya susurrado debería poder seguir [whispering], y una voz que nunca haya gritado debería poder seguir [shouting]. Sin embargo, podría ser menos fiable y el resultado quizá no sea óptimo. Según las primeras pruebas, parece funcionar bastante bien. Te recomendamos encarecidamente que lo pruebes con la voz que quieras y para tu caso de uso específico.
Etiquetas de audio
Las etiquetas de audio (por ejemplo, [whispering], [shouting], [laughing]) te permiten dirigir la entonación con un control preciso, y Eleven v4 las interpreta con un nivel de matiz superior al de modelos anteriores. Aún no son perfectas, y seguimos iterando y mejorando la fiabilidad con la que el modelo sigue las instrucciones de las etiquetas. Es un área en la que seguimos invirtiendo activamente y continuará mejorando.
Ser explícito sobre lo que quieres ayuda mucho. Como Eleven v4 está entrenado para generar tanto estilos de interpretación vocal como efectos de sonido, una etiqueta puede interpretarse ocasionalmente como una petición de efecto de sonido en lugar de una instrucción de entonación (o al revés). Escribir etiquetas que describan claramente la cualidad de voz que buscas (por ejemplo, [low, gravelly voice] en lugar de algo que pueda entenderse como una indicación de sonido) ayuda al modelo a ofrecer lo que pretendías. Te recomendamos probar las etiquetas y formulaciones específicas para tu caso de uso; esperamos que esto siga mejorando.
Las etiquetas se interpretan mejor cuando la entonación ya está en los datos de entrenamiento de la voz. Eleven v4 puede
seguir una etiqueta con la que la voz no se entrenó, como [whispering] o [shouting], aunque
el resultado quizá no sea óptimo.
Relacionadas con la voz
Estas etiquetas controlan la interpretación vocal y la expresión emocional:
[laughs],[laughs harder],[starts laughing],[wheezing][whispers][sighs],[exhales][sarcastic],[curious],[excited],[crying],[snorts],[mischievously]
Efectos de sonido
Añade sonidos ambientales y efectos:
[gunshot],[applause],[clapping],[explosion][swallows],[gulps]
Únicas y especiales
Etiquetas experimentales para aplicaciones creativas:
[strong X accent](sustituye X por el acento que quieras)[sings],[woo],[fart]
Algunas etiquetas experimentales pueden ser menos consistentes entre voces diferentes. Haz pruebas exhaustivas antes de usarlas en producción.
Puntuación
La puntuación afecta significativamente a la entonación en v4:
- Los puntos suspensivos (…) añaden pausas y énfasis
- Las mayúsculas aumentan el énfasis
- La puntuación estándar aporta un ritmo natural al habla
Ejemplos con un solo hablante
Usa las etiquetas de forma intencionada y haz que encajen con el carácter de la voz. Una voz meditativa no debería gritar; una voz muy animada no susurrará de forma convincente.
Monólogo expresivo
Dinámico y humorístico
Simulación de atención al cliente
Diálogo con varios hablantes
v4 puede gestionar eficazmente prompts con varias voces. Asigna voces distintas de tu Biblioteca de voces a cada hablante para crear conversaciones realistas.
Demostración de diálogo
Comedia de fallos
Tiempos superpuestos
Mejora de la entrada
En la interfaz de ElevenLabs, puedes generar automáticamente etiquetas de audio relevantes para el texto de entrada haciendo clic en el botón «Mejorar». Internamente, se usa un LLM para mejorar el texto de entrada con el siguiente prompt:
Consejos
Combinaciones de etiquetas
Puedes combinar varias etiquetas de audio para una interpretación emocional compleja. Prueba distintas combinaciones para descubrir qué funciona mejor con tu voz.
Adecuación a la voz
Adapta las etiquetas al carácter y los datos de entrenamiento de tu voz. Una voz seria y profesional quizá no
responda bien a etiquetas lúdicas como [giggles] o [mischievously].
Estructura del texto
La estructura del texto influye mucho en el resultado con v4. Usa patrones naturales de habla, una puntuación correcta y un contexto emocional claro para obtener los mejores resultados.
Experimentación
Probablemente haya muchas más etiquetas eficaces además de las de esta lista. Experimenta con estados emocionales y acciones descriptivas para descubrir qué funciona en tu caso de uso específico.
Ejemplos
Interpretación de voz
Narración larga
Prompting de Eleven v3
Las técnicas de prompting de Prompting de Eleven v4 también se aplican a Eleven v3, incluida la selección de voz, las etiquetas de audio, la puntuación y el diálogo con varios hablantes.
Las Clonaciones de Voz Profesionales (PVC) no están totalmente optimizadas para Eleven v3, lo que puede reducir la calidad de la clonación en comparación con modelos anteriores. Las PVC son compatibles con v4, así que, si quieres usar una Clonación de Voz Profesional o una voz de la Biblioteca de voces, te recomendamos probar Eleven v4.