Diseño de voz
Diseño de voz
Guía para crear voces a partir de un prompt de texto.
Descripción general
Diseño de voz ayuda a creadores a cubrir las necesidades cuando la voz exacta que buscan no está disponible en la Biblioteca de voces. Si no encuentras una voz adecuada para tu proyecto, puedes crearla. Diseño de voz es ideal para explorar e iterar rápidamente, y la calidad del resultado puede variar según el prompt y el caso de uso. Si necesitas la mayor calidad posible, lista para producción y consistente, los clones de voz profesionales (PVC) son actualmente las voces de mayor calidad de nuestra plataforma. Por tanto, si hay un PVC disponible en nuestra biblioteca que se ajuste a tus necesidades, te recomendamos usarlo.
Puedes encontrar Diseño de voz en Voices -> My Voices -> Add a new voice -> Voice Design en la app de ElevenLabs o mediante la API.
Al pulsar generar, crearemos tres opciones de voz para ti. El único coste de usar Diseño de voz es el número de créditos necesarios para generar el texto de vista previa, que solo se cobra una vez aunque generemos tres muestras. Puedes ver el número de caracteres que se descontarán en el cuadro de texto «Text to preview».
Después de generar las voces, podrás seleccionar y guardar una de ellas, que ocupará una de tus plazas de voz.
Guía de prompting
El prompt es la base de tu voz. Indica al modelo qué tipo de voz intentas crear: desde el acento y el tipo de personaje hasta el género y la personalidad de la voz. Un prompt bien elaborado puede marcar la diferencia entre una voz genérica y otra que encaje de verdad con tu visión. En general, los prompts más descriptivos y detallados suelen ofrecer resultados más precisos y matizados. Cuantos más detalles proporciones —incluidos edad, género, tono, acento, ritmo, emoción, estilo y más—, mejor podrá el modelo interpretar y generar una voz que resulte intencionada y personalizada.
Sin embargo, los prompts cortos y sencillos también pueden funcionar a veces, especialmente si buscas una voz más neutra o de uso general. Por ejemplo, «Un narrador masculino tranquilo» puede darte exactamente lo que necesitas sin entrar en detalles, sobre todo si no intentas crear un personaje o estilo muy específico. El nivel de detalle adecuado depende de tu caso de uso. ¿Estás creando un personaje de fantasía? ¿Un asistente virtual? ¿Una neoyorquina de unos 60 años, cansada y con un sentido del humor seco? Cuanto más claramente lo definas en tu prompt, más se acercará el resultado a lo que imaginas.
Formato de prompt recomendado
Para obtener resultados consistentes, estructura tu prompt con este formato:
Ejemplo:
Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.
Errores habituales que debes evitar
- No uses «acento» cuando te refieras a la entonación: puede provocar cambios de dialecto no deseados. Describe en su lugar los patrones de entonación, énfasis o entonación.
- Evita palabras de efectos: términos como «reverb», «echo», «phone» o «tape» pueden afectar negativamente a la calidad del resultado.
- Indica claramente el idioma y el dialecto: especifica siempre el idioma y la variante regional en la primera frase para evitar desviaciones.
Calidad de audio
La calidad de audio se refiere a la claridad, limpieza y fidelidad general de la voz generada. Por defecto, ElevenLabs busca producir audio limpio y natural, pero si tu proyecto requiere un nivel de calidad específico, lo mejor es incluirlo explícitamente en el prompt.
Para obtener resultados de alta calidad, puedes ayudar al modelo añadiendo una frase como “calidad de audio perfecta” o “grabación con calidad de estudio” a la descripción de la voz. Esto ayuda a garantizar que la voz se genere con la máxima claridad, una distorsión mínima y un acabado pulido.
También puedes usar descriptores de calidad específicos que ofrecen resultados consistentes:
- Calidad aceptable
- Buena calidad
- Muy buena calidad
- Calidad excelente
- Calidad de estudio
- Calidad de emisión
Estos descriptores ayudan a lograr la máxima calidad de audio cuando se incluyen en el prompt.
Incluir este tipo de frases a veces puede reducir la precisión general del prompt si la voz es muy específica o de nicho.
También puede haber casos creativos en los que se busque una calidad de audio inferior, como al simular una llamada telefónica, una emisión de radio antigua o metraje encontrado. En esas situaciones, omite por completo los descriptores de calidad o incluye explícitamente frases como:
- “Audio de baja fidelidad”
- “Mala calidad de audio”
- “Suena como un mensaje de voz”
- “Apagado y distante, como en una grabadora de casetes antigua”
La posición de esta frase en el prompt es flexible: puede aparecer al principio o al final, y hemos comprobado que funciona bien en cualquiera de los dos lugares.
Edad, tono/timbre y género
Estas tres características son la base del diseño de voz, ya que definen la identidad general y la resonancia emocional de la voz. Cuantos más detalles proporciones, más fácil será para la IA producir una voz que encaje con tu visión creativa, tanto si estás creando un personaje creíble como elaborando un narrador cautivador o diseñando un asistente virtual.
Edad
Describir la edad percibida de la voz ayuda a definir su madurez, textura vocal y energía. Usa términos específicos para guiar a la IA hacia la cualidad vocal adecuada.
Descriptores útiles:
- “Hombre adolescente” / “mujer adolescente”
- “Adulto joven” / “veintitantos” / “principios de los 30”
- “Hombre de mediana edad” / “mujer de unos 40 años”
- “Hombre mayor” / “mujer mayor” / “hombre de unos 80 años”
Tono/timbre
Se refiere a la cualidad física de la voz, determinada por el tono, la resonancia y la textura vocal. Es distinto de la expresión emocional o la actitud.
Descriptores habituales de tono/timbre:
- “Profundo” / “grave”
- “Suave” / “rico”
- “Áspero” / “ronco”
- “Nasal” / “chillón”
- “Aéreo” / “entrecortado”
- “Potente” / “resonante”
- “Ligero” / “fino”
- “Cálido” / “meloso”
- “Metálico” / “metalizado”
Género
El género suele influir en el tono, el cuerpo vocal y la presencia tonal, pero puedes ir más allá de categorías simples describiendo el sonido en lugar de la identidad.
Ejemplos:
- “Una voz femenina grave y ronca”
- “Una voz masculina profunda y resonante”
- “Un género neutro: suave y de tono medio”
Acento
El acento desempeña un papel fundamental a la hora de definir la identidad regional, cultural y emocional de una voz. Si tu proyecto depende de un sonido auténtico, ya sea realista o estilizado para un personaje, es esencial ser claro e intencionado sobre el acento deseado.
La elección de las palabras importa: ciertos términos suelen producir resultados más consistentes. Por ejemplo, “marcado” suele dar mejores resultados que “fuerte” al describir lo pronunciado que debe ser un acento. Hay mucho margen para probar y equivocarse, y te animamos a experimentar con la redacción y a ser tan creativo y descriptivo como sea posible.
Ten cuidado al usar la palabra “acento”: si te refieres a patrones de entonación o énfasis en lugar de a un dialecto regional, usa esos términos. Usar “acento” cuando te refieres a la entonación puede provocar cambios de dialecto no deseados.
- Ejemplos de prompts de acento claros:
- “Un hombre de mediana edad con un marcado acento francés”
- “Una mujer joven con un ligero deje sureño”
- “Un hombre mayor con un fuerte acento de Europa del Este”
- “Una mujer alegre que habla con un nítido acento británico”
- “Un hombre joven con una suave cadencia irlandesa”
- “Una voz autoritaria con un acento estadounidense neutro”
- “Un hombre con un acento regional australiano, relajado y nasal”
Evita descriptores demasiado imprecisos como “extranjero” o “exótico”: no son precisos y pueden producir resultados inconsistentes.
Combina el acento con otros rasgos, como el tono, la edad o el ritmo, para tener un mayor control. Por ejemplo: “Una anciana sarcástica con un marcado acento neoyorquino, que habla despacio”.
Para voces de fantasía o ficción, puedes sugerir acentos del mundo real como inspiración:
- “Un elfo con un marcado acento británico. Es regio y lírico”.
- “Un goblin con un áspero acento de Europa del Este”.
Ritmo
El ritmo se refiere a la velocidad y la cadencia con la que habla una voz. Es un componente clave para definir la personalidad, el tono emocional y la claridad de la voz. Ser explícito sobre el ritmo es esencial, especialmente al diseñar voces para casos de uso específicos como narración, publicidad, diálogos de personajes o contenido formativo.
Usa un lenguaje claro para describir lo rápido o despacio que debe hablar la voz. También puedes describir cómo se percibe el ritmo: si es constante, irregular, deliberado o ligero. Si el ritmo cambia, asegúrate de indicar dónde y por qué.
Ejemplos de descriptores de ritmo:
- “Hablando rápido” / “a un ritmo rápido”
- “A un ritmo normal” / “hablando con normalidad”
- “Hablando despacio” / “con un ritmo lento”
- “Ritmo deliberado y medido”
- “Pausado, como si saboreara cada palabra”
- “Con una cadencia apresurada, como si tuviera prisa”
- “Ritmo relajado y conversacional”
- “Rítmico y musical”
- “Ritmo irregular, con pausas y acelerones bruscos”
- “Ritmo uniforme, con intervalos constantes entre palabras”
- “Entonación entrecortada”
Texto de previsualización
Una vez que hayas escrito un buen prompt de voz, el texto que uses para previsualizar esa voz desempeña un papel crucial a la hora de definir cómo sonará realmente. El texto de previsualización actúa como un guion de interpretación: establece el tono, el ritmo y la expresión emocional que la voz intentará reproducir.
Para obtener los mejores resultados, el texto de previsualización debe complementar la descripción de la voz, no contradecirla. Por ejemplo, si tu prompt describe una “voz femenina joven, tranquila y reflexiva con un ligero acento japonés”, usar una frase como “¡Eh! ¡¡¡No soporto lo que has hecho con el maldito sitio!!!” chocará con esa intención. El modelo intentará reconciliar esa discrepancia, lo que a menudo dará lugar a resultados poco naturales o inconsistentes.
En su lugar, usa un texto de ejemplo que refleje la personalidad y el tono emocional previstos para la voz. Para el ejemplo anterior, algo como “Últimamente todo ha estado tranquilo… He tenido tiempo para pensar, y quizá era lo que más necesitaba” respalda el prompt y ayuda a generar una voz más natural y coherente.
Además, hemos comprobado que los textos de previsualización más largos suelen producir resultados más estables y expresivos. Las frases cortas a veces pueden sonar abruptas o inconsistentes, especialmente al probar cualidades sutiles como el tono o el ritmo. Darle más contexto al modelo, una frase completa o incluso un párrafo breve, le permite ofrecer una representación más fluida y precisa de la voz.
Parámetros
Volumen
Controla el volumen de la generación de Texto de previsualización y, en última instancia, de la voz una vez guardada.
Escala de orientación
Determina en qué medida se sigue el Prompt. Los valores más altos se ajustarán más estrictamente al prompt, pero podrían dar lugar a una peor calidad de audio si el prompt es muy de nicho, mientras que los valores más bajos permitirán al modelo ser más creativo a costa de la precisión del prompt. Usa un valor más bajo si, en general, la interpretación y la calidad de audio son más importantes que ajustarse perfectamente al prompt. Se recomiendan valores altos cuando la precisión del acento o el tono es de máxima importancia.
Atributos y ejemplos
Experimenta con la forma de redactar estos descriptores. Por ejemplo, “Calidad de audio perfecta” también puede escribirse como “la calidad de audio es perfecta”. ¡A veces pueden producir resultados diferentes!