Diseño de voz

Guía para crear voces a partir de un prompt de texto.

Diseño de voz

Descripción general

Diseño de voz ayuda a creadores a cubrir las necesidades cuando la voz exacta que buscan no está disponible en la Biblioteca de voces. Si no encuentras una voz adecuada para tu proyecto, puedes crearla. Diseño de voz es ideal para explorar e iterar rápidamente, y la calidad del resultado puede variar según el prompt y el caso de uso. Si necesitas la mayor calidad posible, lista para producción y consistente, los clones de voz profesionales (PVC) son actualmente las voces de mayor calidad de nuestra plataforma. Por tanto, si hay un PVC disponible en nuestra biblioteca que se ajuste a tus necesidades, te recomendamos usarlo.

Puedes encontrar Diseño de voz en Voices -> My Voices -> Add a new voice -> Voice Design en la app de ElevenLabs o mediante la API.

Al pulsar generar, crearemos tres opciones de voz para ti. El único coste de usar Diseño de voz es el número de créditos necesarios para generar el texto de vista previa, que solo se cobra una vez aunque generemos tres muestras. Puedes ver el número de caracteres que se descontarán en el cuadro de texto «Text to preview».

Después de generar las voces, podrás seleccionar y guardar una de ellas, que ocupará una de tus plazas de voz.

Guía de prompting

El prompt es la base de tu voz. Indica al modelo qué tipo de voz intentas crear: desde el acento y el tipo de personaje hasta el género y la personalidad de la voz. Un prompt bien elaborado puede marcar la diferencia entre una voz genérica y otra que encaje de verdad con tu visión. En general, los prompts más descriptivos y detallados suelen ofrecer resultados más precisos y matizados. Cuantos más detalles proporciones —incluidos edad, género, tono, acento, ritmo, emoción, estilo y más—, mejor podrá el modelo interpretar y generar una voz que resulte intencionada y personalizada.

Sin embargo, los prompts cortos y sencillos también pueden funcionar a veces, especialmente si buscas una voz más neutra o de uso general. Por ejemplo, «Un narrador masculino tranquilo» puede darte exactamente lo que necesitas sin entrar en detalles, sobre todo si no intentas crear un personaje o estilo muy específico. El nivel de detalle adecuado depende de tu caso de uso. ¿Estás creando un personaje de fantasía? ¿Un asistente virtual? ¿Una neoyorquina de unos 60 años, cansada y con un sentido del humor seco? Cuanto más claramente lo definas en tu prompt, más se acercará el resultado a lo que imaginas.

Formato de prompt recomendado

Para obtener resultados consistentes, estructura tu prompt con este formato:

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Ejemplo:

Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.

Errores habituales que debes evitar

  • No uses «acento» cuando te refieras a la entonación: puede provocar cambios de dialecto no deseados. Describe en su lugar los patrones de entonación, énfasis o entonación.
  • Evita palabras de efectos: términos como «reverb», «echo», «phone» o «tape» pueden afectar negativamente a la calidad del resultado.
  • Indica claramente el idioma y el dialecto: especifica siempre el idioma y la variante regional en la primera frase para evitar desviaciones.

Calidad de audio

La calidad de audio se refiere a la claridad, limpieza y fidelidad general de la voz generada. Por defecto, ElevenLabs busca producir audio limpio y natural, pero si tu proyecto requiere un nivel de calidad específico, lo mejor es incluirlo explícitamente en el prompt.

Para obtener resultados de alta calidad, puedes ayudar al modelo añadiendo una frase como “calidad de audio perfecta” o “grabación con calidad de estudio” a la descripción de la voz. Esto ayuda a garantizar que la voz se genere con la máxima claridad, una distorsión mínima y un acabado pulido.

También puedes usar descriptores de calidad específicos que ofrecen resultados consistentes:

  • Calidad aceptable
  • Buena calidad
  • Muy buena calidad
  • Calidad excelente
  • Calidad de estudio
  • Calidad de emisión

Estos descriptores ayudan a lograr la máxima calidad de audio cuando se incluyen en el prompt.

Incluir este tipo de frases a veces puede reducir la precisión general del prompt si la voz es muy específica o de nicho.

También puede haber casos creativos en los que se busque una calidad de audio inferior, como al simular una llamada telefónica, una emisión de radio antigua o metraje encontrado. En esas situaciones, omite por completo los descriptores de calidad o incluye explícitamente frases como:

  • “Audio de baja fidelidad”
  • “Mala calidad de audio”
  • “Suena como un mensaje de voz”
  • “Apagado y distante, como en una grabadora de casetes antigua”

La posición de esta frase en el prompt es flexible: puede aparecer al principio o al final, y hemos comprobado que funciona bien en cualquiera de los dos lugares.

Edad, tono/timbre y género

Estas tres características son la base del diseño de voz, ya que definen la identidad general y la resonancia emocional de la voz. Cuantos más detalles proporciones, más fácil será para la IA producir una voz que encaje con tu visión creativa, tanto si estás creando un personaje creíble como elaborando un narrador cautivador o diseñando un asistente virtual.

Edad

Describir la edad percibida de la voz ayuda a definir su madurez, textura vocal y energía. Usa términos específicos para guiar a la IA hacia la cualidad vocal adecuada.

Descriptores útiles:

  • “Hombre adolescente” / “mujer adolescente”
  • “Adulto joven” / “veintitantos” / “principios de los 30”
  • “Hombre de mediana edad” / “mujer de unos 40 años”
  • “Hombre mayor” / “mujer mayor” / “hombre de unos 80 años”

Tono/timbre

Se refiere a la cualidad física de la voz, determinada por el tono, la resonancia y la textura vocal. Es distinto de la expresión emocional o la actitud.

Descriptores habituales de tono/timbre:

  • “Profundo” / “grave”
  • “Suave” / “rico”
  • “Áspero” / “ronco”
  • “Nasal” / “chillón”
  • “Aéreo” / “entrecortado”
  • “Potente” / “resonante”
  • “Ligero” / “fino”
  • “Cálido” / “meloso”
  • “Metálico” / “metalizado”

Género

El género suele influir en el tono, el cuerpo vocal y la presencia tonal, pero puedes ir más allá de categorías simples describiendo el sonido en lugar de la identidad.

Ejemplos:

  • “Una voz femenina grave y ronca”
  • “Una voz masculina profunda y resonante”
  • “Un género neutro: suave y de tono medio”

Acento

El acento desempeña un papel fundamental a la hora de definir la identidad regional, cultural y emocional de una voz. Si tu proyecto depende de un sonido auténtico, ya sea realista o estilizado para un personaje, es esencial ser claro e intencionado sobre el acento deseado.

La elección de las palabras importa: ciertos términos suelen producir resultados más consistentes. Por ejemplo, “marcado” suele dar mejores resultados que “fuerte” al describir lo pronunciado que debe ser un acento. Hay mucho margen para probar y equivocarse, y te animamos a experimentar con la redacción y a ser tan creativo y descriptivo como sea posible.

Ten cuidado al usar la palabra “acento”: si te refieres a patrones de entonación o énfasis en lugar de a un dialecto regional, usa esos términos. Usar “acento” cuando te refieres a la entonación puede provocar cambios de dialecto no deseados.

  • Ejemplos de prompts de acento claros:
    • “Un hombre de mediana edad con un marcado acento francés”
    • “Una mujer joven con un ligero deje sureño”
    • “Un hombre mayor con un fuerte acento de Europa del Este”
    • “Una mujer alegre que habla con un nítido acento británico”
    • “Un hombre joven con una suave cadencia irlandesa”
    • “Una voz autoritaria con un acento estadounidense neutro”
    • “Un hombre con un acento regional australiano, relajado y nasal”

Evita descriptores demasiado imprecisos como “extranjero” o “exótico”: no son precisos y pueden producir resultados inconsistentes.

Combina el acento con otros rasgos, como el tono, la edad o el ritmo, para tener un mayor control. Por ejemplo: “Una anciana sarcástica con un marcado acento neoyorquino, que habla despacio”.

Para voces de fantasía o ficción, puedes sugerir acentos del mundo real como inspiración:

  • “Un elfo con un marcado acento británico. Es regio y lírico”.
  • “Un goblin con un áspero acento de Europa del Este”.

Ritmo

El ritmo se refiere a la velocidad y la cadencia con la que habla una voz. Es un componente clave para definir la personalidad, el tono emocional y la claridad de la voz. Ser explícito sobre el ritmo es esencial, especialmente al diseñar voces para casos de uso específicos como narración, publicidad, diálogos de personajes o contenido formativo.

Usa un lenguaje claro para describir lo rápido o despacio que debe hablar la voz. También puedes describir cómo se percibe el ritmo: si es constante, irregular, deliberado o ligero. Si el ritmo cambia, asegúrate de indicar dónde y por qué.

Ejemplos de descriptores de ritmo:

  • “Hablando rápido” / “a un ritmo rápido”
  • “A un ritmo normal” / “hablando con normalidad”
  • “Hablando despacio” / “con un ritmo lento”
  • “Ritmo deliberado y medido”
  • “Pausado, como si saboreara cada palabra”
  • “Con una cadencia apresurada, como si tuviera prisa”
  • “Ritmo relajado y conversacional”
  • “Rítmico y musical”
  • “Ritmo irregular, con pausas y acelerones bruscos”
  • “Ritmo uniforme, con intervalos constantes entre palabras”
  • “Entonación entrecortada”

Texto de previsualización

Una vez que hayas escrito un buen prompt de voz, el texto que uses para previsualizar esa voz desempeña un papel crucial a la hora de definir cómo sonará realmente. El texto de previsualización actúa como un guion de interpretación: establece el tono, el ritmo y la expresión emocional que la voz intentará reproducir.

Para obtener los mejores resultados, el texto de previsualización debe complementar la descripción de la voz, no contradecirla. Por ejemplo, si tu prompt describe una “voz femenina joven, tranquila y reflexiva con un ligero acento japonés”, usar una frase como “¡Eh! ¡¡¡No soporto lo que has hecho con el maldito sitio!!!” chocará con esa intención. El modelo intentará reconciliar esa discrepancia, lo que a menudo dará lugar a resultados poco naturales o inconsistentes.

En su lugar, usa un texto de ejemplo que refleje la personalidad y el tono emocional previstos para la voz. Para el ejemplo anterior, algo como “Últimamente todo ha estado tranquilo… He tenido tiempo para pensar, y quizá era lo que más necesitaba” respalda el prompt y ayuda a generar una voz más natural y coherente.

Además, hemos comprobado que los textos de previsualización más largos suelen producir resultados más estables y expresivos. Las frases cortas a veces pueden sonar abruptas o inconsistentes, especialmente al probar cualidades sutiles como el tono o el ritmo. Darle más contexto al modelo, una frase completa o incluso un párrafo breve, le permite ofrecer una representación más fluida y precisa de la voz.

Parámetros

Volumen

Controla el volumen de la generación de Texto de previsualización y, en última instancia, de la voz una vez guardada.

Escala de orientación

Determina en qué medida se sigue el Prompt. Los valores más altos se ajustarán más estrictamente al prompt, pero podrían dar lugar a una peor calidad de audio si el prompt es muy de nicho, mientras que los valores más bajos permitirán al modelo ser más creativo a costa de la precisión del prompt. Usa un valor más bajo si, en general, la interpretación y la calidad de audio son más importantes que ajustarse perfectamente al prompt. Se recomiendan valores altos cuando la precisión del acento o el tono es de máxima importancia.

Atributos y ejemplos

Experimenta con la forma de redactar estos descriptores. Por ejemplo, “Calidad de audio perfecta” también puede escribirse como “la calidad de audio es perfecta”. ¡A veces pueden producir resultados diferentes!

AtributoEjemplos
EdadJoven, más joven, adulto, mayor, anciano, en sus 40
Acentoacento escocés “marcado”, acento asiático-estadounidense “ligero”, acento del sur de Estados Unidos
GéneroMasculino, femenino, género neutro, género ambiguo
Tono/timbre/alturaProfundo, cálido, áspero, suave, chillón, aterciopelado, ronco, nasal, gutural, duro, robótico, etéreo
RitmoCadencia normal, ritmo rápido, rápidamente, despacio, pausado, ritmo tranquilo, ritmo natural/conversacional
Calidad de audioCalidad de audio perfecta, la calidad de audio es ‘aceptable’, mala calidad de audio
Personaje / ProfesiónPirata, empresario, granjero, político, terapeuta, ogro, ser divino, locutor de televisión
EmociónEnérgico, emocionado, triste, emotivo, sarcástico, seco
AlturaGrave, agudo, altura normal

Ejemplos de prompts y vistas previas de texto

Tipo de vozPrompt/DescripciónVista previa del textoEscala de guía
Comentarista deportivaUna comentarista deportiva enérgica con un marcado acento británico que narra apasionadamente jugada a jugada un partido de fútbol a un ritmo muy rápido. Su voz es viva, entusiasta y está completamente inmersa en la acción.¡MADRE MÍA, QUÉ GOL! Recoge el balón justo después del centro del campo, se va de DOS defensas como si ni siquiera estuvieran AHÍ, ¡y la clava de lleno en la escuadra! ¡El portero NO TENÍA NINGUNA OPCIÓN! ¡Eso es de NIVEL MUNDIAL por parte de la joven delantera, y el público está EN PIE! ¡Este partido ha COBRADO VIDA, y puedes SENTIR cómo CAMBIA la dinámica!25%
Sargento instructorUn sargento instructor del ejército que grita a su equipo de soldados. Suena enfadado y habla a un ritmo rápido.¡ATENTOS, panda de inútiles! No he venido aquí a hacer de niñera; ¡he venido a FORMAR SOLDADOS! ¡Os movéis cuando digo que os mováis y respiréis cuando digo que respiréis! ¡Tenéis diez segundos para formar filas o os vais a arrepentir!25%
Ogro malvadoUn enorme ogro malvado que habla a un ritmo rápido. Tiene un tono ridículo y resonante.”Vuestras armas no son más que palillos para mí. [laughs] Rendíos ahora y puede que os conceda un final rápido. He derribado reinos y devorado ejércitos. ¿Qué esperanza tenéis contra mí?“30%
Emprendedor británico cercanoAudio de excelente calidad. Un hombre de entre 30 y poco más de 40 años con un marcado acento británico que habla a un ritmo natural, como si estuviera hablando con un amigo.[laughs] Mira, esa es la cuestión. TÚ ves una empresa, mientras que yo veo… [lip smacks] veo una promesa, ¿sabes a lo que me refiero? [exhales] No construimos solo para obtener beneficios, construimos para, para ELEVAR A LOS DEMÁS. Si nuestra tecnología no deja el mundo más amable, más inteligente y más conectado de lo que lo encontramos… [sighs] ¿entonces qué estamos haciendo aquí?40%
Mujer sureñaUna mujer mayor con un marcado acento sureño. Es dulce y sarcástica.”Bueno, cariño, si lo único que hacemos es perseguir títulos y trofeos, nos vamos a perder lo importante. [light chuckle] Prefiero crear algo que facilite la vida de la gente, y si puedo hacerlo con tacones, una sonrisa y un toque de descaro, mucho mejor.”35%
Voz de tráiler de cineVoz dramática, utilizada para generar expectación en tráileres de cine, normalmente asociada a películas de acción o suspense”En un mundo al borde del caos, un héroe se alzará. Prepárate para una historia de proporciones épicas, próximamente en la gran pantalla.”20%
Ratón chillónUn ratoncito adorable y chillón”Puede que sea pequeño, ¡pero mi actitud no lo es en absoluto! [giggles] Ten cuidado, pies grandes, ¡o te daré un mordisquito en los dedos que no olvidarás!“20%
Pirata enfadadoUn viejo pirata enfadado, ruidoso y estruendoso”He enfrentado tormentas que te dejarían el pelo blanco y monstruos marinos que te harían temblar las rodillas. ¿Crees que puedes traicionar al capitán Blackheart y vivir para contarlo?“30%
NeoyorquinoMarcado acento neoyorquino grave y ronco, duro y curtido por la vida, a menudo cínico”Llevo caminando por estas calles más tiempo del que puedas imaginar, chaval. Ya no hay nada que puedas decir o hacer que me sorprenda.”40%
Agente de soporte en españolEspañol nativo, español europeo (sin rasgos de español latinoamericano). Mujer, 35–40 años. Calidad aceptable. Personalidad: operadora de soporte de confianza. Emoción: tranquilizadora, atenta, segura.Timbre suave y natural con entonación delicada, proximidad cercana y señal sin ruido. Comunica actualizaciones a un ritmo relajado, enfatizando claramente la información útil y transmitiendo empatía y profesionalidad.30%
Atención al cliente en árabeÁrabe nativo, con una ligera influencia del acento del Golfo (EAU). Mujer, 30–40 años. Calidad excelente. Personalidad: agente profesional de atención al cliente. Emoción: cálida, segura, educada.Timbre aterciopelado con tono tranquilo, ritmo medido y entonación delicada, manteniendo proximidad al micrófono para una señal de alta fidelidad y sin artefactos. Presencia clara y énfasis suave en frases orientadas al cliente para facilitar la comprensión.35%
Narrador creativo polacoPolaco nativo. Hombre, 48–58 años. Calidad excelente. Personalidad: soñador creativo. Emoción: curioso, delicado, acogedor.La voz es suave y sin artefactos, con una textura cálida y atractiva y un ritmo constante, emitida con proximidad natural. Una entonación brillante y un énfasis preciso guían al oyente a través de la narración.32%
Científico locoLa voz de un genio científico excéntrico con patrones de habla rápidos y erráticos que se aceleran con la emoción. Su acento con matices alemanes se vuelve más pronunciado cuando se agita. El tono varía mucho, desde murmullos reflexivos hasta exclamaciones maníacas, con frecuentes estallidos de risa maniática.”¡Soy el doctor Heinrich, un genio revolucionario rechazado por el estrecho establishment científico! ¡Bah! Llamaron imposibles a mis teorías, poco éticos a mis métodos… pero ¿quién se ríe ahora? (risa maniática) ¡Durante veinte años he perfeccionado mi creación en este laboratorio de montaña, aprovechando energías que superan la comprensión mortal! Los necios de la academia lamentarán sus burlas cuando mi desestabilizador cuántico revele el multiverso. O quizá nuevas formas de vida… el experimento tiene ciertas variables impredecibles… ¡FASCINANTES!“38%

Preguntas frecuentes

Diseño de Voz te permite crear una voz única a partir de un prompt de texto.

Está diseñado para ayudarte cuando no encuentras la voz exacta que necesitas en nuestra Biblioteca de voces. En lugar de elegir entre opciones existentes, ahora puedes generar una voz personalizada describiéndola con tus propias palabras.

Para empezar, solo tienes que escribir un prompt que describa la voz que quieres. Puedes incluir detalles como el acento, el género, el ritmo, el tono y el estilo de habla. Cuanto más específico sea tu prompt, más se ajustará la voz a lo que buscas. Pero, si no lo tienes claro, también funciona un prompt sencillo como “un narrador masculino tranquilo”.

Las voces creadas con Diseño de Voz funcionan con Eleven v4, nuestro modelo más reciente, y con modelos anteriores, incluido Eleven v3. Admiten etiquetas de audio. En Eleven v4 pueden ser menos interpretativas que en modelos anteriores.

Para más consejos sobre cómo escribir prompts eficaces, consulta nuestra guía de Diseño de Voz.

Nota: Diseño de Voz sigue siendo experimental. Los Clones de Voz Profesionales ofrecen la máxima calidad y consistencia. Si encuentras un PVC que se adapte a tus necesidades, te recomendamos usarlo. Los Clones de Voz Profesionales son totalmente compatibles con Eleven v4. No están totalmente optimizados para Eleven v3.

Diseño de Voz puede generar una amplia variedad de voces, desde voces realistas y similares a las humanas hasta voces más creativas, de estilo personaje.

Si no sabes por dónde empezar, prueba un prompt sencillo como “locutora de noticias de mediana edad”. Sin embargo, los prompts más detallados suelen producir resultados más precisos y matizados.

Puedes incluir diversas características en tu prompt, como:

  • edad
  • género
  • acento
  • tono
  • ritmo
  • emoción
  • estilo de habla
  • calidad de audio

Dos controles adicionales ayudan a definir el resultado:

  • Volumen ajusta el volumen tanto de la vista previa como de la voz guardada.
  • Escala de orientación determina hasta qué punto la voz generada sigue tu prompt.

Para obtener más ayuda para crear prompts, consulta nuestra guía de Diseño de Voz.

Diseño de Voz solo consume créditos cuando generas voces.

Cada vez que haces clic en Generar voz, creamos tres opciones de voz basadas en tu prompt. Se te cobra según el número de caracteres de tu texto de vista previa.

Puedes introducir tu propio texto de vista previa o usar el botón Generar automáticamente para crear uno automáticamente. Las vistas previas generadas automáticamente incluyen etiquetas de audio relevantes.

Para obtener más información, consulta nuestra guía de Diseño de Voz.

No results