For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
La tecnología Texto a Voz de ElevenLabs es fundamental en nuestra oferta y permite generar voz con IA de alta calidad para diversas aplicaciones en todo el mundo. Es probable que ya hayas oído nuestras voces en acción, creando experiencias de audio naturales.
Empezar a generar tu primer audio con Texto a Voz es muy sencillo. Sin embargo, para sacar el máximo partido a esta función, hay algunas cosas que debes tener en cuenta.
Haz clic en el botón «Generar» para crear tu archivo de audio.
Ajustes
Familiarízate con las voces, los modelos y los ajustes para crear voz de alta calidad.
Los ajustes que utilizas, especialmente la voz y el modelo, influyen significativamente en el resultado. Es muy importante que te familiarices con ellos y entiendas algunas prácticas recomendadas. Aunque otros ajustes también influyen en el resultado, su impacto es menor en comparación con la voz y el modelo que elijas.
El orden de importancia es el siguiente: la selección de la voz es lo más importante, seguida de la selección del modelo y, después, los ajustes del modelo. Todos ellos, así como su combinación, influirán en el resultado.
Voces
Voces
Ofrecemos muchos tipos de voces, incluidas las cuidadas Voces predeterminadas, nuestra amplia Biblioteca de voces with casi cualquier voz que puedas imaginar, voces totalmente sintéticas creadas con nuestra herramienta Diseño de voz, y también puedes crear tu propia colección de voces clonadas con nuestras dos tecnologías: Clonación instantánea de voz y Clonación profesional de voz.
No todas las voces son iguales y mucho depende del audio de origen utilizado para crearlas. Algunas voces ofrecerán una interpretación y entonación mejores y más humanas, mientras que otras serán más estables.
Elegir la voz adecuada para tu contenido concreto es fundamental. Probablemente sea la decisión más importante y la que tendrá mayor impacto en el resultado final. Determina el género, el tono, el acento, la cadencia y la entonación. Merece la pena dedicar más tiempo a seleccionar la voz perfecta y probarla correctamente para asegurarte de que es coherente y cumple tus expectativas.
Para generar voz en un idioma concreto, obtendrás los mejores resultados usando una voz nativa de la Biblioteca de voces o clonando una voz que hable ese idioma con el acento correcto. Aunque técnicamente cualquier voz puede hablar cualquier idioma, conservará su acento original. Por ejemplo, usar una voz nativa inglesa para generar voz en francés probablemente dará como resultado un audio en francés, pero con acento inglés, ya que la IA debe generalizar cómo sonaría esa voz en un idioma con el que no se entrenó.
Si tienes una voz que te gusta, pero quieres una entonación diferente, nuestra herramienta de remezcla de voz puede ayudarte. Te permite usar prompts en lenguaje natural para cambiar la entonación, la cadencia, el tono, el género e incluso los acentos de una voz. Al cambiar acentos, la voz de base y el acento de destino son muy importantes. Los resultados pueden variar: a veces funciona perfectamente y otras puede requerir varios intentos.
Puedes conseguir resultados muy buenos con la remezcla de voz, pero normalmente no serán tan buenos como los de un clon de voz profesional correctamente creado. Se acercarán más a los de un clon de voz instantáneo.
Ten en cuenta que la remezcla de voz solo funciona con voces específicas. Por ejemplo, no puedes remezclar voces de la Biblioteca de voces; solo puedes remezclar voces que hayas creado tú o las voces predeterminadas.
Modelos
Modelos
Ofrecemos dos familias de modelos: modelos Standard (alta calidad) y modelos Flash, optimizados para una latencia extremadamente baja. La mayoría de las familias incluyen versiones solo en inglés y multilingües.
Eleven v4 es nuestro modelo más reciente. Está disponible en dos variantes: Eleven v4 y Eleven v4 Turbo.
La selección del modelo es el segundo factor con mayor influencia en el resultado de audio final, justo después de la selección de voz. Te recomendamos dedicar un momento a probar los distintos modelos con la voz que hayas elegido para encontrar la combinación que mejor encaje. Todos nuestros modelos tienen puntos fuertes y débiles, y funcionan mejor con unas voces que con otras, por lo que es importante encontrar una buena combinación.
Si tu resultado será exclusivamente en inglés, te recomendamos encarecidamente usar uno de nuestros modelos solo en inglés. Suelen ser más fáciles de usar, más estables y, en general, ofrecen un rendimiento superior para contenido únicamente en inglés. Si tu contenido estará en otro idioma o puede ser multilingüe, debes usar uno de los modelos multilingües.
Lo más habitual es configurar la estabilidad en torno a 50, la similitud en torno a 75 y mantener el estilo en 0, con cambios mínimos a partir de ahí. Por supuesto, todo depende de la voz original y del estilo de interpretación que buscas.
Es importante tener en cuenta que la IA no es determinista; ajustar los controles deslizantes a valores específicos no garantiza los mismos resultados cada vez. En su lugar, los controles funcionan más bien como un intervalo y determinan cuánto puede variar la aleatoriedad entre cada generación.
Velocidad
El ajuste de velocidad te permite acelerar o ralentizar la voz generada. El valor predeterminado es 1.0, lo que significa que la velocidad no se ajusta. Los valores inferiores a 1.0 ralentizarán la voz, hasta un mínimo de 0.7. Los valores superiores a 1.0 acelerarán la voz, hasta un máximo de 1.2. Los valores extremos pueden afectar a la calidad de la voz generada.
La velocidad no está disponible para el modelo Eleven v3.
Estabilidad
El control deslizante de estabilidad determina lo estable que es la voz y la aleatoriedad entre cada generación. Reducir este control introduce una gama emocional más amplia en la voz. Como hemos mencionado antes, esto también depende en gran medida de la voz original. Ajustar el control demasiado bajo puede dar lugar a interpretaciones extrañas, excesivamente aleatorias, y hacer que el personaje hable demasiado rápido. Por otro lado, ajustarlo demasiado alto puede dar lugar a una voz monótona y con poca emoción.
Para una interpretación más viva y dramática, se recomienda ajustar el control de estabilidad a un valor más bajo y generar unas cuantas veces hasta encontrar una interpretación que te guste.
Por otro lado, si quieres una interpretación más seria, incluso cercana a la monotonía con valores muy altos, se recomienda ajustar el control de estabilidad a un valor más alto. Como el resultado es más coherente y estable, normalmente no necesitas generar tantas muestras para conseguir el resultado deseado. Experimenta para descubrir qué te funciona mejor.
Similitud
El control deslizante de similitud determina hasta qué punto debe ajustarse la IA a la voz original al intentar replicarla. Si el audio original es de mala calidad y el control de similitud se ajusta demasiado alto, la IA puede reproducir artefactos o ruido de fondo al intentar imitar la voz, si estaban presentes en la grabación original.
La similitud no está disponible para el modelo Eleven v3.
Exageración del estilo
Con la introducción de los modelos más recientes, también añadimos un ajuste de exageración del estilo. Este ajuste intenta amplificar el estilo del hablante original. Consume recursos computacionales adicionales y puede aumentar la latencia si se ajusta a cualquier valor distinto de 0. Es importante tener en cuenta que este ajuste puede hacer que el modelo sea ligeramente menos estable, ya que busca enfatizar e imitar el estilo de la voz original.
En general, recomendamos mantener este ajuste en 0 en todo momento.
Mejora del hablante
Este ajuste aumenta la similitud con el hablante original. Sin embargo, utilizarlo requiere una carga computacional ligeramente mayor, lo que a su vez aumenta la latencia. Las diferencias que introduce este ajuste suelen ser bastante sutiles.
La mejora del hablante no está disponible para el modelo Eleven v3.
Generar
Una vez que hayas seleccionado la voz, elegido un modelo y configurado los ajustes, el proceso de generación es sencillo: introduces texto, pulsas “Generar voz” y se genera el audio.
Aunque el proceso es muy sencillo en apariencia, el texto que introduces es extremadamente importante para conseguir el resultado deseado. Al usar palabras que podrían estar “fuera de distribución”, es decir, elementos que la IA apenas encontró durante el entrenamiento, como nombres extraños, abreviaturas poco habituales, símbolos o incluso emojis, puedes confundir a la IA y hacer que el resultado sea más inestable. Los emojis y ciertos símbolos son especialmente difíciles de interpretar correctamente para la IA.
Al utilizar Texto a Voz desde la interfaz, aplicamos un paso de normalización automatizado a lo que introduces para mejorar la legibilidad del texto y facilitar su procesamiento por parte de la IA. Por lo general, este paso convierte los símbolos y números en texto escrito, lo que indica a la IA la pronunciación correcta.
Una práctica recomendada que aconsejamos encarecidamente es evitar escribir números como dígitos o usar símbolos, especialmente al utilizar modelos multilingües, aunque también se aplica a los modelos solo en inglés. Como los números y símbolos se escriben igual en muchos idiomas, pero se pronuncian de forma diferente, depender de los dígitos genera ambigüedad para la IA. Por ejemplo, el número “1” se escribe de la misma forma en inglés y en muchos otros idiomas, pero se pronuncia de forma diferente. Escribir el número con palabras, como “uno”, elimina la necesidad de que la IA interprete qué debe hacer.
Estamos trabajando en workflows más avanzados que te permitan influir en la entonación y la interpretación de la IA mediante lo que llamamos Etiquetas de audio. Esta función está disponible en Eleven v4 y Eleven v3. Si te interesa saber más sobre esta función, te recomendamos leer nuestra guía de prompting.
Preguntas frecuentes
Una buena entrada da un buen resultado
El primer factor, y uno de los más importantes, es que una entrada buena, de alta calidad y consistente dará como resultado una salida buena, de alta calidad y consistente.
Si proporcionas a la IA audio que no es óptimo —por ejemplo, audio con mucho ruido, reverberación en una voz clara, varios hablantes o inconsistencias en el volumen, la interpretación o la entonación—, la IA será más inestable y el resultado, más impredecible.
Si tienes pensado clonar tu propia voz, te recomendamos encarecidamente que consultes las directrices de la documentación para crear clones de voz adecuados, ya que así tendrás la mejor base posible para empezar. Aunque solo quieras usar Clones de Voz Instantáneos, también es aconsejable leer la sección sobre Clonación de Voz Profesional. Esta sección contiene información valiosa sobre cómo crear clones de voz, aunque los requisitos para estas dos tecnologías sean ligeramente distintos.
Usa la voz adecuada
El segundo factor que debes tener en cuenta es que la voz que elijas tendrá un efecto enorme en el resultado. Como se mencionó en el primer factor, no solo es extremadamente importante la calidad y consistencia de las muestras utilizadas para crear ese clon concreto, sino también el idioma y la tonalidad de la voz.
Si quieres una voz que suene feliz y alegre, deberías usar una voz clonada a partir de muestras felices y alegres. Por el contrario, si buscas una voz que suene introspectiva y melancólica, deberías seleccionar una voz con esas características.
Sin embargo, también es fundamental usar una voz entrenada en el idioma correcto. Por ejemplo, todos los clones de voz profesionales que ofrecemos como voces predeterminadas son voces en inglés y se han entrenado con muestras en inglés. Por tanto, si las haces hablar otros idiomas, su rendimiento en esos idiomas puede ser impredecible. Es esencial usar una voz clonada a partir de muestras en las que la persona hablaba el idioma que quieres que hable después la IA.
Usa un formato adecuado
Puede parecer algo trivial, pero puede marcar una gran diferencia. La IA intenta entender cómo leer algo basándose en el contexto del propio texto, lo que incluye no solo las palabras utilizadas, sino también cómo se combinan, cómo se aplica la puntuación, la gramática y el formato general del texto.
Esto puede tener una influencia pequeña pero importante en la entonación de la IA. Si escribes mal una palabra, la IA no la corregirá e intentará leerla tal como está escrita.
No determinista
La configuración de la IA no es determinista, lo que significa que incluso con las mismas condiciones iniciales (voz, configuración, modelo), te dará resultados ligeramente distintos, igual que un actor de doblaje interpreta un texto de forma ligeramente diferente cada vez.
Esta variabilidad puede deberse a diversos factores, como las opciones mencionadas antes: voz, configuración y modelo. Por lo general, el alcance de esa variabilidad se puede controlar con el control deslizante de estabilidad. Un ajuste de estabilidad más bajo implica un mayor rango de variabilidad entre generaciones, pero también introduce variabilidad entre generaciones, con la que la IA puede interpretar de forma algo más expresiva.
Una mayor variabilidad suele ser deseable, ya que establecer una estabilidad demasiado alta puede hacer que determinadas voces suenen monótonas, pues no da a la IA el mismo margen para generar contenido más variable. Sin embargo, establecer una estabilidad demasiado baja también puede causar otros problemas que vuelven inestables las generaciones, especialmente con determinadas voces que podrían haber usado audio no óptimo durante el proceso de clonación.
El ajuste predeterminado de 50 suele ser un excelente punto de partida para la mayoría de aplicaciones.
¿Qué es Eleven v4?
Recomendamos cambiar a Eleven v4 y probarlo con tu propio contenido.
Eleven v4 es nuestro modelo de Texto a Voz más reciente y avanzado, y el primero de una nueva generación de modelos. Mejora la calidad del resultado, la precisión de la voz, la emoción, las etiquetas de audio y la cobertura de idiomas en comparación con Eleven v3.
La precisión al clonar voces da un gran salto con Eleven v4. Las voces clonadas capturan las características de la voz de origen —timbre, cadencia y entonación— con más fidelidad que con cualquier modelo anterior.
Los Clones de Voz Instantáneos (IVC) son más precisos que nunca en Eleven v4. Capturan con más fidelidad las características que definen una voz de origen, lo que facilita crear rápidamente un clon convincente a partir de una muestra de audio corta.
Los Clones de Voz Profesionales (PVC) son totalmente compatibles con Eleven v4. Se basan en los mismos avances en precisión de voz y ofrecen una reproducción más fiel de la voz de origen para workflows que requieren el máximo nivel de consistencia y control.
Eleven v4 incluye dos variantes para que puedas elegir el equilibrio adecuado entre calidad y velocidad según tu caso de uso:
Eleven v4 (eleven_v4) — nuestro modelo de máxima calidad, ideal para creación de contenido, audiolibros, locuciones de personajes y cualquier caso de uso en el que la calidad sea la máxima prioridad.
Eleven v4 Turbo (eleven_v4_turbo) — calidad extremadamente alta con una latencia impresionantemente baja, diseñado específicamente para casos de uso en tiempo real, como agentes conversacionales y experiencias de voz interactivas.
Ambas variantes usan dos ajustes de voz: estabilidad y similitud. Los controles de estilo y velocidad no están disponibles en Eleven v4, y SSML no es compatible.
Cuando el idioma que generas coincide con el idioma de tu voz de referencia, el acento original se conserva exactamente igual que antes. Cuando el idioma que generas es distinto del idioma de la voz de referencia, Eleven v4 genera voz fluida y natural en el idioma de destino, en lugar de conservar el acento de la voz de referencia de su idioma original.
Para obtener información sobre clonación, acentos, comparativas y la descripción completa, consulta Eleven v4. Para etiquetas y prompting, consulta Prompting para Eleven v4.
¿Qué es Eleven v3?
Recomendamos cambiar a Eleven
v4 y probarlo con tu propio contenido. Muchas de las técnicas de prompting para Eleven
v4 también se aplican a
Eleven v3.
Eleven v3 es un modelo de Texto a Voz expresivo y con una gran riqueza emocional. Genera voz natural y realista, con un amplio rango emocional y comprensión del contexto en más de 70 idiomas.
Eleven v3 ofrece:
Compatibilidad con etiquetas de audio
emociones: [sad][angry][happily]
indicaciones de entonación: [whispers][shouts]
reacciones no verbales: [laughs][clears throat][sighs]
Modo de diálogo para audio natural con varios hablantes
Compatibilidad con más de 70 idiomas
Este modelo funciona bien para conversaciones entre personajes, narración de audiolibros y diálogos emocionales.
Puedes generar contenido con v3 mediante la API usando nuestras rutas Create speech y Stream speech e indicando el ID de modelo eleven_v3.
También puedes usar nuestras rutas Create dialogue y Stream dialogue para crear un diálogo natural con varios hablantes.
Consulta los siguientes recursos para obtener más información:
El control de velocidad de voz está disponible para Texto a Voz mediante Síntesis de Voz, Studio, ElevenAgents y nuestra API.
Puedes controlar la velocidad de la voz con el ajuste Velocidad.
Los valores posibles van de 0,7 a 1,2. Los valores inferiores a 1 ralentizan el habla y los valores superiores a 1 la aceleran. Los valores extremos pueden afectar a la calidad del habla generada.
Este ajuste está disponible para todas las voces y todos los modelos. Lo encontrarás en los ajustes de voz.
Para saber cómo controlar el habla al usar la API, consulta nuestra referencia de la API.
¿Puedo usar la misma voz clonada/diseñada en distintos idiomas?
Cualquier voz puede hablar cualquiera de los idiomas compatibles.
El modelo actual funciona de modo que no seleccionas un idioma concreto, sino que escribes en el idioma que quieres que hable la IA y esta lo entiende automáticamente. Sin embargo, puede haber coincidencias entre distintos idiomas que usan palabras y vocabulario similares, pero con pronunciaciones y acentos muy diferentes. Por eso, debes usar una voz clonada a partir de alguien que hable el idioma con el acento correcto.
El idioma lo determina el texto, mientras que el acento y la pronunciación los determina la propia voz. Necesita ambos contextos para funcionar de forma óptima.
Estamos investigando nuevas tecnologías que faciliten la selección de idioma, pero la forma en que está construida la IA hace que todo esto siga en desarrollo.
¿Cómo descargo archivos generados desde Texto a Voz?
Puedes descargar los archivos generados de dos formas:
Puedes descargar un archivo generado inmediatamente haciendo clic en el botón de descarga situado abajo a la derecha después de generar el contenido.
Los archivos generados anteriormente se pueden descargar desde el historial.
Para acceder al historial, inicia sesión en tu cuenta y selecciona Texto a Voz en la barra lateral; después, haz clic en la pestaña del historial del panel situado a la derecha de la pantalla. En pantallas estrechas, puedes acceder al historial haciendo clic en el icono del historial situado encima del botón Generar voz.
Desde el historial, puedes hacer clic en el icono de descarga para ver la opción de descargar el archivo como MP3 (128 kbps) o WAV.
También puedes hacer clic en Avanzado para descargar en formatos de archivo adicionales:
MP3 (192 kbps)
MP3 (256 kbps)
M4A
FLAC
¿Podéis hacer que las voces produzcan el sonido de la respiración?
Sí. Con Eleven v4 y Eleven v3, puedes usar etiquetas de audio como [sighs] o [exhales] para añadir respiración y reacciones similares a la voz generada.
Consulta la guía de prompting para obtener más información sobre las etiquetas de audio y el control de la entonación.
¿Ofrecéis un modelo de IA para fines conversacionales o chatbots?
Nuestros modelos Flash y Turbo se han desarrollado especialmente para aplicaciones de baja latencia.
Flash v2 y Flash v2.5 son nuestros modelos de latencia ultrabaja, que generan audio en menos de 75 ms. Flash v2 solo está disponible en inglés, mientras que Flash v2.5 admite 32 idiomas. Puedes consultar una lista completa de todos los idiomas compatibles
aquí.
Nuestros modelos Turbo también son de baja latencia, pero como los modelos Flash ofrecen resultados muy similares, recomendamos usar Flash en lugar de Turbo. Turbo v2 solo está disponible en inglés, mientras que Turbo v2.5 admite 32 idiomas y es un 25 % más rápido que Turbo v2, generando audio en unos 300 ms.
Tanto Flash como Turbo son modelos muy optimizados, diseñados específicamente para aplicaciones de baja latencia sin sacrificar el rendimiento vocal y manteniendo el estándar de calidad que la gente espera de nuestros modelos.
Ambos modelos tienen descuento cuando generas mediante la API. Para más información, consulta los precios de la API.
También ofrecemos ElevenAgents, nuestra plataforma para implementar agentes de voz interactivos y personalizados. Visita nuestra documentación de ElevenAgents para obtener más información.
¿Cómo puedo añadir pausas?
Hay varias formas de introducir una pausa o interrupción e influir en el ritmo y la cadencia de la voz. El método que uses depende del modelo.
Etiquetas de audio (Eleven v4 y Eleven v3)
Con Eleven v4 y Eleven v3, usa etiquetas de audio y puntuación para controlar el ritmo y la entonación. Estos modelos no admiten etiquetas de pausa SSML.
Consulta la guía de prompting para saber cómo indicar pausas y controlar la entonación.
Etiquetas de pausa (Multilingual v2, Flash v2 y Flash v2.5)
La forma más consistente de añadir una pausa en Multilingual v2, Flash v2 y Flash v2.5 es con la sintaxis de etiqueta de pausa SSML <break time="1.5s" />. Esto crea una pausa exacta y natural en la voz. No se limita a insertar silencio entre palabras: el modelo entiende la sintaxis y añade una pausa natural.
La forma en que el modelo gestiona estas pausas puede variar. La voz utilizada desempeña un papel fundamental en el resultado. Algunas voces, entrenadas con algunos «eh» y «ah», pueden insertar esos gestos vocales durante las pausas, como lo haría una persona al hablar.
Un ejemplo sería:
“Dame un segundo para pensarlo.” <break time="1.0s" /> “Sí, funcionaría.”
El tiempo de pausa debe indicarse en segundos. La IA puede gestionar pausas de hasta 3 segundos y se puede usar en Texto a Voz y mediante la API.
Si utilizas un número excesivo de pausas SSML en el texto, podrías tener problemas. La voz podría acelerarse o el audio podría introducir más ruido y otros artefactos. Estamos trabajando para resolverlo.
Puntuación
Estas opciones son menos consistentes que las etiquetas de pausa o las etiquetas de audio, pero aun así pueden influir en el ritmo.
Un guion simple - o la raya — suelen funcionar bien. Puedes añadir varios guiones como -- -- para una pausa más larga.
“Se - está - haciendo tarde.”
Los puntos suspensivos ... a veces pueden añadir una pausa entre palabras, pero normalmente también transmiten cierta duda o nerviosismo en la voz, lo que no siempre encaja.
“Yo… sí, supongo que sí…”
¿Cómo puedo forzar una pronunciación concreta de una palabra o un nombre?
Eleven v3 incluye compatibilidad nativa con el Alfabeto Fonético Internacional (IPA). Consulta más información en IPA con Eleven v3.
Etiquetas de fonemas SSML (solo Flash v2 y Turbo v2)
En Flash v2 y Turbo v2, puedes forzar una pronunciación concreta con etiquetas de fonemas SSML. Admitimos tanto IPA como CMU. CMU suele ser algo más predecible y consistente con la implementación actual. Puedes obtener más información en nuestra guía de pronunciación.
Ortografías alternativas
Como alternativa, puedes buscar una ortografía distinta y escribir una palabra de forma más fonética. Puedes usar varios trucos, como mayúsculas, guiones, apóstrofos o incluso comillas simples alrededor de una letra o varias letras.
Por ejemplo, una palabra como “trapezii” podría escribirse “trapezIi” para enfatizar más la parte “ii” de la palabra.
¿Cómo funcionan las etiquetas de audio con Eleven v3 y v4?
Eleven v4 y Eleven v3 admiten etiquetas de audio. Te recomendamos Eleven v4. Escribe una instrucción breve entre corchetes y colócala en el texto donde deba cambiar la entonación. Las mismas etiquetas funcionan con ambos modelos.
Los archivos que has generado con Texto a Voz o Cambiador de Voz se pueden descargar como archivos MP3, WAV, M4A o FLAC. Los archivos WAV, M4A y FLAC deben descargarse desde el historial.
Cómo descargar archivos WAV
Selecciona Texto a Voz o Cambiador de Voz en la barra lateral; después, haz clic en la pestaña del historial del panel situado a la derecha de la pantalla. En pantallas estrechas, puedes acceder al historial haciendo clic en el icono del historial situado encima del botón Generar voz.
Desde el historial, puedes hacer clic en el icono de descarga para ver la opción de descargar el archivo como MP3 o WAV.
Cómo descargar archivos FLAC o M4A
Selecciona Texto a Voz o Cambiador de Voz en la barra lateral; después, haz clic en la pestaña del historial del panel situado a la derecha de la pantalla. En pantallas estrechas, puedes acceder al historial haciendo clic en el icono del historial situado encima del botón Generar voz.
Desde el historial, puedes hacer clic en el icono de descarga para ver la opción de descargar el archivo como MP3 o WAV. Para acceder a formatos de archivo adicionales, incluidos FLAC y M4A, haz clic en Avanzado y selecciona el formato que prefieras.
¿Cómo selecciono el idioma y el acento?
Idioma al generar desde la web
Cuando generas audio en el sitio web de ElevenLabs, nuestra IA detecta automáticamente el idioma según el contexto del texto de tu prompt. Por eso, es mejor evitar usar varios idiomas en un mismo prompt, ya que podría generar confusión sobre qué idioma debe utilizarse. De momento, no es posible especificar un idioma al generar desde la web.
Idioma al generar mediante la API
Si generas audio a través de la API, puedes especificar manualmente el idioma de tu prompt con el parámetro language_code. Es un parámetro opcional que acepta códigos de idioma ISO 639-1.
Puede resultar útil para prompts cortos o ambiguos, por ejemplo, cuando el texto solo incluye números. Especificar el idioma garantiza que el normalizador aplique las reglas correctas para ese idioma.
Para obtener más información sobre la normalización, consulta este artículo.
Acento
El acento utilizado en tu generación procede de la voz que estés usando. Si utilizas una voz que no se ha entrenado en el idioma que estás generando, podrías notar un ligero acento procedente del idioma original de la voz.
Para obtener los mejores resultados, recomendamos usar una voz entrenada con audio en el idioma que estás generando y con el acento que prefieras. Esto ayuda a la IA a entender con más precisión la pronunciación y la entonación.
Esto es especialmente importante para idiomas similares o que comparten muchas palabras. Elegir una voz entrenada en el idioma correcto garantiza que la IA use la pronunciación y el acento adecuados.
Puedes:
Crear una voz clonada con audio en el idioma y acento que prefieras.
Explorar la Biblioteca de voces y usar los filtros de búsqueda para encontrar voces adecuadas que
se adapten a tus necesidades.
¿Cuánto cuesta generar con Eleven v3 (Alpha)?
El coste de generar con Eleven v3 es de 1 crédito por carácter en el sitio web. Las generaciones mediante API tienen descuento; consulta los detalles en precios de la API.
Consulta los siguientes recursos para obtener más información:
Con Eleven v4 y Eleven v3, puedes usar etiquetas de audio como [laughs] para añadir risas y otras reacciones a la voz generada. Consulta la guía de prompting para obtener más información.
En otros modelos, la entonación emocional depende del contexto, la puntuación y los ajustes de voz. Consulta ¿Cómo producir emociones?.
¿Cómo generar emociones?
El modelo es sensible al contexto más amplio de cada enunciado: evalúa si algo tiene sentido según su relación con el texto anterior y posterior. Esta perspectiva global le permite entonar correctamente fragmentos más largos al aplicar un patrón emocional unificador a una línea de pensamiento que abarca varias frases.
Consejos para producir emociones:
El contexto es clave para generar emociones específicas. Si introduces texto divertido o con risas, podrías obtener un resultado alegre. Lo mismo ocurre con la ira, la tristeza y otras emociones: establecer el contexto es fundamental.
La puntuación y los ajustes de voz desempeñan el papel principal en la entonación del resultado.
Añade énfasis poniendo las palabras o frases relevantes entre comillas.
En la voz generada mediante una voz clonada, se reproduce el estilo de habla de las muestras que subes para la clonación. Si la voz de la muestra subida es monótona, el modelo tendrá dificultades para generar un resultado expresivo.
Con Eleven v4 y Eleven v3, también puedes usar etiquetas de audio para controlar más directamente la emoción y la entonación; por ejemplo, [happy], [sad], [angry], [whispers] y [laughs]. Consulta la guía de prompting para obtener más información.
Estos consejos ayudan a orientar la entonación emocional, pero no garantizan un resultado específico.
¿Hay alguna forma de previsualizar el audio sin gastar cuota antes de descargarlo?
Por desgracia, actualmente no ofrecemos la deducción al descargar como alternativa a la deducción al generar. Por ahora, no es posible previsualizar generaciones sin gastar cuota.
Cuando pulsas «Generar» en la web, se te descuentan créditos porque los servidores deben iniciarse y el audio debe generarse. No hay forma de probar o previsualizar una voz con tu propio texto sin usar créditos.
Permitimos dos regeneraciones gratuitas en Texto a Voz mediante la web en las siguientes circunstancias:
El prompt (para Texto a Voz) o archivo (para Cambiador de Voz), la voz y el modelo se mantienen iguales. Puedes cambiar los controles deslizantes de los ajustes de voz.
La primera generación se realizó hace menos de dos horas.
No has actualizado la página desde que generaste el audio original.
Si se cumple este caso, verás «Regenerar voz», y al pasar el cursor sobre el botón «Regenerar voz» se mostrará el número de regeneraciones gratuitas restantes:
Cuando hayas utilizado tus regeneraciones gratuitas, el botón volverá a mostrar «Generar voz» y se indicará el número de créditos que se usarán para la generación:
Las regeneraciones gratuitas solo están disponibles en Texto a Voz mediante la web. No están disponibles mediante la API.
Estamos estudiando cómo facilitar previsualizaciones con esta calidad sin aumentar precios ni costes. También estamos explorando formas de hacer que la IA sea más controlable, para que no tengas que previsualizar y obtengas el resultado deseado, esperamos que al primer intento.
¿Qué es el modo Diálogo?
Eleven v4 y Eleven v3 ofrecen el modo Diálogo, que te permite generar conversaciones dinámicas con varios interlocutores y un ritmo natural, capaces de gestionar interrupciones, cambios de tono y señales emocionales según el contexto de la conversación.
El modo Diálogo está disponible cuando usas varios interlocutores en el sitio web.
También puedes usar las rutas de la API Texto a Diálogo para generar interacciones con varios interlocutores. Para obtener más información, consulta nuestra documentación de la API:
Cualquier voz puede hablar cualquier idioma que actualmente admita la IA. Sin embargo, si no utilizas una voz nativa del idioma que quieres que hable la IA —por ejemplo, si usas una voz generada o una voz clonada que habla inglés—, la IA podría tener un ligero acento inglés o alternar entre idiomas similares.
Para consultar la lista completa de idiomas admitidos, revisa este artículo: ¿Qué idiomas admitís?
El modelo actual funciona de forma que no seleccionas un idioma concreto. En su lugar, escribes en el idioma que quieres que hable la IA y esta lo entiende automáticamente. Sin embargo, como puede haber coincidencias entre distintos idiomas que usan palabras y vocabulario similares, pero con pronunciaciones y acentos bastante diferentes, deberías usar una voz clonada a partir de alguien que hable el idioma con el acento correcto. Así te aseguras de que la IA tenga el máximo contexto sobre cómo pronunciar algo y en qué idioma.
El idioma lo determina el texto, mientras que el acento y la pronunciación los determina la
propia voz.
Estamos estudiando el desarrollo de nueva tecnología para facilitar la selección del idioma, pero la forma en que está construida la IA hace que todo ello siga en desarrollo.
¿Cuál es la cantidad máxima de caracteres y texto que puedo generar?
En Texto a Voz, desde la web, puedes generar hasta 5000 caracteres en una sola generación con cualquier plan de pago y hasta 2500 con todos los planes gratuitos.
Sin embargo, si planeas generar contenido largo de más de unos miles de caracteres, te recomendamos encarecidamente usar Studio, que te permite generar fácilmente contenido muy extenso, como libros y novelas. Puedes obtener más información aquí.
Si generas mediante la API, la longitud máxima de entrada varía según el modelo que utilices:
Texto a Voz
Flash v2.5: hasta 40 000 caracteres (~40 minutos de audio)
Turbo v2.5: hasta 40 000 caracteres (~40 minutos de audio)
Flash v2: hasta 30 000 caracteres (~30 minutos de audio)
Turbo v2: hasta 30 000 caracteres (~30 minutos de audio)
Multilingual v2: hasta 10 000 caracteres (~10 minutos de audio)
Cambiador de Voz
Multilingual v2: hasta 10 minutos de audio
¿Qué voces de la biblioteca de voces son nativas de un idioma concreto?
Todas las voces prediseñadas y generadas son en inglés. Esto significa que podrían no tener el acento o la pronunciación correctos al hablar en otros idiomas.
En la biblioteca de voces, dentro de la categoría profesional, puedes encontrar voces que la comunidad ha compartido con nosotros. Estas voces son sus propios clones de voz profesionales. Por lo general, estas voces tienen una etiqueta de idioma que indica el idioma en el que se clonaron, lo que las hace nativas de ese idioma. También puedes usar el filtro de búsqueda por idioma para filtrar idiomas concretos.
¿Por qué los números, fechas, símbolos y siglas no se pronuncian correctamente o no se dicen en el idioma correcto?
Los números, las fechas, los símbolos y los acrónimos pueden suponer un reto para la IA, ya que a menudo hay varias formas de decirlos correctamente. También puede depender del idioma que se use; por ejemplo, «11» podría leerse como “Eleven”, pero también podría ser “Once” en español o “Elf” en alemán.
Hay varias formas de asegurarte de que los números, las fechas, los acrónimos y los símbolos se pronuncien correctamente.
Escríbelos completos, con palabras
Para obtener los mejores resultados, recomendamos escribir números, acrónimos, fechas y símbolos completos, con palabras, de la forma en que quieres que la IA los diga. Así, la IA tendrá el máximo contexto posible para generar el resultado correcto. Por ejemplo, para «$100», recomendamos escribir “cien dólares” para asegurarte de obtener el resultado que buscas.
Usar un LLM
Si utilizas un modelo de lenguaje grande para generar tus prompts de texto, por ejemplo, al usar ElevenAgents, puedes indicarle al modelo que escriba siempre los números, las fechas, los símbolos y los acrónimos con palabras, de la forma que prefieras que la IA los diga.
Normalización
Si generas mediante la API, puedes especificar si aplicar la normalización de texto con el parámetro apply_text_normalization. La normalización de texto escribe los números y las fechas con palabras para mejorar la pronunciación. Esta opción añade latencia, ya que el proceso de normalización requiere tiempo de procesamiento adicional.
El parámetro apply_text_normalization tiene tres modos:
on, lo que significa que siempre se aplica
off, lo que significa que nunca se aplica
auto, lo que significa que la IA decidirá automáticamente cuándo aplicar la normalización de texto
También puedes especificar el idioma de tu prompt con el parámetro language_code. Es un parámetro opcional que acepta códigos de idioma ISO 639-1.
Esto puede resultar útil para prompts cortos o ambiguos, por ejemplo, cuando el texto solo incluye números o símbolos. Especificar el idioma garantiza que el normalizador aplique las reglas correctas para ese idioma.
La normalización está activada de forma predeterminada al generar con Texto a Voz desde la web.
En Studio, de forma predeterminada, la normalización se aplica automáticamente, lo que significa que la IA decidirá cuándo aplicar la normalización de texto. También puedes configurar la normalización para que se aplique siempre; esta opción se encuentra en Configuración del proyecto, en la pestaña Avanzado.
¿Por qué mi voz pronuncia mal ciertas palabras?
Las pronunciaciones incorrectas pueden producirse por varios motivos. El más habitual es que la palabra esté mal escrita. La IA no intentará corregir las palabras mal escritas e intentará leerlas exactamente como aparecen. Por eso, es importante revisar bien el texto y asegurarte de que está corregido y terminado antes de pedir a la IA que lo lea.
Si quieres forzar una pronunciación concreta, puedes usar etiquetas de fonemas SSML con nuestro modelo Flash v2. Puedes obtener más información en nuestra guía de pronunciación.
A veces, la IA puede pronunciar mal palabras o tener un acento extraño que no es el que esperabas. Esto puede ocurrir por varios motivos y, en la mayoría de los casos, depende mucho de la voz y el idioma. La mejor forma de asegurar el acento y la pronunciación correctos es clonar una voz con el acento y la pronunciación adecuados. Esto dará a la IA el máximo contexto al generar el audio.
El idioma lo especifica el texto y el acento lo especifica la voz. Por tanto, si escribes en un idioma que puede compartir muchas palabras comunes o estar estrechamente relacionado con otro idioma, a la IA le puede resultar difícil entender cómo pronunciar determinadas palabras o cambiar entre acentos.
Sin embargo, en determinadas circunstancias, la IA puede pronunciar mal palabras correctamente escritas, incluso en inglés. Parece depender en gran medida de la voz y del texto utilizados, pero debería ser algo poco frecuente.