Eleven v4
Nuestro modelo de Texto a Voz más reciente y avanzado.
Eleven v4 es nuestro modelo de Texto a Voz más reciente y avanzado, y el primero de una nueva generación de modelos. Mejora la calidad de salida, la precisión de voz, la consistencia, la emoción, la entonación, las etiquetas de audio y la cobertura de idiomas en comparación con Eleven v3.
En general, Eleven v4 supone una mejora respecto a Eleven v3 y ofrece mejores resultados en casi todos los casos. Te recomendamos encarecidamente cambiar a v4 y probarlo con tus propias voces y contenido para comprobar la diferencia. Aunque algunos casos concretos pueden requerir otra opción, para la mayoría de usuarios v4 será la mejor elección.
Para obtener información sobre etiquetas, puntuación y prompting de diálogos, consulta Prompting Eleven v4.
Clonación de voz
La precisión de la clonación de voz da un gran salto con Eleven v4. Las voces clonadas capturan las características de la voz de origen —timbre, cadencia y entonación— con más fidelidad que cualquier modelo anterior.
Los Clones de Voz Instantáneos (IVC) son más precisos que nunca en Eleven v4. Capturan las características definitorias de una voz de origen con mayor fidelidad, lo que facilita crear rápidamente un clon convincente a partir de una muestra de audio breve.
Los Clones de Voz Profesionales (PVC) son totalmente compatibles con Eleven v4. Se basan en los mismos avances en precisión de voz y ofrecen una reproducción más fiel de la voz de origen para workflows que requieren el máximo nivel de consistencia y control.
Debido a este importante salto de precisión, Eleven v4 puede sonar considerablemente diferente a Eleven v3. Eleven v3 sentó las bases de Eleven v4, con un fuerte énfasis en la entonación y la precisión, mientras que Eleven v4 se apoya en esas bases con una precisión de voz sustancialmente mejorada. Como resultado, Eleven v4 está diseñado para capturar la voz de origen con mayor fidelidad, aunque puede que sigas prefiriendo cómo sonaba una voz en Eleven v3. La precisión y la preferencia personal no siempre coinciden, así que te recomendamos comparar ambas versiones con tu propio contenido para elegir la que mejor se adapte a tu caso de uso.
Dado que Eleven v4 reproduce con mayor fidelidad las características de la voz de origen, incluidos su acento, entonación, volumen y otras cualidades distintivas, la calidad de la grabación de origen importa más que nunca. Un audio de entrenamiento claro y limpio ayuda a Eleven v4 a capturar la voz con precisión, sin introducir sonidos o características no deseados. El ruido de fondo, la distorsión u otros problemas de grabación pueden afectar al resultado.
Seguimos experimentando con Eleven v4 para entender cuál es la mejor forma de usarlo. Por ahora, parece mucho mejor captando matices de audio, especialmente cuando hay mucho audio de entrenamiento, como ocurre con los Clones de Voz Profesionales. Nuestras recomendaciones sobre el uso de datos de entrenamiento variados pueden cambiar a medida que seguimos probando cómo controlar el modelo con un conjunto de datos más versátil. De momento, te recomendamos mantener un único estilo de habla en tu audio de entrenamiento, que Eleven v4 debería captar mejor que los modelos anteriores.
Gestión nativa de acentos
Este es uno de los mayores cambios de Eleven v4 en comparación con cualquier modelo anterior, y merece la pena entenderlo bien.
Cuando el idioma que generas coincide con el idioma de tu voz de referencia, el acento original se conserva exactamente igual que antes.
Cuando el idioma que generas es diferente del idioma de la voz de referencia, Eleven v4 genera habla fluida y natural en el idioma de destino, en lugar de conservar el acento de la voz de referencia de su idioma original.
En la práctica: si clonas la voz de una persona coreana y generas contenido en inglés, Eleven v4 producirá un inglés natural y fluido en lugar de inglés hablado con acento coreano. Esto permite usar cualquier voz en todos los idiomas compatibles y resulta especialmente útil para doblaje, contenido multilingüe y agentes de voz que necesitan atender a usuarios en distintos idiomas con una única voz.
Si tu workflow depende de que una voz mantenga su acento nativo en otros idiomas, prueba este comportamiento directamente con Eleven v4 antes de migrar: es un cambio deliberado en el funcionamiento de la generación entre idiomas, no un error.
Sin embargo, esta nueva funcionalidad todavía se está ajustando, y estamos explorando formas de convertirla en una opción activable en vez de que esté siempre activa. Sigue siendo un proyecto de investigación, por lo que de momento no tenemos una fecha prevista ni más información al respecto.
Variantes del modelo
Eleven v4 cuenta con dos variantes, para que puedas elegir el equilibrio adecuado entre calidad y velocidad para tu caso de uso:
- Eleven v4 (
eleven_v4) — nuestro modelo de mayor calidad, ideal para creación de contenido, audiolibros, locuciones de personajes y cualquier caso de uso en el que la calidad sea la máxima prioridad. - Eleven v4 Turbo (
eleven_v4_turbo) — calidad extremadamente alta con una latencia impresionantemente baja, diseñado específicamente para casos de uso en tiempo real como agentes conversacionales y experiencias de voz interactivas.
Ambas variantes utilizan dos ajustes de voz: Estabilidad y Similitud.
La estabilidad controla la consistencia de la entonación entre generaciones. Los valores más bajos permiten una entonación más expresiva y variada; los valores más altos mantienen la interpretación más cerca de una base fija.
La similitud controla en qué medida el resultado se ajusta a la voz de referencia. Los valores más altos refuerzan una mayor fidelidad a la referencia, lo que puede reducir ligeramente la naturalidad.
Los controles deslizantes de estilo y velocidad no están disponibles en Eleven v4, y SSML no es compatible.
Las etiquetas de audio (por ejemplo, [whispering], [shouting], [laughing]) te permiten dirigir la entonación con un control preciso, y Eleven v4 las gestiona con un nivel de matiz superior al de los modelos anteriores. Aún no son perfectas, y seguimos iterando y mejorando la fiabilidad con la que el modelo sigue las instrucciones de las etiquetas. Es un área activa en la que seguimos invirtiendo y continuará mejorando.
Ejemplos
Estos ejemplos son audio en bruto. No se ha aplicado un posprocesamiento intenso: ni EQ, compresión, normalización, de-essing, eliminación de plosivas ni procesos similares. Si escuchas problemas recurrentes, como clipping, plosivas, EQ desigual o saltos de volumen, es muy probable que estén en los datos de entrenamiento de esa voz. El modelo Eleven v4 simplemente los ha capturado, ya que es muy preciso, incluso al capturar imperfecciones. Hemos dejado el audio intacto para que puedas escuchar lo que produjo el modelo.
Precisión de la clonación de voz
Cada ejemplo comienza con una vista previa de la Biblioteca de Voces. Después tomamos un texto y lo generamos usando un Clon de Voz Instantáneo de esa voz tanto con Eleven v3 como con Eleven v4.
No es una comparación perfecta. Eleven v4 también funciona con Clones de Voz Profesionales, que pueden mejorar aún más la coincidencia. Sin embargo, para que la comparación fuera más justa, usamos Clones de Voz Instantáneos tanto para Eleven v3 como para Eleven v4.
Estos ejemplos muestran cuánto capta el modelo de la voz original. Es importante tener en cuenta que esto también incluye la EQ, la calidad, el volumen y cualquier otro detalle menor e imperfección del audio, como plosivas, sibilancia intensa y fluctuaciones de volumen.
Escucha la vista previa, después Eleven v3 y, por último, Eleven v4.
Voz NfUrCNRReUL9RXS9upG1.
Voz HBDoL4wkcalemIO0nUAu.
Interpretación de voz
Estas son generaciones de Eleven v4. Las etiquetas de audio del texto dirigen la entonación.
Voz EkK5I93UQWFDigLMpZcX.
Voz t7VaN65ClS2VrEUwk1nR.
Audiolibro
Esta es una narración de Eleven v4. Las etiquetas establecen el ritmo y el tono de la escena.
Voz KHRvDizAHFVPzoSehNY6.
El modelo seguirá evolucionando
Eleven v4 se encuentra en desarrollo activo y continuo. A medida que sigamos entrenando y mejorando el modelo tras su lanzamiento, su comportamiento puede cambiar con el tiempo a medida que mejora la calidad. Te recomendamos volver a probar tu caso de uso periódicamente conforme evolucione el modelo, y compartiremos actualizaciones importantes a medida que se publiquen.
Preguntas frecuentes
¿Qué idiomas admite Eleven v4?
Eleven v4 admite afrikáans, amhárico, árabe, armenio, asamés, asturiano, azerbaiyano, bielorruso, bengalí, bosnio, búlgaro, birmano, cantonés, catalán, cebuano, croata, checo, danés, neerlandés, inglés, estonio, filipino, finés, francés, fula (pulaar), gallego, georgiano, alemán, griego, guyaratí, hausa, hebreo, hindi, húngaro, islandés, indonesio, italiano, japonés, canarés, kazajo, coreano, kirguís, lao, lingala, lituano, luganda, luxemburgués, macedonio, malayo, malayalam, maltés, chino mandarín, maorí, maratí, mongol, nepalí, noruego bokmål, occitano, odia, pastún, persa, polaco, portugués (Brasil), panyabí, rumano, ruso, serbio, shona, sindhi, eslovaco, esloveno, somalí, kurdo soraní, español (LatAm), suajili, sueco, tayiko, tamil, télugu, tailandés, turco, ucraniano, urdu, uzbeko, vietnamita, galés y wolof.
Algunos idiomas se gestionan con mayor fluidez que otros, pero en general Eleven v4 gestiona muy bien la gran mayoría.
¿Una voz clonada conservará su acento?
Cuando la voz de referencia y el habla generada están en el mismo idioma, se conserva el acento de la voz. Por ejemplo, si clonas a alguien que habla inglés con un determinado acento inglés y generas habla en inglés, ese acento se mantendrá.
¿Puedo hacer que una voz hable otro idioma con su acento original?
De forma predeterminada, cuando el idioma generado difiere del idioma de la voz de referencia, Eleven v4 busca generar habla fluida y natural en el idioma de destino, en lugar de conservar el acento de referencia. Puedes probar a utilizar etiquetas de audio para guiar un acento o estilo de entonación, pero los resultados pueden variar, así que prueba tu voz y caso de uso específicos.
¿Un clon de Eleven v4 sonará como su versión de Eleven v3?
En general, Eleven v4 reproduce las características de la voz de origen con mucha más precisión que Eleven v3, incluidos su timbre, cadencia, entonación y otros rasgos. Como resultado, un clon de Eleven v4 generalmente sonará más como la voz de origen y puede sonar bastante diferente de su versión de Eleven v3.
¿Necesito entrenar Eleven v4?
Eleven v4 funciona tanto con Clonación de Voz Instantánea como con Clonación de Voz Profesional.
Con Clonación de Voz Instantánea, creas una voz sin un paso de entrenamiento independiente. Sube una muestra breve, normalmente de uno a dos minutos, y en cuestión de segundos tendrás una voz que podrás usar.
La Clonación de Voz Profesional funciona igual que con los modelos anteriores. Entrena un modelo específico con un conjunto más amplio de grabaciones.
Si ya tienes un Clon de Voz Profesional y quieres entrenarlo con Eleven v4, abre Mis voces, busca la voz en la lista y pasa el cursor sobre ella. Verás los modelos disponibles para esa voz. Haz clic en el botón con el símbolo más junto a Eleven v4 para iniciar el ajuste fino.
¿Debería usar Diseño de Voz con Eleven v4?
Las voces de Diseño de Voz funcionan con Eleven v4, pero puede que no sean tan expresivas ni suenen tan bien como con los modelos anteriores.