Clonar voz IA

Descubre cómo clonar tu voz con nuestros modelos líderes del sector.

Resumen

Al clonar una voz, hay dos opciones principales: Clonar voz IA instantáneo y Clonar voz IA profesional. Clonar voz IA instantáneo es una forma rápida y sencilla de clonar tu voz, mientras que Clonar voz IA profesional es una opción más precisa y personalizable.

Clonar voz IA instantáneo

Clonación de voz
instantánea

Clonar voz IA instantáneo te permite crear clones de voz a partir de muestras más cortas casi al instante. Al crear un clon de voz instantáneo (IVC), no se entrena ni se crea un modelo de IA personalizado. En su lugar, se basa en conocimientos previos de los datos de entrenamiento para hacer una estimación fundamentada, en lugar de entrenarse con la voz exacta.

Esto funciona extremadamente bien con muchas voces. Sin embargo, la mayor limitación de los IVC aparece si intentas clonar una voz muy singular o una voz con un acento que la IA quizá no haya encontrado con frecuencia durante el entrenamiento. En esos casos, usar Clonar voz IA profesional para crear un modelo personalizado mediante entrenamiento explícito puede ser la mejor opción.

Clonar voz IA profesional

Clonación de voz
profesional

Clonar voz IA profesional es una función disponible en el plan Creator o superiores. Clonar voz IA profesional te permite entrenar un modelo más realista de tu voz entrenando un modelo dedicado con un conjunto mayor de datos de voz, lo que produce un modelo prácticamente indistinguible de la voz original.

Como los modelos personalizados requieren ajuste y entrenamiento, entrenar PVC lleva más tiempo que crear IVC. Por lo general, el ajuste tarda entre 3 y 6 horas en completarse, aunque a veces puede tardar un poco más, según el número de PVC que estén en cola para el ajuste.

Guía para principiantes sobre grabación de audio

Si te estás iniciando en la grabación de audio, aquí tienes algunos consejos para empezar.

Lugar de grabación

Al grabar audio, elige un lugar adecuado y prepáralo para minimizar el eco o la reverberación de la sala. Por tanto, queremos «amortiguar» la sala tanto como sea posible. Eso es precisamente para lo que sirve una cabina vocal con tratamiento acústico y, si no tienes una a mano, puedes probar algunas ideas para crear una cabina vocal casera, una «fortaleza de mantas» o usar un armario.

Aquí tienes algunos ejemplos de YouTube con ideas de acústica casera:

Micrófono, filtro antipop e interfaz de audio

Un buen micrófono es fundamental. Los micrófonos pueden costar entre $100 y $10.000, pero un micrófono XLR profesional de entre $150 y $300 es suficiente para la mayoría de los trabajos de locución.

Para una configuración asequible y de alta calidad para trabajos de locución, considera una interfaz Focusrite con un Audio-Technica AT2020 o un micrófono Rode NT1. Esta configuración, con un coste de entre $300 y $500, ofrece grabaciones de alta calidad aptas para uso profesional y un ruido propio mínimo para obtener resultados limpios.

Asegúrate de colocar un filtro antipop adecuado delante del micrófono al grabar para evitar las oclusivas, así como la respiración y el aire que golpean directamente el diafragma o el micrófono, ya que sonarán mal y también causarán problemas en el proceso de clonación.

Estación de trabajo de audio digital (DAW)

Hay muchas soluciones de grabación diferentes que hacen lo mismo: grabar audio. Sin embargo, no todas ofrecen la misma calidad. Siempre que puedan grabar archivos WAV a 44,1 kHz o 48 kHz con una profundidad de bits de al menos 24 bits, servirán. No necesitas posprocesamiento sofisticado, plugins, reductores de ruido ni nada parecido, porque queremos mantener la grabación de audio sencilla.

Si quieres una recomendación, te sugerimos REAPER, un DAW fantástico y muy flexible. Es el estándar del sector para muchos trabajos de audio. Otra buena opción gratuita es Audacity.

Mantén niveles de grabación óptimos —ni demasiado altos ni demasiado bajos— para evitar la distorsión digital y el ruido excesivo. Para trabajos de locución, busca picos de entre -6 dB y -3 dB y una sonoridad media de -18 dB, para garantizar claridad y minimizar el nivel de ruido. Supervisa atentamente y ajusta los niveles según sea necesario para obtener los mejores resultados en función del proyecto y del entorno de grabación.

Posicionamiento

Una pauta útil es mantener una distancia de unos dos puños respecto al micrófono, aproximadamente 20 cm (7-8 pulgadas), con un filtro antipop entre tú y el micrófono. Algunas personas prefieren colocar el filtro antipop al máximo hacia atrás para poder apoyarse directamente en él. Esto les ayuda a mantener una distancia uniforme respecto al micrófono con más facilidad.

Otra técnica habitual para evitar respirar directamente en el micrófono o producir sonidos oclusivos es hablar en ángulo. Hablar en ángulo hace que sea menos probable que el aire espirado golpee el micrófono directamente y, en su lugar, pase a su lado.

Interpretación

La interpretación que hagas es uno de los aspectos más importantes de toda la sesión de grabación. La IA intentará clonar todo lo relacionado con tu voz lo mejor que pueda, y su capacidad para ello es muy alta. Esto significa que intentará reproducir tu cadencia, tonalidad, estilo de interpretación, la duración de las pausas, si tartamudeas, respiras profundamente, hablas con voz entrecortada o usas muchos «eh» y «ah»; incluso puede reproducirlos. Por tanto, lo que queremos en el archivo de audio es exactamente la interpretación y la voz que queremos clonar, ni más ni menos. Por eso también es importante encontrar un guion que puedas leer y que se ajuste a la tonalidad que buscamos.

Al grabar para IA, es muy importante mantener la uniformidad. Si grabas una voz, mantenla muy animada durante toda la grabación o muy contenida durante toda ella; no puedes mezclar ambos estilos o la IA puede volverse inestable porque no sabe qué parte de la voz debe clonar. Lo mismo ocurre si usas un acento: mantén el mismo acento durante toda la grabación. ¡La uniformidad es clave para obtener un buen clon!

Preguntas frecuentes

La Clonación de Voz Profesional, a diferencia de la Clonación de Voz Instantánea, que permite clonar voces rápidamente con menos de 2 minutos de audio, te permite entrenar un modelo más realista de tu voz. Esto se consigue entrenando un modelo específico con un amplio conjunto de datos de voz para producir un modelo prácticamente indistinguible de tu voz original.

Puesto que los clones de voz profesionales requieren ajuste fino y entrenamiento, pasará algún tiempo antes de que puedas usar tu clon de voz. Es difícil dar una estimación, ya que depende del número de personas que haya en la cola antes que tú y de otros factores, pero el ajuste fino suele tardar entre 3 y 6 horas.

Recibirás una notificación por correo electrónico cuando tu clon de voz profesional esté listo.

Para la Clonación de Voz Instantánea y la Clonación de Voz Profesional, aceptamos diversos tipos de archivo. Recomendamos encarecidamente MP3 a 192 kbps o más.

Formato recomendado

  • MP3, 192 kbps o más

Duración recomendada

  • Clonación de Voz Instantánea: 1-2 minutos de audio de buena calidad
  • Clonación de Voz Profesional: 30-180 minutos de audio de buena calidad

Los formatos sin comprimir, como WAV, normalmente no mejoran la calidad del clon y pueden causar problemas durante la subida. En su lugar, céntrate en la calidad de la grabación: utiliza una grabación limpia, sin ruido de fondo, reverberación de la sala ni varios hablantes, con un volumen y tono constantes, y sin largos silencios.

Para obtener más información, consulta Clonación de Voz Instantánea (IVC) y Clonación de Voz Profesional (PVC).

ElevenLabs ofrece dos opciones para clonar voces:

  • Clonación de Voz Instantánea: resultados rápidos a partir de unos 1-3 minutos de audio. Funciona bien con la mayoría de las voces, pero puede tener dificultades con acentos poco comunes o voces únicas.
  • Clonación de Voz Profesional: mayor fidelidad, utilizando entre 30 minutos y unas 3 horas de audio. El ajuste suele tardar entre 3 y 6 horas, y puede llevar más tiempo si hay muchas voces en cola.

Si la Clonación de Voz Instantánea no capta bien tu voz o acento, prueba la Clonación de Voz Profesional.

No puedes cambiar el acento ni el tono de un clon después de crearlo. Para mejorar el resultado, cambia las muestras de audio que utilizas. Pequeños cambios en las muestras pueden marcar una gran diferencia.

En ElevenLabs, nos comprometemos plenamente tanto a respetar los derechos de propiedad intelectual como a implementar medidas de protección contra el posible uso indebido de nuestra tecnología:

  • Solo colaboramos con clientes que cumplen nuestros Términos de servicio y nuestra Política de uso prohibido, que prohíben el uso malintencionado de nuestra tecnología para cualquier fin que pueda considerarse ilegal o perjudicial;
  • Buscamos apoyar a propietarios de voces y a sus licenciatarios para que reclamen sus derechos, y revisaremos y actuaremos ante todas las infracciones conocidas;
  • Todo el audio generado por nuestros modelos puede rastrearse de inmediato hasta el usuario responsable de generarlo.

La tecnología que estamos desarrollando es nueva y todavía no existe una regulación clara. Parte de nuestro objetivo como laboratorio de investigación de IA es dar a conocer la existencia de esta tecnología, su potencial y también sus limitaciones.

No puedes descargar ni exportar tus clones de voz como archivos independientes. Los clones de voz permanecen en tu cuenta de ElevenLabs.

Aun así, puedes usar tus voces de ElevenLabs fuera del sitio web de ElevenLabs. Con tu clave de API, los servicios de terceros pueden llamar a la API de ElevenLabs y generar voz con las voces de tu cuenta.

Si quieres volver a crear un clon más adelante, guarda las muestras de audio originales que usaste para crearlo. Cada clon sonará ligeramente distinto, incluso si usas el mismo audio.

Para consultar una guía completa, te recomendamos leer nuestra documentación sobre Clonar Voz Instantánea y Clonar Voz Profesional.

La idea principal es: una entrada buena y uniforme = un resultado bueno y uniforme.

Duración

  • Clonar Voz Instantánea: 1-2 minutos de audio de buena calidad
  • Clonar Voz Profesional: 30-180 minutos de audio de buena calidad

Usa los fragmentos de audio mejores y más nítidos que encuentres. Debe haber un solo hablante, sin ruido ni interferencias de fondo, y su voz debe oírse alta y clara.

En lugar de usar muchos fragmentos de distinta calidad solo para aumentar la duración, prioriza aquellos en los que la calidad del micrófono sea claramente muy alta y la calidad y el tono sean uniformes de principio a fin, en vez de centrarte en aumentar la duración total.

Asegúrate de que la mayor parte del diálogo de tus fragmentos coincida con el estilo de habla y la entonación del hablante que más te gustan. No conviene incluir demasiados fragmentos en los que el hablante se aleje de los patrones de habla que quieres escuchar.

Si es necesario, usa un eliminador de ruido para reducir el ruido de fondo.

Puedes encontrar más información en nuestra documentación aquí.

Sí. Puedes clonar tu voz en cualquier idioma compatible con Flash v2.5 y Multilingual v2. Consulta la lista completa de idiomas compatibles aquí.

También puedes clonar una voz que habla un idioma que la IA no admite. El clon puede captar el tono del hablante, pero no podrá hablar ese idioma y los resultados pueden ser impredecibles. No lo recomendamos.

No. Solo puedes crear un Clon de Voz Profesional de tu propia voz. Aunque tengas su consentimiento, no puedes clonar la voz de otra persona. Todos los Clones de Voz Profesionales requieren un proceso de verificación para confirmar que la voz te pertenece.

Si alguien quiere compartir su voz contigo, puede crear y verificar un Clon de Voz Profesional en su propia cuenta y después compartirlo contigo de forma privada mediante un enlace para compartir. Más información en nuestro artículo: ¿Cómo comparto una voz?

Lamentablemente, no es posible. Como se indicó durante el proceso de configuración de tu Clon de Voz Profesional (PVC), cuando llegas a la fase de verificación, no puedes hacer cambios hasta que hayas verificado tu voz.

Si necesitas ayuda con tu Clon de Voz Profesional, ponte en contacto con el equipo de asistencia escribiendo a support@elevenlabs.io.

Todos los Clones de Voz Profesionales (PVC) se entrenarán automáticamente con los modelos Flash v2.5, Turbo v2.5 y Multilingual v2. Los PVC entrenados con audio en inglés también se entrenarán automáticamente con los modelos Flash v2 y Turbo v2.

Si ya tienes un PVC, ahora puedes realizar un ajuste fino con modelos adicionales. En el futuro, si se lanzan nuevos modelos compatibles con el ajuste fino, recibirás una notificación. Se mostrará mediante un icono de exclamación a la derecha de tu voz en la lista de voces de Mis voces. Al pasar el cursor sobre este icono, se mostrará la notificación.

Para iniciar el proceso de ajuste fino, pasa el cursor sobre el nombre de tu voz en la lista de Mis voces, y verás todos los modelos disponibles. Los modelos con los que la voz ya se ha ajustado se mostrarán con un icono de marca de verificación, y los modelos disponibles para el ajuste fino se mostrarán con un icono de suma. Para iniciar el ajuste fino, solo tienes que hacer clic en el modelo. 

Mientras se ajusta la voz, puedes pasar el cursor sobre el nombre del modelo para ver el progreso. Ten en cuenta que, debido a la caché de voz, puede que necesites actualizar la página para ver el progreso más reciente. Cuando finalice el ajuste fino, recibirás una notificación tanto en la app como por correo electrónico.

El número de plazas para Clones de Voz Profesionales (PVC) varía según el nivel de suscripción:


Plazas de PVC incluidas
  • Planes Free y Starter: no hay plazas de PVC disponibles
  • Planes Creator, Pro y Scale heredado: 1 plaza de PVC
  • Planes Scale y Business heredado: 3 plazas de PVC
  • Plan Business: 10 plazas de PVC
  • Plan Enterprise: número personalizado de plazas de PVC

Plazas de PVC adicionales

Puedes obtener plazas de PVC adicionales cuando un Clon de Voz Profesional que hayas compartido en la Biblioteca de Voces reciba la calificación Studio Quality.

  • La revisión de Studio Quality solo se aplica a las voces que hayas compartido en la Biblioteca de Voces
  • Tras aceptar tu voz en la Biblioteca de Voces, la revisión de Studio Quality se realiza automáticamente. No es inmediata
  • Si tu PVC compartido recibe la calificación Studio Quality, recibirás automáticamente una plaza de PVC adicional
  • Esto puede ocurrir varias veces si varias voces compartidas reciben la calificación Studio Quality
  • No puedes crear más PVC a menos que:
    • Obtengas plazas adicionales mediante la revisión Studio Quality de voces compartidas en la Biblioteca de Voces
    • Actualices al plan Scale o superior
Notas importantes
  • Los Clones de Voz Profesionales solo se pueden usar para clonar tu propia voz
  • Si cambias a un plan inferior a Creator, tu PVC permanecerá en tu cuenta, pero no podrás usarlo hasta que actualices al plan Creator o superior
  • El número total de voces personalizadas que puedes tener, incluidos los PVC, depende de tu nivel de suscripción

La clonación con Clonación de Voz Instantánea puede ser algo complicada y tenemos algunas pautas generales. Sin embargo, no dejan de ser pautas. No tenemos reglas fijas sobre el número de muestras ni su duración. Hemos visto usuarios que han utilizado muestras de solo 30 segundos y han obtenido resultados excelentes, mientras que otros han usado 10 minutos de audio y han obtenido peores resultados. Pero hay algunas cosas que deberías tener en cuenta.

  • La calidad del audio es el aspecto más importante que debes considerar al usar la Clonación de Voz Instantánea.
  • El número de muestras no importa; lo importante es la duración total. Tener más de 2-3 minutos de audio apenas mejorará el resultado y, en algunos casos, incluso puede perjudicar la estabilidad del clon.

Después de verificar tu voz, deberá ajustarse con precisión a nuestros modelos antes de que puedas usarla. Mientras esto ocurre, puedes consultar el estado de tu voz en Mis voces pasando el cursor sobre su nombre. Verás todos los modelos disponibles para tu voz. Para consultar el estado de cada modelo, pasa el cursor sobre el nombre del modelo. 

Si algo ha salido mal, es posible que veas el siguiente estado:

Lo sentimos, el proceso de entrenamiento ha tenido problemas y se ha vuelto a intentar. No es necesario realizar ninguna otra acción. Esto significa que algo ha salido mal, pero tu voz se ha puesto automáticamente en cola para volver a intentar el proceso de ajuste fino. Tu voz debería completar correctamente el proceso de ajuste fino en el siguiente intento, pero si experimentas varios fallos, puede que haya un problema con el conjunto de datos que la IA no pueda resolver.

Puedes intentar resolverlo eliminando la voz y subiendo los datos de nuevo, desde el principio. Esto ha ayudado a algunos usuarios.

Si esto no resuelve el problema, puede que tengas que revisar el audio de entrenamiento y usar otro distinto.

Si experimentas fallos durante el proceso de ajuste fino, siempre puedes contactar con soporte escribiéndonos a support@elevenlabs.io.

Si agotas todos los intentos de verificación durante la creación de tu clon de voz profesional, puedes esperar 24 horas y después volver a intentarlo.

También puedes contactar con soporte escribiendo a support@elevenlabs.io para que puedan revisarlo. Si todo parece correcto, restablecerán tus intentos de verificación para que puedas volver a realizar el proceso.

Estas son algunas recomendaciones para verificar correctamente tu clon de voz profesional:

  • Asegúrate de que tu navegador web tiene permiso para usar el micrófono y de que no tienes el sonido silenciado.
  • Comprueba que el audio grabado con el micrófono del ordenador suene parecido al audio que subiste para clonarlo, sin ruido de fondo ni otras interferencias de audio externas.
  • Intenta hablar con un estilo similar al del audio que usaste para entrenar la voz.
  • Lee cada línea de verificación solo una vez y, después, pulsa Detener para detener la grabación. Leer la línea más de una vez puede hacer que el proceso de verificación falle.

Verás este error si intentas usar tu clon de voz profesional (PVC) antes de que haya completado el proceso de ajuste fino y esté disponible para usarlo.

Cuando creas un PVC, debe pasar por varios procesos antes de estar disponible para su uso.  Después de verificar tu voz, se procesará y se pondrá en cola para el ajuste fino.   Según cuántas otras voces estén actualmente en cola para el ajuste fino, calculamos que este proceso suele tardar entre 3 y 6 horas, aunque puede tardar hasta 24 horas.

Puedes consultar el progreso de tu PVC en Mis voces: busca la voz en tu lista de voces y haz clic en Ver para ver más detalles.  Puedes pasar el cursor sobre cada modelo para ver su estado actual.  

Para obtener más información sobre el significado de cada estado, consulta ¿Qué significa el estado de mi clon de voz profesional?

Cuando tu PVC haya completado el ajuste fino y esté disponible para usarlo, verás una notificación emergente y también recibirás un aviso por correo electrónico.

Tu clon de voz profesional pasará por varias etapas mientras se procesa. Estas etapas se reflejan en el estado que se muestra para tu clon de voz profesional en Mis voces.

Para ver el estado actual, busca tu voz en la lista y consulta los iconos que aparecen a la derecha.

Borrador: Este estado significa que tu voz está incompleta. Por lo general, se debe a que no has terminado de crear la voz o todavía no la has verificado.

Para realizar el proceso de verificación, haz clic en el icono de marca de verificación.

Para volver al proceso de creación de voz, haz clic en Más acciones (los tres puntos) y selecciona Editar voz.

Cuando hayas verificado tu voz, tendrá que ajustarse con precisión a nuestros modelos antes de que puedas usarla. Puedes seguir este proceso pasando el cursor sobre el nombre de tu voz en Mis voces. Aquí verás todos los modelos disponibles, con un icono que indica el estado de cada uno. 

Pasa el cursor sobre el nombre del modelo para obtener más información. Verás uno de los siguientes estados:

El proceso de entrenamiento se ha programado: significa que tu voz está esperando a que se libere una plaza para poder entrenarse. El tiempo que tu voz permanecerá en cola dependerá de cuántas otras voces estén también en la cola.

Creando conjunto de datos y Ejecutando ajuste fino: cuando se libere una plaza, comenzará el proceso de ajuste fino. Puede tardar entre 6 y 24 horas. Verás el porcentaje completado de cada paso del proceso de entrenamiento de tu voz.

Lo sentimos, el proceso de entrenamiento ha tenido problemas y se ha vuelto a intentar. No es necesario realizar ninguna otra acción.

Esto significa que algo ha salido mal, pero tu voz se ha puesto automáticamente en cola para volver a intentar el proceso de ajuste fino. Tu voz debería completar correctamente el proceso de ajuste fino en el siguiente intento, pero si experimentas varios fallos, contacta con soporte escribiéndonos a support@elevenlabs.io.

La voz está lista para usarse con el modelo: significa que el proceso de ajuste fino para este modelo se ha completado y que ya puedes usar tu voz con él.

Haz clic para iniciar el ajuste fino: algunos modelos no se entrenan automáticamente y tendrás que hacer clic en el nombre del modelo para iniciar el ajuste fino. Si hay modelos adicionales disponibles para ajustar con precisión tu voz, verás un icono de exclamación junto a ella. 

Para iniciar el proceso de ajuste fino, pasa el cursor sobre el nombre de tu voz y haz clic en el nombre del modelo.

Clonar Voz Profesional es compatible con todos los idiomas disponibles en la familia de modelos Eleven v4: más de 90 idiomas en total.

La familia de modelos Eleven v4 es compatible con más de 90 idiomas, incluidos:

Afrikáans (afr), amárico (amh), árabe (ara), armenio (hye), asamés (asm), asturiano (ast), azerbaiyano (aze), bielorruso (bel), bengalí (ben), bosnio (bos), búlgaro (bul), birmano (mya), cantonés (yue), catalán (cat), cebuano (ceb), croata (hrv), checo (ces), danés (dan), neerlandés (nld), inglés (eng), estonio (est), filipino (fil), finés (fin), francés (fra), fula/pulaar (ful), gallego (glg), georgiano (kat), alemán (deu), griego (ell), guyaratí (guj), hausa (hau), hebreo (heb), hindi (hin), húngaro (hun), islandés (isl), indonesio (ind), italiano (ita), japonés (jpn), javanés (jav), kamba (kam), canarés (kan), kazajo (kaz), coreano (kor), kirguís (kir), lao (lao), letón (lav), lingala (lin), lituano (lit), luganda (lug), luxemburgués (ltz), macedonio (mkd), malayo (msa), malayalam (mal), maltés (mlt), chino mandarín (cmn), maorí (mri), maratí (mar), mongol (mon), nepalí (nep), bokmål noruego (nob), occitano (oci), odia (ori), pastún (pus), persa (fas), polaco (pol), portugués de Brasil (por), panyabí (pan), rumano (ron), ruso (rus), serbio (srp), shona (sna), sindhi (snd), eslovaco (slk), esloveno (slv), somalí (som), kurdo soraní (ckb), español de Latinoamérica (spa), suajili (swa), sueco (swe), tayiko (tgk), tamil (tam), telugu (tel), tailandés (tha), turco (tur), ucraniano (ukr), urdu (urd), uzbeko (uzb), vietnamita (vie), galés (cym), wólof (wol), zulú (zul).

Clonar Voz Profesional consiste en entrenar (ajustar) el modelo con grandes conjuntos de datos de la voz de un hablante concreto para crear un modelo personalizado.

Cuando hayas subido tus muestras y verificado tu voz, tu Clon de Voz Profesional se añadirá a la cola. El tiempo estimado de entrenamiento es de aproximadamente 3 a 6 horas. Depende de varios factores, por lo que es difícil dar una estimación exacta. Lamentablemente, a veces puede tardar más.

Puedes consultar el estado actual de tu voz en Mis voces. Para obtener más información, consulta ¿Qué significa el estado de mi Clon de Voz Profesional?

Cuando tu PVC haya completado el proceso de ajuste, recibirás notificaciones en la app y por correo electrónico para avisarte de que tu voz ya está lista para usar.

No results