Conversión de voz
- Publicado
- Última actualización
EscucharEscucha este artículo
¿Qué es la conversión de voz?
La conversión de voz te permite transformar la voz de una persona en la de otra. Utiliza un proceso llamado clonación de voz para codificar la voz de destino —es decir, la voz a la que convertimos— y generar el mismo mensaje hablado de una forma que se ajuste a la identidad del hablante de destino, pero conserve la entonación original.
Usos
La tecnología de conversión de voz y clonación de voz de alta calidad tiene el potencial de revolucionar la forma en que se produce, distribuye e interactúa con el contenido en diversos sectores. Promete optimizar el tiempo y los costes de producción, además de ofrecer a quienes comparten sus voces para entrenar algoritmos de conversión formas de obtener ingresos pasivos.
- en la industria cinematográfica, actores podrían compartir sus bases de datos de voz con productores para crear pistas de audio sin tener que desplazarse al rodaje o al estudio;
- las frases mal pronunciadas podrían regrabarse con mucha más eficacia en posproducción;
- la tecnología también puede utilizarse para reproducir fielmente las voces de personajes históricos en escenarios ficticios o para devolver la voz a actores fallecidos;
- el desarrollo de videojuegos también encontrará esta tecnología igual de útil: se podrían corregir intervenciones o simplemente experimentar en el momento, sin que el actor tenga que estar físicamente presente para grabar;
- en medicina, pacientes que han perdido la capacidad de hablar, por ejemplo como consecuencia de un tratamiento contra el cáncer de garganta, podrían tener la oportunidad de volver a comunicarse con su propia voz;
- los asistentes virtuales podrían personalizarse, ya que a usuarios domésticos les resultaría más natural interactuar, por ejemplo, con la voz de un ser querido que con la de un desconocido virtual;
- por otro lado, el sector publicitario podría beneficiarse de la introducción de locuciones sintéticas que suenan tan reales como cualquier voz humana y, al mismo tiempo, evitan los problemas relacionados con la titularidad de derechos y las regalías. Si lo que se necesita es precisamente una voz reconocible, productores de anuncios también podrían utilizar la tecnología para clonar, con consentimiento, la voz de un actor concreto sin que tenga que estar físicamente presente en largas sesiones de grabación;
- las industrias del audiolibro y los pódcasts son otros dos sectores en crecimiento en los que aplicar tecnologías de clonación y conversión de voz ofrece la posibilidad de optimizar la producción y edición de contenido inmersivo.
Conversión de voz de ElevenLabs
Aunque en Eleven desarrollamos software de conversión de voz como parte de nuestro conjunto de herramientas, nuestra investigación sobre clonación de voz y síntesis de voz impulsa principalmente el desarrollo de nuestro producto principal, que planeamos lanzar a principios del próximo año: la herramienta automática de doblaje que conserva la identidad.
Nuestro objetivo es hacer que todo el contenido hablado sea accesible en distintos idiomas con la voz del hablante original, con solo pulsar un botón. Imagina un vídeo de YouTube educativo en inglés. Si alguien solo habla español (pero le interesaría el tema si conociera el idioma), eso supone un problema. Los subtítulos ofrecen una solución, claro, pero nuestro objetivo es proporcionar una forma mucho más inmersiva y entretenida de conectar con el contenido. Queremos poder generar a esa misma persona diciendo el mismo mensaje de forma natural en un español propio de un hablante nativo, aunque en realidad no lo hable.
Para ello, la clonación de voz nos permite conservar su identidad: el sonido de su voz. La usamos para generar nuevas intervenciones en otro idioma que suenen como si hablara la misma persona.
La conversión de voz entra en juego porque queremos conservar sus emociones, intención y estilo de entonación para lograr la máxima inmersión. Entrenamos modelos sólidos en varios idiomas que nos permiten analizar intervenciones en el idioma de origen y trasladarlas al idioma de destino con la entonación adecuada.
Proceso
Para convertir la voz de una persona en la de otra, es decir, el habla de origen en habla de destino, necesitamos un algoritmo que exprese el contenido del habla de origen con las características del habla de destino. Una buena analogía son las aplicaciones de intercambio de caras, que te permiten mezclar tu cara con la de otra persona para crear una imagen que combina ambas.
Para hacerlo, se toma la imagen de una cara y se representan sus atributos. Los puntos del ejemplo siguiente hacen precisamente eso: delimitan el espacio en el que se representarían los rasgos de la otra cara.
En la conversión de voz, necesitamos una forma de que el algoritmo codifique las propiedades del habla de destino. El algoritmo se entrena con un conjunto de datos que incluye muchos ejemplos de ese habla. Descompone esas muestras hasta un nivel fundamental: los «átomos» del habla, por así decirlo. El habla se compone de frases. Las frases se componen de palabras. Las palabras se componen de fonemas, que marcan las características del habla de destino. Es el nivel fundamental en el que opera el algoritmo.
La clave de la conversión de voz consiste en reproducir el contenido del habla de origen utilizando los fonemas del habla de destino. Pero existe una contrapartida, como en el ejemplo del intercambio de caras: cuantos más marcadores uses para representar los atributos de una cara, más restricciones impones a la cara que representas dentro de ellos. Menos marcadores implican menos restricciones. Lo mismo ocurre con la conversión de voz. Cuanta más prioridad demos al habla de destino, mayor será el riesgo de desincronizarnos con el habla de origen. Pero, si no le damos suficiente prioridad, corremos el riesgo de perder gran parte de lo que hace característico a ese habla. Por ejemplo, si reprodujéramos la grabación de alguien gritando enfadado con la voz de Morgan Freeman, tendríamos un problema. Dar demasiada prioridad a las emociones del habla de origen tiene el precio de perder la impresión de que realmente habla Morgan Freeman. Si ponemos demasiado énfasis en su patrón de habla, perdemos la carga emocional del habla de origen.
Ética
Las preocupaciones éticas sobre la clonación de voz merecen abordarse, ya que el potencial de uso indebido de esta tecnología preocupa a un número cada vez mayor de personas. En 2020, estafadores utilizaron deepfakes de audio para hacerse pasar por un CEO en una llamada telefónica y autorizar una transferencia bancaria de 35 millones de dólares. Una tecnología que puede hacer parecer de forma convincente que alguien dijo algo que no dijo genera, naturalmente, temor a que se utilice para desinformar, difamar o cometer fraude. Del mismo modo, la conversión de voz plantea cuestiones importantes sobre la infracción de derechos de autor si permite a usuarios beneficiarse de contenido generado sin el consentimiento de quienes poseen las voces.
En Eleven creemos necesario hacer todo lo posible para garantizar que nuestra tecnología no se utilice con fines maliciosos e implementar medidas de seguridad que protejan frente a sus riesgos:
- solo colaboramos con clientes que cumplen nuestros Términos, que prohíben el uso malicioso de nuestra tecnología con la intención de desinformar, difamar, cometer fraude o para cualquier otro fin que pueda considerarse ilegal o perjudicial;
- el contenido de vídeo sintético producido por Eleven incluye una marca de agua clara que indica que se ha generado con IA. El contenido de audio incluye una descripción clara del archivo. Cuando usamos voces reconocibles, lo hacemos con fines demostrativos y en contextos que no generan conflictos de intereses;
- al mismo tiempo, buscamos ayudar a propietarios de voces y sus licenciantes a reclamar sus derechos.
- Si tienes ideas sobre cómo mejorar nuestra postura, escríbenos a ethics@elevenlabs.io
Creemos que el miedo al uso indebido no debe ser el factor dominante que guíe nuestra actitud ante las potentes nuevas tecnologías. Debemos esforzarnos por garantizar que se introduzcan medidas de seguridad adecuadas durante su desarrollo para minimizar el riesgo de daños, mientras aprovechamos al máximo el potencial que la tecnología ofrece a la comunidad en general.
Futuro
La tecnología de conversión y clonación de voz promete revolucionar el cine, la televisión, la creación de contenido, el desarrollo de videojuegos, los pódcasts y el audiolibro, así como el sector publicitario. Pero sus aplicaciones van más allá del ámbito comercial, con posibles usos en medicina, educación y comunicación.
La clonación de voz está allanando el camino hacia un futuro en el que se podrá generar cualquier contenido en cualquier idioma y con cualquier voz para llegar a millones de personas en todo el mundo y crear una economía completamente nueva. Nuestro objetivo en Eleven es contribuir a hacer realidad este futuro.

