Ir al contenido

Esta Voz No Existe - Voz IA Generativa

Publicado

EscucharEscucha este artículo

Últimamente, parece que todo el mundo habla de IA generativa. Los grandes modelos de lenguaje y de texto a imagen basados en deep learning, como ChatGPT, Stable Diffusion, DALL-E y Midjourney, han generado mucho revuelo en el mundo tecnológico y más allá. Muchos los consideran uno de los avances recientes más importantes de la IA. Estés o no de acuerdo, la sensación general es que ha aparecido algo muy potente. En 2023 oiremos hablar de modelos que pueden ayudarte a dibujar o crear vídeos. Igual que nos preguntamos cuál es el smartphone más avanzado, pronto nos preguntaremos cuál es el modelo fundacional más avanzado. Sin embargo, pese a toda esta expectación, creemos que hay un ámbito de los medios generativos que sigue recibiendo mucha menos atención de la que merece: la voz IA. También es el ámbito en el que aspiramos a ser líderes. En Eleven, aprovechamos cada día el potencial de las técnicas de deep learning para impulsar nuestras herramientas realistas de Texto a Voz y Clonar Voz IA. Y ahora también estamos incorporando nuestro propio modelo generativo, que te permite diseñar desde cero voces sintéticas completamente nuevas.

Generador de Voz: diseña una voz

Usuarios recurren a la plataforma a diario para dar vida a sus personajes, ya sea para audiolibros, videojuegos o fanfiction. Nos dimos cuenta de que nuestro catálogo actual de voces es demasiado reducido para que todo el mundo encuentre voces que se ajusten a sus necesidades de contenido y, al mismo tiempo, sean exclusivas para cada usuario. Nuestra solución fue permitirte diseñar voces sintéticas completamente nuevas.

La idea de cómo hacerlo surgió al analizar los métodos que usamos actualmente para la síntesis de voz y Clonar Voz IA. Ambos procesos necesitan una forma de codificar las características de una voz concreta. Los embeddings de hablante son los que contienen esta identidad: una representación vectorial de la voz de una persona. Nos dimos cuenta de que podíamos tomar muestras de la distribución de embeddings de hablante entrenando un modelo específico que nos permitiera crear infinitas voces nuevas.

Como usuarios buscan sobre todo características específicas del habla, necesitábamos añadir cierto grado de control al proceso. Ampliamos nuestro modelo con condicionamiento para generar voces según sus características. Ahora, el modelo te permite definir ciertos parámetros básicos que establecen la identidad principal de la nueva voz: género, edad, acento, tono y estilo de habla. En otras palabras, cada vez que pulsas «generar», aunque elijas los mismos parámetros de base, obtienes una voz completamente nueva que no existía antes.

A continuación, te mostramos algunos ejemplos de voces que pueden diseñarse de esta forma:

00:00
00:00
00:00
00:00
00:00
00:00

«Diseñar voz» estará disponible en nuestra plataforma este febrero como parte de Voice Lab.

¿Para qué sirve?

Nuestras herramientas ya pueden generar voces tan naturales como las humanas, y esperamos que el abanico de aplicaciones potenciales de las voces artificiales no deje de crecer. Muchas de estas nuevas aplicaciones, como grabar audio para publicaciones de noticias o anuncios, requerirán que una voz esté limitada a una marca o caso de uso concreto, y se identifique con ellos, sin utilizarse en ningún otro lugar. Otros casos de uso, como la narración de historias y los videojuegos, priorizan la flexibilidad y la libertad de experimentar desde las primeras fases del desarrollo. Por eso, en lugar de crear un gigantesco conjunto de voces virtuales, decidimos que usuarios tengan la última palabra sobre qué voces se ajustan mejor a sus propósitos.

Autores de libros tienen ahora no solo la oportunidad de convertir fácilmente su obra en audio, sino también de mantener el control artístico sobre el diseño de una narración a medida. Esto ofrece a sus audiencias nuevas e interesantes formas de interactuar con las publicaciones y aumenta considerablemente el número de libros que podremos disfrutar escuchando.

Editores de noticias se han adentrado cada vez más en el audio, y elegir voces distintivas que representen sus publicaciones es una tarea importante: muchos oyentes valoran tanto la forma como el contenido. Además, los editores pueden tener la certeza de que una voz concreta los representa a ellos y solo a ellos.

Desarrolladores de videojuegos pueden ahora dar voz a una multitud de PNJ que, de otro modo, permanecerían mudos, con todas las herramientas necesarias al alcance de la mano. No solo pueden reducir costes sin renunciar a la calidad, sino que también pueden diseñar voces completamente únicas para los mundos virtuales que crean.

Creativos de publicidad necesitan locuciones que se adapten a campañas concretas, por lo que poder diseñar desde el inicio del desarrollo una narración que conecte con el público y esté pensada para un fin específico supone una ventaja considerable. Ahora pueden experimentar al instante con múltiples voces y estilos de entonación, sin necesidad de recurrir a recursos adicionales.

Desde creadores que producen todo tipo de contenido de audio y vídeo hasta responsables de empresas que buscan poner voz a las comunicaciones de su empresa, las posibilidades de diseñar un audio atractivo, único y adaptado a un caso de uso específico son ahora infinitas.

IA ética

Al igual que Clonar Voz IA genera preocupación por las consecuencias de un posible uso indebido, cada vez más personas temen que la proliferación de la tecnología de IA ponga en riesgo el sustento de profesionales. En Eleven, imaginamos un futuro en el que actores de doblaje puedan conceder licencias para usar sus voces en el entrenamiento de modelos de voz para usos específicos, a cambio de una remuneración. Clientes y estudios seguirán contando encantados con talento de voz profesional en sus proyectos, y el uso de la IA simplemente contribuirá a acelerar los plazos de entrega y a ofrecer mayor libertad para experimentar y definir una dirección en las primeras fases del desarrollo. La tecnología cambiará cómo se diseña y graba el audio hablado, pero el hecho de que actores de doblaje ya no tengan que estar físicamente presentes en cada sesión les dará realmente la libertad de participar en más proyectos a la vez y de inmortalizar de verdad sus voces.

Además, nos entusiasma que una multitud de libros, noticias, juegos independientes y otros contenidos cuyos autores y desarrolladores no podrían permitirse de otro modo los costes de grabación ahora serán accesibles a través de otro medio. Este mayor acceso brinda la oportunidad de ampliar las audiencias en cada caso.

En Eleven, estamos plenamente comprometidos tanto con el respeto de los derechos de propiedad intelectual como con la implementación de medidas de seguridad frente a posibles usos indebidos de nuestra tecnología:

  • Solo colaboramos con clientes que cumplen nuestros Términos, que prohíben el uso malicioso de nuestra tecnología para cualquier fin que pueda considerarse ilegal o perjudicial;
  • También estamos trabajando para incorporar marcas de agua a todo el audio generado por nuestro modelo, de modo que pueda rastrearse hasta nosotros de forma inmediata;
  • Cuando utilizamos voces reconocibles, lo hacemos con fines de demostración y en contextos que no generan conflictos de intereses;
  • Al mismo tiempo, buscamos apoyar a propietarios de voces y a quienes poseen sus licencias para que reclamen sus derechos, y revisaremos y tomaremos medidas ante todas las infracciones conocidas.

Mirando al futuro: mejora tu propia voz

En el futuro, tenemos previsto combinar las capacidades de nuestros modelos de generación de voz y Clonar Voz IA para permitir que usuarios mejoren sus propias voces. Podrás clonar tu voz y manipularla para lograr el efecto que quieras. Si crees que tu estilo natural al hablar es un poco monótono, podrás añadirle variedad. Si no te gusta que te graben, podrás modificar el resultado para que suene más natural. Cualquier persona que necesite crear audio con su propia voz para cualquier fin, ya sea una presentación pregrabada o un mensaje de audio, podrá hacerlo con nuestro conjunto de herramientas con solo pulsar un botón.

Feliz Año Nuevo

Al terminar 2022, queremos dar las gracias a usuarios de nuestra beta por vuestra participación continua y vuestros comentarios. Muchas de las funciones que estamos desarrollando nacen de vuestras aportaciones y sugerencias. No podríamos estar más felices de contar con vosotros y os deseamos a todos un Feliz Año Nuevo.

Beta de Eleven Labs
Ve aquí para registrarte en nuestra plataforma beta y probarla por ti mismo. Estamos realizando mejoras constantemente, y en esta fase inicial cualquier opinión de usuarios es muy valiosa para nosotros.

Artículos relacionados

Crea con el audio IA de la más alta calidad