Presentamos Eleven v4Conoce Eleven v4, nuestro modelo más expresivo hasta la fecha. Con 3 veces más créditos incluidos en Creator+ hasta el 12 de octubre

Ir al contenido

Voice Design - La Primera IA Generativa Para Audio

Publicado

EscucharEscucha este artículo

El mes pasado anunciamos que estaba en camino nuestro modelo generativo para crear voces. Por fin está aquí y es el primero de su tipo: lo llamamos Voice Design. Esta función te permite crear voces nuevas desde cero seleccionando sus cualidades principales, como el género, la edad y el acento. Incluso con los mismos ajustes de parámetros principales, nuestro modelo añade aleatoriedad cada vez que pulsas «Generar» para garantizar que cada voz que escuches sea totalmente única. Voice Design forma parte de nuestro esfuerzo más amplio por ofrecer a editores y creadores las herramientas de IA más versátiles para contar historias.

Voice Design

El modelo que hay detrás de Voice Design es en gran medida fruto de nuestra investigación sobre síntesis de voz y clonación de voz, aunque siempre nos gustó la idea de una herramienta generativa para la voz. Ya hemos visto aplicaciones prácticas de los modelos generativos de texto a imagen y de chatbots, pero faltaba una herramienta similar para el audio. Desde nuestro lanzamiento, hemos recibido solicitudes para añadir más locutores a nuestra biblioteca. En lugar de saturarla con innumerables voces y hacer que tengas que escuchar cada muestra para saber quién es quién, decidimos darle la vuelta y dejar que determines la identidad del locutor, con una variedad infinita dentro de estos límites.

Añadir cierto control a la selección de voces era importante, ya que nuestros usuarios suelen buscar características de voz concretas para sus guiones. Garantizar que cada voz generada sea única era igual de crucial, pues muchos casos de uso requieren, o al menos se benefician de, tener acceso exclusivo a una voz. Además de ofrecer a usuarios una nueva vía creativa, las voces generadas con Voice Design son completamente artificiales y no pertenecen a ninguna persona real.

Aplicaciones

Además de convertir fácilmente textos en audio de calidad con nuestra herramienta habitual de síntesis de voz, autores de libros ya pueden usar Voice Design para tener control artístico sobre la narración y dar forma a la personalidad de cada personaje con voces a medida.

Medios de comunicación que apuestan por el audio necesitan voces para sus historias. Como los narradores acaban identificándose con las publicaciones a las que representan, elegir la locución adecuada se convierte en una tarea importante que no suele repetirse. Voice Design permite a editores elegir y comparar prácticamente innumerables narradores al instante. También les da la tranquilidad de contar con una voz concreta que los represente solo a ellos.

Desarrolladores de videojuegos ya no tienen que decidir si un personaje concreto justifica los costes de grabación. Decenas de miles de personajes no jugables que antes no hablaban ahora pueden tener personalidades únicas, ampliando los límites de la inmersión virtual.

Tanto si eres creador de contenido preparando tu próximo lanzamiento como si eres responsable de comunicación corporativa y buscas poner voz a las comunicaciones de tu empresa, las posibilidades de diseñar audio realista y atractivo para casos de uso y audiencias específicos son ahora ilimitadas.

Ecosistema

Voice Design es una de las varias funciones de edición de narración que tenemos previsto lanzar este año. La siguiente es Studio; nuestra nueva estación de trabajo para estructurar textos extensos, insertar pausas, regenerar fragmentos de audio y asignar partes del texto a distintos locutores. Studio llegará a finales de marzo y contará con compatibilidad para editar la entonación más adelante, en el segundo trimestre de este año.

Artículos relacionados

Crea con el audio IA de la más alta calidad