Aller au contenu

Cette Voix n'Existe Pas - Voix IA Générative

Publié

ÉcouterÉcouter cet article

Ces derniers temps, tout le monde semble parler d’IA générative. Les grands modèles de langage et de génération d’images à partir de texte, propulsés par le deep learning, comme ChatGPT, Stable Diffusion, DALL-E et Midjourney, ont suscité beaucoup d’effervescence dans le monde de la tech et au-delà. Beaucoup les considèrent comme les avancées récentes les plus marquantes en IA. Qu’on partage ou non cet avis, le sentiment général est qu’une technologie très puissante vient d’émerger. En 2023, nous entendrons parler de modèles capables de vous aider à dessiner ou à créer des vidéos. Comme pour le dernier smartphone à la mode, nous nous demanderons bientôt quel est le dernier modèle de fondation en date. Pourtant, malgré cet engouement, un domaine des médias génératifs reste selon nous largement sous-estimé : l’IA vocale. C’est aussi le domaine dans lequel nous voulons devenir leaders. Chez Eleven, nous exploitons chaque jour le potentiel des techniques de deep learning pour alimenter nos outils réalistes de Text to Speech et de Clonage de Voix. Nous déployons désormais notre propre modèle génératif, qui vous permet de concevoir de toutes nouvelles voix synthétiques à partir de zéro.

Générateur de voix — concevez une voix

Chaque jour, nos utilisateurs se rendent sur la plateforme pour donner vie à leurs personnages, qu’il s’agisse de livres audio, de jeux ou de fan fiction. Nous avons constaté que notre catalogue actuel de voix était trop restreint pour permettre à chacun de trouver des voix adaptées à ses contenus tout en restant exclusives à chaque utilisateur. Notre solution : vous permettre de concevoir des voix synthétiques entièrement nouvelles.

L’idée nous est venue en analysant les méthodes que nous utilisons actuellement pour la synthèse vocale et le clonage de voix. Ces deux processus exigent un moyen d’encoder les caractéristiques d’une voix donnée. Les représentations vectorielles de locuteurs portent cette identité : elles constituent une représentation vectorielle de la voix d’un locuteur. Nous avons compris que nous pouvions échantillonner la distribution de ces représentations en entraînant un modèle dédié, afin de créer une infinité de nouvelles voix.

Comme nos utilisateurs recherchent principalement des caractéristiques vocales précises, nous devions leur donner davantage de contrôle sur le processus. Nous avons enrichi notre modèle d’un mécanisme de conditionnement pour générer des voix à partir de leurs caractéristiques. Il vous permet désormais de définir certains paramètres de base qui établissent l’identité de la nouvelle voix : genre, âge, accent, hauteur et style d’élocution. Autrement dit, chaque fois que vous sélectionnez « générer », même avec les mêmes paramètres de base, vous obtenez une voix entièrement nouvelle, qui n’existait pas auparavant.

Voici quelques exemples de voix conçues de cette manière :

00:00
00:00
00:00
00:00
00:00
00:00

« Design Voice » sera disponible sur notre plateforme en février, dans le cadre de Voice Lab.

À quoi cela sert-il ?

Nos outils produisent déjà une parole aussi réaliste que celle d’un humain, et nous pensons que le champ des applications possibles pour les voix artificielles ne fera que s’étendre. Nombre de ces nouvelles applications, notamment l’enregistrement audio pour des médias d’information ou des publicités, nécessiteront qu’une voix soit réservée à une marque ou à un cas d’usage précis, et qu’elle ne soit pas utilisée ailleurs. D’autres cas d’usage, comme la narration et les jeux vidéo, privilégient la flexibilité et la liberté d’expérimenter dès les premières phases de développement. Plutôt que de créer un immense catalogue de locuteurs virtuels, nous avons donc choisi de laisser aux utilisateurs le dernier mot sur les voix les mieux adaptées à leurs besoins.

Les auteurs de livres peuvent désormais non seulement convertir facilement leurs œuvres en audio, mais aussi conserver le contrôle artistique de la conception d’une narration sur mesure. Leur public bénéficie ainsi de nouvelles façons intéressantes d’interagir avec les publications, tandis que le nombre de livres que nous pourrons écouter augmente considérablement.

Les éditeurs de presse se tournent de plus en plus vers l’audio, et choisir des voix distinctives pour représenter leurs publications est une tâche importante : de nombreux auditeurs accordent autant d’importance à la forme qu’au fond. Les éditeurs ont également la certitude qu’une voix donnée les représente, et eux seuls.

Les développeurs de jeux vidéo peuvent désormais donner une voix à une multitude de PNJ jusque-là muets, avec tous les outils nécessaires à portée de main. Ils peuvent réduire leurs coûts sans compromettre la qualité, mais aussi concevoir des voix entièrement uniques pour les univers virtuels qu’ils créent.

Les créatifs publicitaires ont besoin de voix off adaptées à des campagnes spécifiques. Pouvoir concevoir dès le début du développement une narration percutante et pensée pour un objectif précis constitue donc un avantage considérable. Ils peuvent désormais expérimenter instantanément plusieurs voix et styles d’interprétation, sans mobiliser de ressources supplémentaires.

Des créateurs de contenus audio et vidéo de tous types aux dirigeants d’entreprise souhaitant donner une voix aux communications de leur société, les possibilités de concevoir un audio convaincant, à la fois unique et adapté à un cas d’usage précis, sont désormais infinies.

IA éthique

Tout comme le clonage de voix suscite des craintes quant aux conséquences d’une utilisation abusive, un nombre croissant de personnes s’inquiètent des effets de la prolifération des technologies d’IA sur les moyens de subsistance des professionnels. Chez Eleven, nous envisageons un avenir dans lequel les doubleurs et doubleuses pourront concéder sous licence leurs voix pour entraîner des modèles de parole destinés à des usages spécifiques, en échange d’une rémunération. Les clients et les studios continueront volontiers à faire appel à des talents vocaux professionnels dans leurs projets, et l’IA contribuera simplement à accélérer les délais de production tout en offrant davantage de liberté pour expérimenter et définir une orientation dès le début du développement. La technologie changera la manière dont l’audio parlé est conçu et enregistré, mais le fait que les doubleurs et doubleuses n’aient plus besoin d’être physiquement présents à chaque session leur donnera la liberté de participer à davantage de projets simultanément et de véritablement pérenniser leurs voix.

Nous nous réjouissons également qu’une multitude de livres, d’actualités, de jeux indépendants et d’autres contenus, dont les auteurs et développeurs ne pourraient autrement pas assumer les coûts d’enregistrement, deviennent accessibles par un autre média. Cet accès élargi offre, dans chaque cas, la possibilité d’atteindre un public plus large.

Chez Eleven, nous nous engageons pleinement à respecter les droits de propriété intellectuelle et à mettre en place des garanties contre les utilisations abusives potentielles de notre technologie :

  • Nous travaillons uniquement avec des clients qui respectent nos Conditions, lesquelles interdisent toute utilisation malveillante de notre technologie à des fins pouvant être considérées comme illégales ou nuisibles ;
  • Nous travaillons également au filigranage de tous les audios générés par notre modèle afin qu’ils puissent être immédiatement retracés jusqu’à nous ;
  • Lorsque nous utilisons des voix reconnaissables, nous le faisons à des fins de démonstration et dans des contextes ne créant pas de conflits d’intérêts ;
  • Nous cherchons parallèlement à aider les titulaires de voix et leurs concédants de licence à faire valoir leurs droits. Toute atteinte connue fera l’objet d’un examen et de mesures appropriées.

Perspectives — améliorez votre propre voix

À l’avenir, nous prévoyons de combiner les capacités de nos modèles de génération de voix et de Clonage de Voix pour permettre aux utilisateurs d’améliorer leur propre voix. Vous pourrez cloner votre voix, puis la modifier pour obtenir l’effet souhaité. Si vous trouvez votre style d’élocution naturel un peu monotone, vous pourrez lui apporter plus de variété. Si vous n’aimez pas être enregistré, vous pourrez modifier le rendu pour qu’il paraisse plus naturel. Toute personne ayant besoin de produire un audio avec sa propre voix, qu’il s’agisse d’une présentation préenregistrée ou d’un message audio, pourra le faire avec notre suite d’outils, en quelques clics.

Bonne année

Alors que 2022 touchait à sa fin, nous souhaitons remercier nos bêta-utilisateurs pour leur participation continue et leurs retours. Nombre des fonctionnalités que nous développons sont le fruit de vos contributions et suggestions. Nous sommes ravis de vous compter parmi nous et vous souhaitons à tous une très bonne année.

Eleven Labs Beta
Rendez-vous ici pour vous inscrire à notre plateforme bêta et l’essayer par vous-même. Nous l’améliorons en permanence, et les retours des utilisateurs sont très précieux à ce stade précoce.

Articles similaires

Créez avec l'audio IA de la plus haute qualité