La première IA capable de rire
- Publié
ÉcouterÉcouter cet article
Dans notre précédent article, nous avons présenté quelques extraits longs générés par notre outil de synthèse vocale et expliqué brièvement comment la conception unique de notre modèle lui permet de produire une voix au rythme naturel, sans effet robotique. Aujourd’hui, nous allons vous montrer qu’il est également particulièrement riche sur le plan émotionnel et attentif au contexte. Il est ainsi aussi captivant à écouter qu’adapté à de nombreux usages, de la narration de livres et de jeux vidéo à la publicité.
Émotions
Les deux atouts de notre modèle — sa fluidité et son intonation juste — reposent sur la richesse des données d’entraînement qu’il a analysées (plus de 500 000 heures), mais le facteur déterminant réside dans la manière dont il apprend à partir de ces données, liée à sa conception. À la base, il est conçu pour comprendre les émotions exprimées à l’écrit et déterminer si le locuteur doit sembler heureux, en colère, triste ou neutre. Voici quelques exemples :
Toutes les différences d’intonation et d’ambiance proviennent uniquement du texte : aucun autre élément n’a influencé le résultat. La ponctuation et le sens des mots jouent un rôle déterminant dans la manière de prononcer une phrase. Observez également comment, lorsque le locuteur se réjouit de sa victoire, le modèle produit de façon convaincante des sons qui ne font pas partie de la parole habituelle, comme le rire (nous publierons bientôt une compilation des différents rires que notre IA peut produire). De même, il amplifie justement la réaction lorsque le locuteur trouve quelque chose hilarant : c’est « trop trop drôle ».
Contexte
Mais connaître le sens de chaque mot ne suffit pas. Notre modèle est tout aussi sensible au contexte plus large de chaque énoncé : il détermine si un élément a du sens en fonction de ses liens avec le texte qui le précède et le suit. Cette vision d’ensemble lui permet d’intoner correctement des passages plus longs en leur appliquant un schéma émotionnel cohérent qui accompagne une même idée sur plusieurs phrases, comme l’illustrait notre précédent article avec des contenus plus développés. Elle l’aide aussi à éviter les erreurs de logique. Par exemple, certains mots s’écrivent de la même façon, mais ont des sens différents, comme « read » au présent et au passé, ou « minute », qui peut désigner une unité de temps ou quelque chose de très petit. Le choix de la bonne interprétation dépend du contexte :
Langue écrite et langue parlée
Notre plateforme étant conçue pour répondre aux exigences des contenus longs, notre modèle doit également comprendre que les symboles, les abréviations et certaines conventions courantes à l’écrit doivent être prononcés d’une manière précise, voire ne pas être lus littéralement. Par exemple, le modèle doit savoir que FBI, TNT et ATM ne se prononcent pas comme UNESCO ou NASA. De même, $3tr est parfaitement compréhensible à l’écrit, mais à l’oral, cela doit devenir « trois mille milliards de dollars ».
Intervention humaine
Reconnaître ces distinctions subtiles est essentiel, car notre objectif est de réduire au minimum le besoin d’intervention humaine dans le processus de génération. Nous ne mettons pas en avant la capacité de notre outil à générer un livre audio en quelques minutes pour que quelqu’un doive ensuite écouter l’intégralité de l’audio et réécrire tout le texte. Toutefois, même si nous actualisons continuellement les règles de prononciation de notre modèle, certains éléments peuvent encore le dérouter. C’est pourquoi nous développons actuellement un système de signalement des incertitudes : les utilisateurs pourront repérer instantanément les passages que le modèle a jugés problématiques et lui indiquer comment les prononcer.
D’innombrables applications
Toutes les capacités que nous avons présentées nous rapprochent d’un outil de génération vocale par IA toujours plus polyvalent.
Les éditeurs de presse ont déjà constaté qu’accroître leur présence audio est un excellent moyen de fidéliser leurs abonnés. Intégrer une lecture audio à chaque article permet aux lecteurs de l’écouter tout en faisant autre chose. Les éditeurs qui le font font souvent appel à des doubleurs, ce qui est coûteux et ne permet pas de couvrir tous les articles. Ils peuvent aussi demander à leurs journalistes de lire les articles, une tâche longue et donc également coûteuse. Ceux qui utilisent la synthèse vocale pour donner une voix à leurs contenus réduisent leurs coûts, mais au prix d’un compromis sur la qualité. Avec ElevenLabs, ce compromis n’est plus nécessaire : vous bénéficiez des avantages des deux approches.
Imaginez aussi générer des livres audio avec des voix off distinctes et émotionnellement convaincantes pour chaque personnage, en quelques minutes. Cela ouvre non seulement de nouvelles façons d’interagir avec les livres, mais facilite aussi grandement l’accès aux personnes ayant des difficultés d’apprentissage.
Pensez aux possibilités désormais offertes aux développeurs de jeux vidéo : ils n’ont plus à se demander si un personnage est suffisamment important pour justifier le coût considérable que représente habituellement son interprétation par un acteur réel. Tous les PNJ peuvent désormais avoir leur propre voix et leur propre personnalité.
Les agences de publicité et les producteurs peuvent désormais expérimenter librement et ajuster les voix off au ton de n’importe quelle campagne, qu’il s’agisse d’une chaîne de télévision sportive ou d’une marque de montres de luxe. La voix de tout acteur peut être concédée sous licence pour le clonage, afin d’appliquer les modifications instantanément, sans sa présence physique. S’ils optent pour une voix entièrement synthétique, les annonceurs n’ont pas non plus à se préoccuper des indemnités liées aux droits vocaux.
Les assistants virtuels peuvent gagner en naturel, à la fois parce que le clonage de voix leur permet de s’exprimer avec une voix familière pour un utilisateur donné et parce que cette nouvelle profondeur d’interprétation rend les interactions plus naturelles.
ElevenLabs Beta
Rendez-vous ici pour vous inscrire à notre plateforme bêta et l’essayer. Nous l’améliorons continuellement, et les retours des utilisateurs sont très précieux à ce stade précoce. Profitez-en.




