Conversion de Voix
- Publié
- Dernière mise à jour
ÉcouterÉcouter cet article
Qu’est-ce que la conversion vocale ?
La conversion vocale permet de transformer la voix d’une personne en celle d’une autre. Elle repose sur un procédé appelé clonage de voix pour encoder la voix cible — c’est-à-dire la voix vers laquelle la conversion est effectuée — et générer le même message en préservant l’identité du locuteur cible tout en conservant l’intonation d’origine.
Applications
Les technologies de conversion vocale et de clonage de voix de haute qualité peuvent transformer la production, la diffusion et l’interaction avec les contenus dans de nombreux secteurs. Elles permettent d’optimiser les délais et les coûts de production, tout en offrant aux personnes qui partagent leur voix pour entraîner des algorithmes de conversion la possibilité de percevoir des revenus passifs.
- Dans le cinéma, les acteurs pourraient partager leurs bases de données vocales avec les producteurs pour créer des pistes audio sans avoir à se déplacer sur le plateau ou en studio ;
- les répliques mal prononcées pourraient être réenregistrées bien plus efficacement en postproduction ;
- la technologie peut aussi reproduire fidèlement la voix de figures historiques dans des scénarios fictifs ou redonner voix à des acteurs disparus ;
- le développement de jeux vidéo pourrait en tirer des avantages comparables : corriger des répliques ou simplement expérimenter serait possible sur place, sans que l’acteur soit physiquement présent pour l’enregistrement ;
- en médecine, les patients ayant perdu la capacité de parler, par exemple à la suite d’un traitement contre le cancer de la gorge, pourraient à nouveau communiquer avec leur propre voix ;
- les assistants virtuels pourraient être personnalisés, car les utilisateurs à domicile trouveraient peut-être plus naturel d’interagir avec la voix d’un proche plutôt qu’avec celle d’un inconnu virtuel ;
- à l’inverse, le secteur publicitaire pourrait bénéficier de voix off synthétiques aussi réalistes qu’une voix humaine, tout en évitant les questions de droits et de redevances. Lorsqu’une voix reconnaissable est précisément recherchée, les producteurs publicitaires pourraient aussi utiliser cette technologie pour cloner, avec son consentement, la voix d’un acteur sans l’obliger à participer à de longues sessions d’enregistrement ;
- les secteurs du livre audio et du podcast ne sont que deux autres marchés en croissance où le clonage de voix et la conversion vocale permettent d’optimiser la production et le montage de contenus immersifs.
Conversion vocale d’ElevenLabs
Bien que nous développions chez ElevenLabs un logiciel de conversion vocale dans le cadre de notre suite d’outils, nos recherches sur le clonage de voix et la synthèse vocale alimentent principalement le développement de notre produit phare, dont la sortie est prévue au début de l’année prochaine : l’outil de doublage automatique qui préserve l’identité vocale.
Notre objectif est de rendre tout contenu parlé accessible dans toutes les langues, avec la voix du locuteur d’origine, en un clic. Imaginez une vidéo YouTube éducative en anglais. Pour une personne qui ne parle que l’espagnol — mais qui trouverait le sujet intéressant si elle maîtrisait la langue — c’est un obstacle. Les sous-titres apportent certes une solution, mais nous voulons proposer une façon bien plus immersive et divertissante d’interagir avec les contenus. Notre ambition est de générer cette même personne prononçant naturellement le même message dans un espagnol digne d’un locuteur natif, même si elle ne le parle pas réellement.
À cette fin, le clonage de voix nous permet de préserver son identité — le timbre de sa voix. Nous l’utilisons pour générer de nouvelles phrases dans une autre langue, comme si c’était toujours la même personne qui parlait.
La conversion vocale intervient lorsque nous voulons préserver les émotions, l’intention et le style d’élocution afin de maximiser l’immersion. Nous entraînons des modèles multilingues robustes, capables d’analyser les énoncés dans la langue source et de les restituer dans la langue cible avec la bonne intonation.
Fonctionnement
Pour convertir la voix d’une personne en celle d’une autre, c’est-à-dire la parole source en parole cible, nous avons besoin d’un algorithme qui exprime le contenu de la parole source à l’aide des caractéristiques de la parole cible. Une bonne analogie serait les applications d’échange de visages, qui permettent de combiner votre visage avec celui de quelqu’un d’autre pour créer une image réunissant les deux.
Pour ce faire, il faut partir de l’image d’un visage et en cartographier les attributs. Les points de l’exemple ci-dessous remplissent cette fonction : ils délimitent la zone dans laquelle les traits de l’autre visage seraient reproduits.
Dans la conversion vocale, l’algorithme doit pouvoir encoder les propriétés de la parole cible. Il est entraîné sur un ensemble de données comprenant de nombreux exemples de cette parole. Il décompose ces échantillons jusqu’à un niveau fondamental — les « atomes » de la parole, pour ainsi dire. La parole se compose de phrases. Les phrases se composent de mots. Les mots se composent de phonèmes, qui définissent les caractéristiques de la parole cible. C’est à ce niveau fondamental que l’algorithme opère.
L’enjeu de la conversion vocale consiste à restituer le contenu de la parole source à l’aide des phonèmes de la parole cible. Mais cela implique un compromis, comme dans l’exemple d’échange de visages : plus vous utilisez de repères pour cartographier les attributs d’un visage, plus vous imposez de contraintes au visage reproduit à l’intérieur. Moins de repères signifie moins de contraintes. Il en va de même pour la conversion vocale. Plus nous privilégions la parole cible, plus nous risquons de nous éloigner de la parole source. Mais si nous ne lui accordons pas suffisamment de poids, nous risquons de perdre une grande partie de ce qui la caractérise. Par exemple, si nous devions restituer l’enregistrement d’une personne criant avec colère dans la voix de Morgan Freeman, nous serions face à un dilemme. Privilégier excessivement les émotions de la parole source ferait perdre l’impression que c’est bien Morgan Freeman qui parle. Trop insister sur son style de parole ferait disparaître la charge émotionnelle de la parole source.
Éthique
Les questions éthiques liées au clonage de voix doivent être prises en compte, car le risque de détournement de cette technologie inquiète un nombre croissant de personnes. En 2020, des escrocs ont utilisé des deepfakes audio en se faisant passer pour un PDG lors d’un appel téléphonique afin d’autoriser un virement bancaire de 35 millions de dollars. Une technologie capable de faire croire de manière convaincante qu’une personne a dit quelque chose qu’elle n’a pas dit suscite naturellement des craintes de désinformation, de diffamation ou de fraude. De même, la conversion vocale soulève d’importantes questions de violation des droits d’auteur lorsqu’elle permet aux utilisateurs de tirer profit de contenus générés sans le consentement des détenteurs des voix.
Chez ElevenLabs, nous faisons tout notre possible pour que notre technologie ne soit pas utilisée à des fins malveillantes et pour mettre en place des mesures de protection contre ses risques :
- nous collaborons uniquement avec des clients qui respectent nos Conditions, lesquelles interdisent toute utilisation malveillante de notre technologie visant à désinformer, diffamer, frauder ou servir tout autre objectif illégal ou préjudiciable ;
- les contenus vidéo synthétiques produits par ElevenLabs comportent un filigrane clair indiquant qu’ils sont générés par l’IA. Les contenus audio incluent une description explicite du fichier. Lorsque nous utilisons des voix reconnaissables, nous le faisons à des fins de démonstration et dans des contextes ne créant aucun conflit d’intérêts ;
- parallèlement, nous cherchons à aider les détenteurs de voix et leurs titulaires de licence à faire valoir leurs droits.
- Si vous avez des idées pour améliorer notre approche, écrivez-nous à ethics@elevenlabs.io
Nous pensons que la crainte des abus ne doit pas être le facteur déterminant de notre approche des nouvelles technologies puissantes. Nous devons plutôt veiller à mettre en place des garanties adaptées dès leur développement, afin de réduire les risques de préjudice tout en exploitant le potentiel qu’elles offrent à la communauté au sens large.
Perspectives
Les technologies de conversion vocale et de clonage de voix peuvent transformer le cinéma, la télévision, la création de contenu, le développement de jeux vidéo, les podcasts et les livres audio, ainsi que le secteur publicitaire. Mais leurs applications dépassent le cadre commercial, avec des usages possibles dans la médecine, l’éducation et la communication.
Le clonage de voix ouvre la voie à un avenir où tout contenu pourra être généré dans n’importe quelle langue et avec n’importe quelle voix, afin d’atteindre des millions de personnes dans le monde et de créer une économie entièrement nouvelle. Chez ElevenLabs, notre objectif est de contribuer à faire de cet avenir une réalité.

