Présentation du Modificateur de Voix
- Publié
ÉcouterÉcouter cet article
Voice Changer était initialement appelé « speech-to-speech ». Dans le contexte des agents vocaux IA, le « speech-to-speech » désigne également des architectures fusionnées dans lesquelles un seul modèle traite directement les entrées et sorties audio. ElevenAgents utilise une architecture en cascade avancée pour sa plateforme. En savoir plus : Modèles en cascade ou fusionnés.
Voice Changer
Nous avons ajouté Voice Changer à Speech Synthesis. Voice Changer est un outil de conversion vocale qui transforme l'enregistrement d'une voix pour lui donner l'apparence d'être prononcé par une autre, tout en préservant l'interprétation originale. Les émotions, le timing, le rythme et la prononciation de l'enregistrement sont ainsi conservés dans la voix de sortie.
Vous bénéficiez ainsi d'un niveau de contrôle que les prompts de synthèse vocale ne permettent pas toujours d'atteindre seuls. Il existe deux principales façons de l'utiliser.
Donnez davantage d'émotion à une voix. Toutes les voix ne réagissent pas aussi bien aux indications émotionnelles transmises par des prompts de synthèse vocale. Voice Changer vous permet d'enregistrer ou d'importer une élocution très expressive et de reproduire cette palette émotionnelle dans une autre voix. Si vous souhaitez qu'un narrateur professionnel paraisse plus chaleureux ou qu'un personnage de livre pour enfants soit plus enjoué, vous pouvez effectuer l'interprétation vous-même et laisser Voice Changer la transférer vers la voix cible.
Affinez l'interprétation vocale. Nos modèles de synthèse vocale gèrent généralement bien l'intonation dès le départ. Mais lorsque vous avez besoin d'un contrôle précis sur la manière dont une phrase est prononcée — l'accentuation, l'effet d'une pause ou la cadence — Voice Changer vous permet de la démontrer avec votre propre voix, puis d'appliquer cette interprétation à la voix de votre choix. Cette fonctionnalité sera encore plus utile une fois Voice Changer directement intégré à Studio, mais l'objectif reste le même : vous donner un contrôle précis sur votre résultat.
Voici une démonstration réalisée par un membre de notre communauté :
Recherche
Pour convertir la parole source en parole cible, nous devons exprimer le contenu de la parole source avec les caractéristiques de la parole cible. Une analogie utile est l'échange de visages : des applications qui prennent deux visages et les fusionnent, en reproduisant les traits d'une personne dans la structure cartographiée d'une autre.
Pour cela, il faut prendre l'image d'un visage et cartographier ses attributs. Les repères de l'exemple ci-dessous remplissent précisément ce rôle : ils définissent les limites à l'intérieur desquelles l'autre visage serait reproduit.
L'enjeu de la conversion vocale consiste à restituer le contenu de la parole source à l'aide des phonèmes de la parole cible. Mais cela implique un compromis, comme dans l'exemple de l'échange de visages : plus vous utilisez de repères pour cartographier les attributs d'un visage, plus vous imposez de contraintes au visage reproduit à l'intérieur. Moins de repères signifie moins de contraintes.
Il en va de même pour la conversion vocale. Plus nous privilégions la parole cible, plus nous risquons de nous désynchroniser de la parole source. Mais si nous ne lui accordons pas suffisamment de priorité, nous risquons de perdre une grande partie de ce qui la caractérise. Par exemple, si nous devions restituer l'enregistrement d'une personne criant de colère avec une voix chuchotée, le résultat poserait problème. Accorder trop de priorité aux émotions de la parole source revient à perdre l'impression qu'une voix chuchotée parle. Mettre trop l'accent sur le schéma vocal chuchoté fait perdre la charge émotionnelle de la parole source.
Produit et mises à jour récentes
Modifications des voix prêtes à l'emploi
Nous modifions les voix par défaut disponibles dans Speech Synthesis. Certaines voix seront retirées et remplacées par de nouvelles, avec plus de 20 ajouts prévus dans les semaines à venir.
Nous commencerons également à afficher dans l'interface la durée de disponibilité prévue pour chaque voix. Tout au long du mois de décembre, nous remanierons nos fonctionnalités de partage des voix et de rémunération de leur utilisation afin d'améliorer la diversité des voix. Plus de détails prochainement.
Eleven Turbo v2 et format uLaw 8 kHz
Turbo v2 est le résultat de plusieurs mois de recherche menés par notre équipe. Il est conçu pour les interactions en temps réel, mais convient à tous les cas d'usage. Il prend également en charge le format standard (m)uLaw 8 kHz pour les systèmes IVR.
Normalisation et métadonnées avec Studio
Studio prend désormais en charge les directives de soumission standard du secteur pour les livres audio, y compris l'ajustement du gain et la compression dynamique. Vous pouvez également intégrer des métadonnées (ISBN, auteur et titre) directement dans votre projet Studio.
Dictionnaire de prononciation
Il s'agit de l'une de nos fonctionnalités les plus demandées. Le mois dernier, nous avons ajouté la prise en charge des balises SSML pour indiquer la prononciation à l'aide des dictionnaires IPA et CMU avec nos modèles anglais. Nous proposons désormais la prise en charge des dictionnaires de prononciation dans l'interface de Studio : vous pouvez importer un fichier indiquant la prononciation à l'aide de l'IPA, du CMU ou de substitutions de mots (alias). Les fichiers de dictionnaire utilisent le format ouvert standard du secteur .PLS de fichier lexique.
L'IPA et le CMU sont actuellement pris en charge par Turbo v2 English. Les substitutions de mots sont prises en charge par tous les modèles et dans toutes les langues. La documentation complète est disponible ici.
Si vous avez des retours, n'hésitez pas à nous contacter sur Discord.
Essayez Voice Changer
Dites-le comme vous le souhaitez et écoutez-le dans une voix complètement différente, avec un contrôle total sur l'interprétation. Capturez les chuchotements, les rires, les accents et les nuances émotionnelles.
Dites ce que vous voulez et écoutez-le dans une voix totalement différente, avec un contrôle total sur l’interprétation. Capturez les chuchotements, rires, accents et nuances émotionnelles.




