Clonage de voix instantané

Découvrez comment cloner instantanément votre voix avec nos modèles de pointe.

Fonctionnalité de clonage de voix

Créer un clonage de voix instantané

Lors du clonage d’une voix, il est important de tenir compte de ce sur quoi l’IA a été entraînée : les langues et le type de jeu de données. Consultez la page des modèles pour en savoir plus sur chaque modèle et ses points forts.

Guide

Si vous avez un doute sur ce qui est autorisé d’un point de vue juridique, consultez les Conditions d’utilisation et nos informations sur la sécurité de l’IA pour en savoir plus.

1

Accéder à la page de clonage de voix instantané

Dans le Dashboard ElevenLabs, sélectionnez la section Voix à gauche, puis cliquez sur l’icône plus.

Dans la fenêtre modale, sélectionnez Instant Voice Clone.

2

Importer ou enregistrer votre audio

Suivez les instructions à l’écran pour importer ou enregistrer votre audio.

3

Confirmer les détails de la voix

Fenêtre modale de clonage de voix IVC

Nommez et étiquetez votre clonage de voix, confirmez que vous disposez des droits et du consentement nécessaires pour cloner la voix, puis cliquez sur Enregistrer la voix.

4

Utiliser votre clonage de voix

Dans la section Voix du Dashboard, cliquez sur Mes voix, puis sur Utiliser la voix pour commencer à l’utiliser.

Bonnes pratiques

Enregistrez au moins 1 minute d’audio

Évitez d’enregistrer plus de 3 minutes : cela n’apportera que peu d’améliorations et peut même, dans certains cas, nuire au clonage.

La façon dont l’audio a été enregistré est plus importante que la durée totale des échantillons. Le nombre d’échantillons utilisés importe peu : c’est leur durée cumulée qui compte.

Nous recommandons environ 1 à 2 minutes d’audio clair, sans réverbération, artefacts ni bruit de fond. Lorsque nous parlons de « qualité audio ou d’enregistrement », nous ne faisons pas référence au codec, tel que MP3 ou WAV, mais à la manière dont l’audio a été capturé. Concernant les codecs audio, nous conseillons toutefois d’utiliser du MP3 à 128 kb/s ou plus. Des débits binaires plus élevés n’ont pas d’impact significatif sur la qualité du clonage.

Gardez un audio cohérent

L’IA tentera d’imiter tout ce qu’elle entend dans l’audio, notamment le débit de parole, les inflexions, l’accent, la tonalité, le rythme et l’intensité de la respiration, ainsi que les bruits et les claquements de bouche. Les bruits et artefacts susceptibles de la perturber sont également pris en compte.

Veillez à ce que la voix conserve un ton et une interprétation cohérents tout au long de l’enregistrement. Assurez-vous aussi que la qualité audio reste cohérente dans tous les échantillons. Même si vous n’utilisez qu’un seul échantillon, veillez à sa cohérence sur toute sa durée. Fournir à l’IA un audio très dynamique, avec de fortes variations de hauteur et de volume, produira des résultats moins prévisibles.

Reproduisez votre interprétation

Il est également important de garder à l’esprit que l’IA cherchera à reproduire l’interprétation de la voix fournie. Si vous parlez lentement, d’une voix monotone et peu expressive, c’est ce que l’IA imitera. À l’inverse, si vous parlez vite avec beaucoup d’émotion, c’est ce que l’IA tentera de reproduire.

Il est essentiel que la voix reste cohérente dans tous les échantillons, non seulement dans son ton, mais aussi dans son interprétation. Trop de variations peuvent perturber l’IA et générer des résultats plus variables d’une génération à l’autre.

Trouvez un bon équilibre de volume

Trouvez un bon équilibre de volume afin que l’audio ne soit ni trop faible ni trop fort. L’idéal est un niveau RMS compris entre -23 dB et -18 dB, avec un véritable pic à -3 dB.

FAQ

Le Clonage de voix professionnel, contrairement au Clonage de voix instantané qui vous permet de cloner rapidement des voix avec moins de 2 minutes d’audio, vous permet d’entraîner un modèle plus réaliste de votre voix. Pour cela, un modèle dédié est entraîné sur un vaste ensemble de données vocales afin de produire un modèle pratiquement impossible à distinguer de votre voix d’origine.

Les clones vocaux professionnels nécessitent un ajustement fin et un entraînement. Vous devrez donc patienter avant de pouvoir utiliser votre clone vocal. Il est difficile de donner une estimation, car cela dépend du nombre de personnes devant vous dans la file d’attente et de plusieurs autres facteurs, mais l’ajustement fin prend généralement entre 3 et 6 heures.

Vous recevrez une notification par email lorsque votre clone vocal professionnel sera prêt.

Le clonage de voix instantané peut être un peu complexe, et nous proposons quelques recommandations générales. Elles restent toutefois des recommandations. Il n’existe pas de règles strictes concernant le nombre ou la durée des échantillons. Certains utilisateurs ont obtenu d’excellents résultats avec des échantillons de seulement 30 secondes, tandis que d’autres ont obtenu de moins bons résultats avec 10 minutes d’audio. Voici néanmoins quelques éléments à prendre en compte.

  • La qualité audio est l’aspect le plus important pour le clonage de voix instantané.
  • Le nombre d’échantillons n’a pas d’importance ; c’est la durée totale qui compte. Au-delà de 2 à 3 minutes d’audio, l’amélioration est minime et cela peut même, dans certains cas, nuire à la stabilité du clone.

Pour le clonage de voix instantané et le clonage de voix professionnel, nous acceptons plusieurs types de fichiers. Nous recommandons vivement le format MP3 à 192 kbps ou plus.

Format recommandé

  • MP3, 192 kbps ou plus

Durée recommandée

  • Clonage de voix instantané : 1 à 2 minutes d’audio de bonne qualité
  • Clonage de voix professionnel : 30 à 180 minutes d’audio de bonne qualité

Les formats non compressés tels que WAV n’améliorent généralement pas la qualité du clone et peuvent entraîner des problèmes lors de l’importation. Privilégiez plutôt la qualité de l’enregistrement : utilisez un enregistrement propre, sans bruit de fond, réverbération de la pièce ni plusieurs intervenants, avec un volume et une tonalité constants, et sans longs silences.

Pour plus d’informations, consultez Clonage de voix instantané (IVC) et Clonage de voix professionnel (PVC).

Chez ElevenLabs, nous nous engageons pleinement à respecter les droits de propriété intellectuelle et à mettre en place des mesures de protection contre les utilisations abusives potentielles de notre technologie :

  • Nous collaborons uniquement avec des clients qui respectent nos Conditions d’utilisation et notre Politique d’utilisation interdite, lesquelles interdisent toute utilisation malveillante de notre technologie à des fins pouvant être considérées comme illégales ou nuisibles ;
  • Nous cherchons à soutenir les détenteurs de voix et leurs ayants droit dans la revendication de leurs droits, et toutes les atteintes connues font l’objet d’un examen et de mesures appropriées ;
  • Tout audio généré par nos modèles peut être instantanément retracé jusqu’à l’utilisateur responsable de sa génération.

La technologie que nous développons est récente et une réglementation claire doit encore être mise en place. En tant que laboratoire de recherche en IA, l’un de nos objectifs est de sensibiliser à l’existence de cette technologie, à son potentiel et à ses limites.

Pour un guide complet, nous vous recommandons vivement de consulter notre documentation sur Instant Voice Cloning et Professional Voice Cloning.

En résumé : une entrée de bonne qualité et cohérente produit un résultat de bonne qualité et cohérent.

Durée

  • Instant Voice Cloning : 1 à 2 minutes d’audio de bonne qualité
  • Professional Voice Cloning : 30 à 180 minutes d’audio de bonne qualité

Utilisez les extraits audio les meilleurs et les plus clairs que vous pouvez trouver. Ils ne doivent contenir qu’un seul locuteur, sans bruit de fond ni interférences, et sa voix doit être forte et claire.

Plutôt que d’utiliser de nombreux extraits de qualité différente uniquement pour augmenter la durée, privilégiez les extraits dont la qualité du microphone est manifestement très élevée et dont la qualité ainsi que le ton restent cohérents, plutôt que de chercher à augmenter la durée totale.

Assurez-vous que la majorité des dialogues de vos extraits correspond au style de parole et à l’intonation du locuteur que vous préférez. Évitez d’inclure trop de passages où le locuteur s’écarte des caractéristiques vocales que vous souhaitez obtenir.

Si nécessaire, utilisez un outil de suppression du bruit pour réduire les bruits de fond.

Vous trouverez plus d’informations dans notre documentation ici.

Oui. Vous pouvez cloner votre voix dans toute langue prise en charge par Flash v2.5 et Multilingual v2. Consultez la liste complète des langues prises en charge ici.

Vous pouvez également cloner une voix qui parle une langue non prise en charge par l’IA. Le clone peut reproduire le ton du locuteur, mais il ne pourra pas parler cette langue et les résultats peuvent être imprévisibles. Nous ne le recommandons pas.

Vous ne pouvez pas télécharger ni exporter vos clones de voix sous forme de fichiers autonomes. Les clones de voix restent dans votre compte ElevenLabs.

Vous pouvez néanmoins utiliser vos voix ElevenLabs en dehors du site ElevenLabs. Grâce à votre clé API, des services tiers peuvent appeler l’API ElevenLabs et générer de la parole avec les voix de votre compte.

Si vous souhaitez recréer un clone plus tard, conservez les échantillons audio d’origine utilisés pour le créer. Chaque clone aura un son légèrement différent, même si vous utilisez le même audio.

ElevenLabs propose deux options de clonage :

  • Clonage de voix instantané : des résultats rapides à partir d’environ 1 à 3 minutes d’audio. Cette option fonctionne bien pour la plupart des voix, mais peut rencontrer des difficultés avec les accents rares ou les voix singulières.
  • Clonage de voix professionnel : une fidélité supérieure, avec 30 minutes à environ 3 heures d’audio. L’ajustement fin prend généralement entre 3 et 6 heures, et peut être plus long si de nombreuses voix sont en attente.

Si le Clonage de voix instantané ne restitue pas bien votre voix ou votre accent, essayez le Clonage de voix professionnel.

Vous ne pouvez pas modifier l’accent ou le ton d’un clone après sa création. Pour améliorer le résultat, modifiez les échantillons audio que vous utilisez. De petits changements dans les échantillons peuvent faire une grande différence.

Vous verrez cette erreur si vous essayez d’utiliser votre clone vocal professionnel (PVC) avant que le processus d’affinage ne soit terminé et qu’il soit disponible à l’utilisation.

Lorsque vous créez un PVC, plusieurs processus doivent être effectués avant qu’il puisse être utilisé.  Après avoir vérifié votre voix, elle sera traitée et mise en file d’attente pour l’affinage.   Selon le nombre d’autres voix actuellement en attente d’affinage, nous estimons que ce processus prend généralement entre 3 et 6 heures, mais il peut prendre jusqu’à 24 heures.

Vous pouvez vérifier la progression de votre PVC dans Mes voix en trouvant la voix dans votre liste de voix, puis en cliquant sur Voir pour afficher plus de détails.  Vous pouvez survoler chaque modèle pour voir son statut actuel.  

Pour en savoir plus sur la signification de chaque statut, consultez Que signifie le statut de mon clone vocal professionnel ?

Lorsque l’affinage de votre PVC est terminé et qu’il est disponible à l’utilisation, vous verrez une notification contextuelle et recevrez également un email.

No results