Prise en charge de plusieurs voix
Permettez à votre agent IA de passer d’une voix à l’autre pour les conversations avec plusieurs personnages et une narration enrichie.
Vue d’ensemble
La prise en charge de plusieurs voix permet à votre agent ElevenLabs de passer dynamiquement d’une voix ElevenLabs à l’autre au cours d’une même conversation. Cette fonctionnalité permet notamment :
- Narration avec plusieurs personnages : différentes voix pour différents personnages dans les récits
- Apprentissage des langues : voix de locuteurs natifs pour différentes langues
- Agents émotionnels : changements de voix selon le contexte émotionnel
- Scénarios de jeu de rôle : voix distinctes pour différentes personnalités

Fonctionnement
Lorsque la prise en charge de plusieurs voix est activée, votre agent peut utiliser un balisage de type XML pour passer d’une voix configurée à l’autre pendant la génération de texte. L’agent revient automatiquement à la voix par défaut lorsqu’aucune voix précise n’est indiquée.
Configuration
Ajouter des voix prises en charge
Chaque voix prise en charge possède les propriétés suivantes :
- Libellé de voix : identifiant unique, par exemple « Joe », « Spanish », « Happy »
- Voix : sélectionnez parmi vos voix ElevenLabs disponibles
- Famille de modèles : choisissez Turbo, Flash ou Multilingual, facultatif
- Langue : remplacez la langue par défaut pour cette voix, facultatif
- Description : indiquez quand l’agent doit utiliser cette voix
Mettre à jour via le Dashboard
Mettre à jour via la CLI
Mettre à jour via l’API
Ouvrez votre agent dans le Dashboard, accédez à l’onglet Voice, puis repérez la section Multi-voice support. Cliquez sur Add voice pour configurer une nouvelle voix prise en charge.

Propriétés des voix
Libellé de voix
Identifiant unique que le LLM utilise pour référencer cette voix. Choisissez des libellés descriptifs, par exemple : noms de personnages : « Alice », « Bob », « Narrator » ; langues : « Spanish », « French », « German » ; émotions : « Happy », « Sad », « Excited » ; rôles : « Teacher », « Student », « Guide ».
Famille de modèles
Remplacez la famille de modèles par défaut de l’agent pour cette voix précise : Flash : génération la plus rapide, optimisée pour une utilisation en temps réel ; Turbo : vitesse et qualité équilibrées ; Multilingual : qualité maximale, idéal pour les langues autres que l’anglais ; Same as agent : utilise le réglage par défaut de l’agent.
Remplacement de la langue
Spécifiez une autre langue pour cette voix, ce qui est utile pour : les conversations multilingues, l’apprentissage des langues et les prononciations propres à une région.
Description
Indiquez le contexte dans lequel l’agent doit utiliser cette voix. Exemples :
- « Pour tous les mots ou expressions en espagnol »
- « Lorsque le contenu du message est joyeux ou enthousiaste »
- « Chaque fois que le personnage Joe parle »
Mise en œuvre
Syntaxe du balisage XML
Votre agent utilise des balises de type XML pour changer de voix :
Points clés :
- Remplacez
VOICE_LABELpar le libellé exact que vous avez configuré - Le texte en dehors des balises utilise la voix par défaut
- Les balises sont sensibles à la casse
- Les balises imbriquées ne sont pas prises en charge
Intégration au prompt système
Lorsque vous configurez des voix prises en charge, le système ajoute automatiquement des instructions au prompt de votre agent :
Exemples d’utilisation
Apprentissage des langues
Narration
Bonnes pratiques
Sélection des voix
- Choisissez des voix qui différencient clairement les personnages ou les contextes
- Testez les combinaisons de voix pour vous assurer qu’elles fonctionnent bien ensemble
- Tenez compte du ton émotionnel et de la personnalité de chaque voix
- Assurez-vous que les voix correspondent à la langue et à l’accent lors du changement de langue
Nommage des libellés
- Utilisez des libellés descriptifs et intuitifs que le LLM peut comprendre
- Gardez les libellés courts et faciles à retenir
- Évitez les caractères spéciaux et les espaces dans les libellés
Optimisation des performances
- Limitez le nombre de voix prises en charge à ce dont vous avez réellement besoin
- Utilisez la même famille de modèles lorsque possible afin de réduire la surcharge liée aux changements de voix
- Testez avec les schémas de conversation attendus
- Surveillez les temps de réponse avec plusieurs changements de voix
Consignes de contenu
- Indiquez clairement quand chaque voix doit être utilisée
- Testez les cas limites où le changement de voix peut manquer de clarté
- Prévoyez le comportement de secours lorsque les libellés de voix sont ambigus
- Assurez-vous que les changements de voix enrichissent la conversation au lieu de la distraire
Limites
- Maximum de 10 voix prises en charge par agent, y compris la voix par défaut
- Le changement de voix ajoute une latence minimale pendant la génération
- Les balises XML doivent être correctement formatées et fermées
- Les libellés de voix sont sensibles à la casse dans le balisage
- Les balises de voix imbriquées ne sont pas prises en charge
FAQ
Que se passe-t-il si j’utilise un libellé de voix non défini ?
Si l’agent utilise un libellé de voix qui n’a pas été configuré, le texte est prononcé avec la voix par défaut. Les balises XML sont ignorées.
Puis-je changer de voix au milieu d’une phrase ?
Oui, vous pouvez changer de voix au sein d’une même réponse. Chaque section balisée utilise la voix indiquée, tandis que le texte non balisé utilise la voix par défaut.
Les changements de voix affectent-ils la latence de conversation ?
Le changement de voix ajoute une surcharge minimale. La première utilisation de chaque voix dans une conversation peut présenter une latence légèrement supérieure pendant l’initialisation de la voix.
Puis-je utiliser la même voix avec différents libellés ?
Oui, vous pouvez configurer plusieurs libellés utilisant la même voix ElevenLabs, mais avec différentes familles de modèles, langues ou contextes.
Comment entraîner mon agent à utiliser efficacement le changement de voix ?
Fournissez des exemples clairs dans votre prompt système et testez minutieusement. Vous pouvez inclure des scénarios précis dans lesquels un changement de voix doit se produire, ainsi que des exemples du format de balisage XML.