Aller au contenu

Modèles d’interaction : Créer un dialogue naturel entre humains et IA

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Quiconque a déjà tenté d’interrompre un agent vocal IA en pleine phrase sait ce que l’on ressent face à un système qui n’est pas conçu pour la conversation humaine. Le rythme est mauvais, la voix semble détachée du contenu et, même lorsque l’information est correcte, l’interaction paraît étrange : ce n’est pas comme parler à une personne compétente, mais comme naviguer dans un logiciel qui utilise des mots.

Cette impression artificielle a une cause structurelle : de nombreux systèmes d’IA vocale ont été conçus pour gérer des tours de parole, pas des conversations. Ils écoutent, traitent et répondent à un échange à la fois. Cela fonctionne pour des démonstrations simples, mais échoue dès que la conversation devient émotionnelle et imprévisible.

Les modèles d’interaction sont des systèmes d’IA conçus pour communiquer en temps réel par audio et par texte. Ils perçoivent non seulement ce qui est dit, mais aussi quand cela est dit et le type de réponse émotionnelle qu’exige le moment. Cet article explique ce qui distingue un modèle d’interaction, son importance pour les entreprises qui déploient l’IA vocale et la manière dont ElevenLabs le développe.

En résumé

  • La plupart des systèmes d’IA vocale échouent en conversation réelle, car ils ne savent pas gérer les interruptions, les silences ni le contexte qui se prolonge d’un tour de parole à l’autre.
  • La pile d’interaction d’ElevenLabs est conçue pour gérer les interruptions, les pauses et les chevauchements de parole sans perdre le contexte ni rompre le fil de la conversation.
  • ElevenLabs développe de véritables modèles d’interaction grâce à une architecture en cascade avancée, à ses propres systèmes de Speech to Text (STT) et de Text to Speech (TTS), ainsi qu’à une pile optimisée pour une faible latence et des échanges naturels.

Pourquoi la plupart des communications vocales entre humains et IA ne paraissent pas naturelles

La plupart des systèmes d’IA vocale traitent une conversation comme une série d’entrées et de sorties distinctes : le système attend un segment de parole, le réduit à du texte, traite ce texte, puis répond. Cela fonctionne pour les interactions de type commande-réponse, mais une conversation réelle n’est pas une succession nette d’échanges textuels. C’est un va-et-vient continu, ponctué de pauses et d’interjections. 

Supprimer le flux entre les tours de parole et le contexte qui se prolonge entre eux entraîne trois défaillances précises :

  • Il vous interrompt ou vous fait attendre : Le système ne distingue pas une pause pour réfléchir d’un tour de parole terminé. Il intervient donc alors que vous parlez encore ou reste silencieux après votre arrêt. Marquez une pause au milieu d’une phrase et il vous coupe ; terminez votre propos et vous attendez dans un silence pesant.
  • Il ne peut plus réagir une fois qu’il a commencé à parler : Dès que le système commence à répondre, il cesse d’écouter. Si vous l’interrompez pour réorienter l’échange, il continue de fournir une réponse à une question que vous avez déjà abandonnée, car il ne détecte aucun changement.
  • Il oublie au fil de l’échange : Chaque tour de parole est traité de manière isolée : le contexte d’il y a cinq échanges ne se prolonge pas. Vous devez alors vous répéter, ou le système répond comme si la conversation venait de commencer.

On obtient ainsi une conversation qui peut être fonctionnellement correcte tout en paraissant inadaptée. 

Ce que les modèles d’interaction font que l’IA vocale traditionnelle ne peut pas faire

Là où l’IA vocale traditionnelle traite un tour de parole à la fois, un modèle d’interaction gère l’ensemble de la conversation en tenant simultanément compte de ce qui est dit et de ce qui doit se passer ensuite. Sur le plan fonctionnel, il répond à l’état réel de l’échange, et non à la seule entrée la plus récente.

Les modèles d’interaction offrent :

  • Une réponse en temps réel : Le système est conçu pour répondre au rythme d’une conversation, avec un cycle de bout en bout pouvant s’exécuter en moins d’une seconde selon la configuration.
  • Une gestion naturelle des interruptions, silences et chevauchements : Il distingue une pause de réflexion d’un tour de parole terminé, sans couper la parole ni laisser de silence. Lorsque le client parle en même temps que lui pour réorienter l’échange, il gère le chevauchement sans perdre le contexte ni désorganiser la conversation.
  • Une continuité sur l’ensemble de l’échange : Au lieu de réinitialiser le contexte à chaque tour de parole, le système conserve l’historique de la conversation. Ainsi, ce qu’il dit au dixième tour reflète tout ce qui s’est passé depuis le premier.
  • Une expression adaptative : La voix peut être programmée pour s’adapter — plus calme, plus directe ou plus rassurante — selon la tâche qu’elle exécute.
  • L’exécution parallèle des tâches : Le système récupère des informations, exécute des appels d’outils et continue de parler simultanément, plutôt que de se taire pendant une recherche.

Un modèle d’interaction se révèle lors d’un appel qui se passe mal. Dans l’enregistrement ci-dessous, un client appelle à propos de l’annulation d’un vol. Il est tendu et a besoin d’une résolution rapide.

mark screenshot w caption space

L’agent reconnaît immédiatement, à partir des mots employés par le client, son urgence et sa frustration. Il adapte son ton, gère l’interruption sans perdre le fil et utilise ses outils connectés pour proposer des solutions concrètes au vol annulé. Au final, le client obtient une résolution sans avoir besoin d’un agent humain.

Comparez cela aux agents classiques, fondés sur les tours de parole et utilisés aujourd’hui. Ces systèmes attendraient chaque pause, répondraient depuis une base neutre et ne percevraient pas la frustration du client. Après quelques échanges qui ne répondent pas à ce que ressent réellement l’appelant, l’appel devrait probablement être transféré à un humain, laissant le client encore plus frustré qu’au départ.

Comment ElevenLabs développe les modèles d’interaction

Notre pipeline conversationnel utilise une architecture en cascade avancée plutôt qu’une architecture fusionnée. Au lieu qu’un seul modèle gère tout, chaque étape repose sur un composant spécialisé.

Cette approche nous permet d’optimiser chaque étape du pipeline indépendamment et de remplacer le modèle d’un composant sans reconstruire l’ensemble du système. Comme nous développons ces composants en interne, ils sont co-optimisés pour se transmettre un contexte riche, et non de simples données. Le pipeline se comporte donc comme une conversation cohérente plutôt que comme une chaîne d’outils distincts.

Structure d’un modèle en cascade

Flowchart of an audio processing system: Audio, Speech-to-Text, LLM, Text-to-Speech, Audio in an interaction model

Structure d’un modèle fusionné

Audio processing flowchart: Audio > Combined System (STT, LLM, TTS, Tools) > Audio.

Images : modèles en cascade ou fusionnés

Voici les technologies qui composent actuellement le pipeline :

  • Scribe v2 Realtime : Notre modèle STT développé en interne transcrit la parole en environ 150 ms dans plus de 90 langues, tout en résistant au bruit de fond, aux accents, aux interruptions et aux événements non verbaux tels que les rires et les pauses. Il traite également le vocabulaire spécifique à chaque domaine, des termes médicaux au jargon financier.
  • Prise de tour spéculative : Ce système décide quand parler, faire une pause ou attendre en interprétant le flux de la conversation, plutôt qu’en s’appuyant sur un seuil de silence rigide. Les améliorations de notre modèle de détection d’activité vocale l’aident à mieux filtrer les paroles en arrière-plan et les réponses courtes, pour une prise de tour plus naturelle.
  • Eleven v3 Conversational : Notre modèle TTS le plus expressif, conçu pour le dialogue en direct. Il conserve la tonalité émotionnelle de la conversation d’un tour de parole à l’autre : l’expression de l’agent au dixième tour reflète ainsi tout ce qui a précédé, et non uniquement la réponse la plus récente.
  • Expressive Mode : Basé sur Eleven v3 Conversational et le système de prise de tour, Expressive Mode contrôle la manière dont l’agent s’exprime selon le moment : il désamorce les tensions lorsque les clients sont frustrés, rassure lorsqu’ils sont perdus et adopte un ton direct lorsque la clarté est requise. Il lit également les balises expressives ; le modèle peut donc s’appuyer sur des indications telles que [laughs], [whispers] ou [sighs] pour façonner certains moments de l’expression.
  • Flash v2.5 : Notre modèle TTS à faible latence prend en charge 32 langues et génère la parole en moins de 75 ms. Lorsque la latence est prioritaire, il maintient le temps de réponse dans le rythme naturel d’un échange humain.
  • Speech Engine : La couche de connexion qui relie la pile en connectant votre serveur à notre ElevenAPI via WebSocket, avec une connexion par conversation. Nous gérons le STT et le TTS tandis que votre serveur exécute le LLM, afin que les équipes techniques puissent utiliser leur propre modèle et conserver la logique conversationnelle sur leur infrastructure.

Ces modèles sont constamment améliorés et de nouvelles versions sont publiées régulièrement. Chaque version réduit l’écart entre parler à un logiciel et parler à une personne, avec des réponses plus rapides, une reconnaissance émotionnelle plus fine, davantage de langues et une expression plus fluide.

Parler tout en réfléchissant

Toutes les parties d’un modèle d’interaction n’ont pas besoin de s’exécuter dans un ordre strict. ElevenAgents peut continuer à travailler en arrière-plan pendant que la conversation se poursuit, plutôt que de laisser systématiquement un silence entre une question et une réponse. 

Plusieurs systèmes essentiels fonctionnent ensemble pour permettre de parler et réfléchir simultanément :

  • Appels d’outils parallèles : L’agent peut interroger une base de données, exécuter un outil ou vérifier le statut d’une commande tout en parlant encore, afin que la récupération d’informations ne ressemble jamais à une pause dans la conversation. 
  • Délai d’attente souple : Si un LLM met plus de temps que prévu à générer une réponse, l’agent prononce une courte formule d’attente comme « Laissez-moi réfléchir » ou « hmmm », plutôt que de laisser un silence gênant. Délai d’attente souple aide à maintenir un flux conversationnel naturel et réduit le risque d’interruptions. 
  • Termes à ignorer lors d’une interruption : Plutôt que d’utiliser un seuil de silence fixe, le système cherche à interpréter le sens de ce qui est dit afin de déterminer intuitivement quand un tour de parole est réellement terminé. De même, de brèves marques d’acquiescement telles que « d’accord » ou « hum-hum » peuvent être configurées pour passer sans déclencher une interruption complète, afin que l’agent ne perde pas le fil à chaque interjection de l’appelant.

Ensemble, ces systèmes évitent que l’agent donne l’impression de mettre une réponse en mémoire tampon ou de la charger. Ils forment un moteur conversationnel fluide qui comble naturellement les temps morts comme le ferait une personne, tout en traitant des informations et en réfléchissant en arrière-plan.

Comment fonctionne réellement une conversation avec ElevenLabs

Les composants ci-dessus ne s’exécutent pas proprement les uns après les autres. Ils se chevauchent. Voici comment un agent ElevenLabs traiterait, au cours d’un appel au support, la question d’un appelant : « Ma commande a-t-elle déjà été expédiée ou est-elle toujours en cours de traitement ? »

  1. L’appelant parle : L’audio est transmis à ElevenLabs via la connexion WebSocket, et Scribe commence la transcription en temps réel, avec environ 150 ms de décalage sur la voix. 
  2. Le système interprète le flux : Pendant que Scribe transcrit encore, la prise de tour spéculative évalue déjà si l’appelant a terminé ou s’il est en pleine réflexion. La fin « ou est-elle toujours en cours de traitement ? » est interprétée comme un passage de relais plutôt que comme une pause ; elle déclenche donc l’étape suivante au lieu d’attendre en silence.
  3. Le LLM rassemble le contexte et répond : La question transcrite est envoyée au LLM avec l’historique de la conversation, l’enregistrement de la commande récupéré depuis les propres systèmes de l’entreprise via RAG, les résultats des outils utilisés plus tôt dans l’appel et le prompt système. Il analyse l’ensemble et génère une réponse fondée sur la commande réelle de l’appelant, plutôt qu’un message de statut générique.
  4. Eleven v3 synthétise la réponse : Le texte devient un audio naturel. Si Expressive Mode est activé, la réponse porte des indications d’expression adaptées au moment : une mise à jour de routine paraît ainsi simple et posée, plutôt que neutre. Lorsque la latence est prioritaire, Flash réalise la synthèse en moins de 75 ms.
  5. La réponse est diffusée : L’audio commence à être lu avant la fin de la synthèse, de sorte que l’appelant entend le début de la réponse pendant que le reste est encore généré. 
  6. Le cycle se répète : chaque nouveau tour de parole conserve le ton, le contexte et l’historique de la conversation.

Tout au long de ce processus rapide, la conversation paraît naturelle. L’appelant cesse de s’adapter à la machine : il ne ralentit pas, n’articule pas excessivement et n’attend pas de bip. Il parle simplement, comme il le ferait avec une personne.

Déployez des agents vocaux naturels dans toute votre entreprise

Tout ce qui est décrit ici est déjà en production, et non sur une feuille de route. De l’architecture en cascade au pipeline sous la seconde, des entreprises du monde entier utilisent déjà ElevenAgents pour gérer à grande échelle de véritables conversations clients.

Cela inclut les environnements réglementés et à forts enjeux, car l’architecture de nos agents prend en charge des garde-fous, des journaux d’audit et des contrôles de conformité. ElevenLabs est certifié SOC 2 Type II, ISO 27001, HIPAA et PCI DSS Level 1, avec Zero Retention Mode et un hébergement des données en Europe pour les équipes qui doivent conserver leurs données dans un périmètre précis.

Prêt à mettre un agent au travail ? Vous pouvez créer un agent et commencer à le configurer dans la console, ou contacter notre équipe commerciale pour discuter d’un déploiement adapté à votre environnement.

FAQ sur les modèles d’interaction

Articles similaires

Créez avec l'audio IA de la plus haute qualité