Modèles

Découvrez comment choisir le modèle adapté à votre cas d’utilisation

ElevenAgents offre une interface unifiée pour connecter votre agent à plusieurs modèles et fournisseurs, avec flexibilité, fiabilité et optimisation des coûts.

Fonctionnalités clés

  • Accès unifié : passez d’un fournisseur et d’un modèle à l’autre avec un minimum de modifications du code
  • Haute fiabilité : basculez automatiquement vers un autre fournisseur en cas de défaillance
  • Suivi des dépenses : suivez vos dépenses sur les différents modèles

Modèles pris en charge

Les modèles suivants sont actuellement pris en charge de manière native et peuvent être configurés dans les paramètres de l’agent :

FournisseurModèle
ElevenLabsDeepSeek Flash 4.1
GLM 5.2
Qwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.8 Flash
Gemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-6.1 Sol
GPT-6 Astra
GPT-6 Sol
GPT-6 Luna
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 5.5
Claude Opus 5
Claude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5.5
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

Les tarifs sont généralement indiqués en USD par million de jetons, sauf indication contraire. Un jeton est une unité fondamentale de données textuelles pour les LLM, équivalant en moyenne à environ 4 caractères.

LLM personnalisé

Vous pouvez utiliser votre propre LLM personnalisé en indiquant l’endpoint auquel nous devons envoyer des requêtes et en fournissant des identifiants via notre stockage sécurisé de secrets. En savoir plus sur l’intégration d’un LLM personnalisé.

Certains modèles ne sont pas disponibles lorsque l’hébergement des données en Europe est activé. Consultez le RGPD et la résidence des données pour connaître les détails de disponibilité.

Choisir un modèle

Pour sélectionner le LLM le mieux adapté à votre application, tenez compte de plusieurs facteurs :

  • Complexité des tâches : évaluez les modèles sur des tâches représentatives de votre application
  • Exigences de latence : pour les conversations vocales en direct, choisissez un modèle à faible latence et mesurez le temps de réponse avec vos prompts et outils
  • Taille de la fenêtre contextuelle : si votre application doit traiter, comprendre ou mémoriser des informations issues de longues conversations ou de documents volumineux, sélectionnez des modèles dotés de fenêtres contextuelles plus grandes
  • Rapport coût-efficacité : équilibrez les performances et fonctionnalités souhaitées avec votre budget. Les prix des LLM peuvent varier considérablement ; analysez donc la structure tarifaire, pour les jetons d’entrée, de sortie et de cache, en fonction de vos modèles d’utilisation prévus
  • Conformité HIPAA : si votre application traite des informations de santé protégées (PHI), il est essentiel d’utiliser un LLM déclaré conforme à la HIPAA et de vous assurer que l’ensemble de votre processus de traitement des données respecte les normes réglementaires

La taille maximale du prompt système est de 2 Mo, y compris les instructions de votre agent, le contenu de la base de connaissances et les autres éléments de contexte au niveau système.

Configuration des modèles

Température

La température contrôle le caractère aléatoire des réponses du modèle. Des valeurs plus faibles produisent des résultats plus cohérents et ciblés, tandis que des valeurs plus élevées augmentent la créativité et la variation.

  • Faible (0,0-0,3) : réponses déterministes et cohérentes pour les interactions structurées
  • Moyenne (0,4-0,7) : équilibre entre créativité et cohérence
  • Élevée (0,8-1,0) : réponses créatives et variées pour des conversations dynamiques

Configuration des LLM de secours

Configurez des LLM de secours pour assurer la continuité des conversations lorsque le LLM principal échoue ou devient indisponible.

Options de configuration :

  • Par défaut : utilise la séquence de repli recommandée par ElevenLabs
  • Personnalisée : définissez votre propre séquence en cascade de modèles de secours
  • Désactivée : aucun repli, fortement déconseillé en production

Désactiver les LLM de secours signifie que les conversations s’arrêteront brutalement si votre LLM principal échoue ou devient indisponible. Cette configuration est fortement déconseillée en production.

En savoir plus sur la mise en cascade des LLM.

Raisonnement

Le raisonnement aide les agents à gérer des décisions complexes, comme choisir entre plusieurs outils, appliquer des politiques ou achever des workflows en plusieurs étapes. Selon le modèle, vous contrôlez l’ampleur du raisonnement effectué à l’aide d’un budget de réflexion ou d’un niveau d’effort de raisonnement.

Budget de réflexion

Définissez le nombre maximal de jetons de raisonnement à l’aide du curseur numérique. Des budgets plus importants peuvent augmenter le temps de réponse. Définissez le budget sur 0 pour désactiver la réflexion lorsque le modèle le permet.

Effort de raisonnement

L’effort de raisonnement contrôle l’ampleur du raisonnement effectué par le modèle avant de répondre. Les niveaux disponibles dépendent du modèle sélectionné.

Commencez avec un budget ou un effort plus faible pour les agents vocaux en direct, car une réflexion supplémentaire peut retarder la prise de parole. Augmentez-le pour les étapes de workflow nécessitant des décisions plus complexes.

Résumé du raisonnement

Activez le résumé du raisonnement pour capturer le raisonnement renvoyé par le modèle lors du débogage des réponses, des appels d’outils ou des chemins de workflow. Activez Résumé du raisonnement dans les paramètres LLM de l’agent, ou définissez enable_reasoning_summary via l’API. Ce paramètre est désactivé par défaut.

Pour les endpoints personnalisés, consultez la manière dont ElevenLabs demande et stocke le raisonnement.

Le contenu de raisonnement est soumis aux paramètres de rétention et de suppression des données personnelles identifiables. Vous pouvez y accéder par les canaux suivants :

DestinationDisponibilité
Historique des conversationsDisponible sous le badge Raisonnement
API Get conversationRenvoyé dans le champ reasoning de l’élément de transcription
OpenTelemetryInclus dans les spans de réponse de l’agent après l’appel sous elevenlabs.reasoning_content
Événements clientDisponible sous agent_reasoning_response_part uniquement dans les conversations textuelles

Avec le mode zéro rétention, ElevenLabs **ne stocke pas le contenu de raisonnement **. Il est transmis uniquement aux clients de chat et aux webhooks post-appel.

Limites

  • Demander un résumé du raisonnement peut augmenter la latence de réponse. Testez-le avant de l’activer sur des agents vocaux sensibles à la latence.
  • Les fournisseurs peuvent renvoyer un résumé, du texte de réflexion, des deltas de raisonnement bruts ou aucun contenu affichable.

Comprendre la tarification

  • Jetons : l’utilisation des LLM est généralement facturée en fonction du nombre de jetons traités. Pour un texte en anglais, 100 jetons correspondent approximativement à 75 mots
  • Tarification des entrées et sorties : les fournisseurs distinguent souvent les tarifs des jetons d’entrée, les données envoyées au modèle, et des jetons de sortie, les données générées par le modèle en réponse
  • Tarification du cache :
    • input_cache_read : désigne le coût associé à la récupération depuis un cache de données d’entrée précédemment traitées. L’utilisation de données mises en cache peut réduire les coûts lorsque des entrées identiques sont traitées plusieurs fois
    • input_cache_write : désigne le coût associé au stockage de données d’entrée dans un cache. Certains fournisseurs de LLM peuvent facturer cette opération
  • Les tarifs indiqués dans ce document sont établis par million de jetons et reposent sur les informations disponibles au moment de la rédaction. Les fournisseurs de LLM peuvent les modifier
  • Tarification sans majoration : ElevenLabs répercute les coûts des LLM tiers au tarif publié par le fournisseur, sans majoration. Certains modèles Gemini et Claude sont alignés sur la tarification régionale, non mondiale, de Vertex AI, appliquée au trafic américain et européen, soit une hausse de 10 % pour les jetons d’entrée, de sortie et de cache, conformément aux tarifs régionaux de Vertex

Pour connaître les capacités actuelles des modèles, les tarifs et les conditions d’utilisation, consultez la documentation du fournisseur.

Conformité HIPAA

Certains LLM disponibles sur notre plateforme peuvent convenir à des environnements exigeant une conformité HIPAA. Consultez la documentation sur la conformité HIPAA pour plus de détails.

Ressources associées

Modèles hébergés par ElevenLabs

ElevenLabs donne accès à divers modèles IA, y compris certains modèles tiers hébergés par ElevenLabs.

Lorsqu’un modèle est désigné comme « Hébergé par ElevenLabs », il est déployé et exploité sur une infrastructure gérée par ElevenLabs. Ces modèles sont actuellement hébergés aux États-Unis ou dans la région de votre déploiement Enterprise.

Identifier les modèles hébergés par ElevenLabs

Les modèles hébergés par ElevenLabs sont clairement étiquetés dans l’interface ElevenLabs. Recherchez la mention « Hébergé par ElevenLabs » lorsque vous parcourez ou sélectionnez des modèles.

Traitement de vos données

Pour les modèles hébergés par ElevenLabs, les requêtes sont traitées au sein d’une infrastructure gérée par ElevenLabs. Le fournisseur du modèle d’origine ne reçoit donc pas, n’accède pas et ne traite pas les entrées et sorties soumises via ElevenLabs.

En hébergeant ces modèles, ElevenLabs peut offrir une expérience cohérente tout en gardant le contrôle de l’infrastructure utilisée pour traiter les requêtes de modèles.

Questions fréquentes

Où sont hébergés les modèles auto-hébergés ?

Les modèles hébergés par ElevenLabs sont actuellement hébergés sur une infrastructure située aux États-Unis ou dans la région de votre déploiement Enterprise.

Le fournisseur du modèle d’origine accède-t-il à mes données ou aux métadonnées de mon utilisation ?

Pour les modèles hébergés par ElevenLabs, le développeur d’origine du modèle ne reçoit jamais vos entrées ni vos sorties et n’a pas accès aux données relatives au déploiement qui les traite.

Comment savoir si un modèle est hébergé par ElevenLabs ?

Les modèles hébergés par ElevenLabs sont clairement identifiés dans l’interface ElevenLabs par la mention « Hébergé par ElevenLabs ».