Modelle

Erfahren Sie, wie Sie das passende Modell für Ihren Anwendungsfall auswählen

ElevenAgents bietet eine einheitliche Schnittstelle, um Ihren Agenten mit mehreren Modellen und Anbietern zu verbinden. Das ermöglicht Flexibilität, Zuverlässigkeit und Kostenoptimierung.

Hauptfunktionen

  • Einheitlicher Zugriff: Wechseln Sie mit minimalen Codeänderungen zwischen Anbietern und Modellen
  • Hohe Zuverlässigkeit: Wechseln Sie automatisch zu einem anderen Anbieter, wenn einer ausfällt
  • Ausgabenüberwachung: Überwachen Sie Ihre Ausgaben für verschiedene Modelle

Unterstützte Modelle

Derzeit werden die folgenden Modelle nativ unterstützt und können über die Agenteneinstellungen konfiguriert werden:

AnbieterModell
ElevenLabsQwen3.6-35B-A3B
Qwen3.5-397B-A17B
GoogleGemini 3.7 Flash
Gemini 3.6 Flash
Gemini 3.5 Flash
Gemini 3.5 Flash-Lite
Gemini 3.1 Pro Preview
Gemini 3.1 Flash Lite
Gemini 3 Flash Preview
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
OpenAIGPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
GPT-5.5
GPT-5.4
GPT-5.4 Mini
GPT-5.4 Nano
GPT-5.2
GPT-5.1
GPT-5
GPT-5 Mini
GPT-5 Nano
GPT-4.1
GPT-4.1 Mini
GPT-4.1 Nano
GPT-4o
GPT-4o Mini
AnthropicClaude Opus 4.8
Claude Opus 4.7
Claude Sonnet 5
Claude Sonnet 4.6
Claude Sonnet 4.5
Claude Haiku 4.5

Preise werden in der Regel in USD pro 1 Million Tokens angegeben, sofern nicht anders angegeben. Ein Token ist eine grundlegende Einheit von Textdaten für LLMs und entspricht im Durchschnitt etwa 4 Zeichen.

Benutzerdefiniertes LLM

Sie können ein eigenes benutzerdefiniertes LLM verwenden, indem Sie den Endpunkt angeben, an den wir Anfragen senden sollen, und Anmeldedaten über unseren sicheren Secrets-Speicher bereitstellen. Erfahren Sie mehr über die Integration benutzerdefinierter LLMs.

Einige Modelle sind nicht verfügbar, wenn EU-Datenresidenz aktiviert ist. Details zur Verfügbarkeit finden Sie unter DSGVO und Datenresidenz.

Auswahl eines Modells

Bei der Auswahl des passenden LLM für Ihre Anwendung sollten Sie mehrere Faktoren berücksichtigen:

  • Aufgabenkomplexität: Bewerten Sie Modelle anhand repräsentativer Aufgaben aus Ihrer Anwendung
  • Latenzanforderungen: Wählen Sie für Live-Sprachgespräche ein Modell mit niedriger Latenz und messen Sie die Antwortzeit mit Ihren Prompts und Tools
  • Größe des Kontextfensters: Wenn Ihre Anwendung Informationen aus langen Gesprächen oder umfangreichen Dokumenten verarbeiten, verstehen oder abrufen muss, wählen Sie Modelle mit größeren Kontextfenstern
  • Kosten-Nutzen-Verhältnis: Wägen Sie die gewünschte Leistung und Funktionen gegen Ihr Budget ab. LLM-Preise können stark variieren. Analysieren Sie daher die Preisstruktur für Eingabe-, Ausgabe- und Cache-Tokens im Verhältnis zu Ihren erwarteten Nutzungsmustern
  • HIPAA-Konformität: Wenn Ihre Anwendung geschützte Gesundheitsinformationen (PHI) verarbeitet, ist es entscheidend, ein als HIPAA-konform eingestuftes LLM zu verwenden und sicherzustellen, dass Ihre gesamte Datenverarbeitung regulatorische Standards erfüllt

Die maximale Größe des System-Prompts beträgt 2 MB. Dazu gehören die Anweisungen Ihres Agenten, Inhalte der Wissensdatenbank und weiterer Kontext auf Systemebene.

Modellkonfiguration

Temperatur

Die Temperatur steuert die Zufälligkeit von Modellantworten. Niedrigere Werte erzeugen konsistentere, fokussiertere Ausgaben, während höhere Werte Kreativität und Variation erhöhen.

  • Niedrig (0.0-0.3): Deterministische, konsistente Antworten für strukturierte Interaktionen
  • Mittel (0.4-0.7): Ausgewogene Kreativität und Konsistenz
  • Hoch (0.8-1.0): Kreative, vielfältige Antworten für dynamische Gespräche

Konfiguration von Backup-LLMs

Konfigurieren Sie Backup-LLMs, um die Kontinuität von Gesprächen sicherzustellen, wenn das primäre LLM ausfällt oder nicht verfügbar ist.

Konfigurationsoptionen:

  • Standard: Verwendet die von ElevenLabs empfohlene Fallback-Reihenfolge
  • Benutzerdefiniert: Definieren Sie Ihre eigene kaskadierende Reihenfolge von Backup-Modellen
  • Deaktiviert: Kein Fallback (für den Produktionseinsatz dringend nicht empfohlen)

Wenn Sie Backup-LLMs deaktivieren, enden Gespräche abrupt, falls Ihr primäres LLM ausfällt oder nicht verfügbar ist. Dies wird für den Produktionseinsatz dringend nicht empfohlen.

Erfahren Sie mehr über LLM-Kaskadierung.

Reasoning

Reasoning hilft Agenten bei komplexen Entscheidungen, etwa bei der Auswahl zwischen Tools, der Anwendung von Richtlinien oder der Ausführung mehrstufiger Workflows. Je nach Modell steuern Sie mit einem Thinking-Budget oder einer Reasoning-Aufwandsstufe, wie viel Reasoning durchgeführt wird.

Thinking-Budget

Legen Sie mit dem numerischen Schieberegler die maximale Anzahl an Reasoning-Tokens fest. Größere Budgets können die Antwortzeit erhöhen. Setzen Sie das Budget auf 0, um Thinking zu deaktivieren, wenn das Modell dies zulässt.

Reasoning-Aufwand

Der Reasoning-Aufwand steuert, wie viel Reasoning das Modell vor der Antwort durchführt. Die verfügbaren Stufen hängen vom ausgewählten Modell ab.

Beginnen Sie bei Live-Sprachagenten mit einem niedrigeren Budget oder Aufwand, da zusätzliches Thinking den Sprecherwechsel verzögern kann. Erhöhen Sie ihn für Workflow-Schritte, die komplexere Entscheidungen erfordern.

Reasoning-Zusammenfassung

Aktivieren Sie die Reasoning-Zusammenfassung, um das vom Modell zurückgegebene Reasoning beim Debuggen von Antworten, Tool-Aufrufen oder Workflow-Pfaden zu erfassen. Aktivieren Sie Reasoning-Zusammenfassung in den LLM-Einstellungen des Agenten oder setzen Sie enable_reasoning_summary über die API. Die Einstellung ist standardmäßig deaktiviert.

Für benutzerdefinierte Endpunkte erfahren Sie unter wie ElevenLabs Reasoning anfordert und speichert mehr.

Reasoning-Inhalte unterliegen den Einstellungen für Aufbewahrung und PII-Redaktion. Sie können über die folgenden Kanäle darauf zugreifen:

ZielVerfügbarkeit
GesprächsverlaufVerfügbar unter dem Badge Reasoning
Get-conversation-APIWird im Feld reasoning des Transkript-Elements zurückgegeben
OpenTelemetryIn Agenten-Antwort-Spans nach dem Anruf als elevenlabs.reasoning_content enthalten
Client-EreignisseNur in Textgesprächen als agent_reasoning_response_part verfügbar

Mit dem Zero Retention Mode speichert ElevenLabs **keine Reasoning-Inhalte **. Sie werden nur an Chat-Clients und Webhooks nach dem Anruf übermittelt.

Einschränkungen

  • Das Anfordern einer Reasoning-Zusammenfassung kann die Antwortlatenz erhöhen. Testen Sie dies, bevor Sie sie für latenzsensitive Sprachagenten aktivieren.
  • Anbieter können eine Zusammenfassung, Gedankentext, rohe Reasoning-Deltas oder keine darstellbaren Inhalte zurückgeben.

Preise verstehen

  • Tokens: Die LLM-Nutzung wird in der Regel anhand der Anzahl verarbeiteter Tokens abgerechnet. Als allgemeiner Richtwert entsprechen 100 Tokens in englischen Texten ungefähr 75 Wörtern
  • Preise für Eingabe und Ausgabe: Anbieter unterscheiden häufig zwischen Preisen für Eingabe-Tokens (die Daten, die Sie an das Modell senden) und Ausgabe-Tokens (die Daten, die das Modell als Antwort erzeugt)
  • Cache-Preise:
    • input_cache_read: Dies bezeichnet die Kosten für das Abrufen zuvor verarbeiteter Eingabedaten aus einem Cache. Die Nutzung zwischengespeicherter Daten kann Kosten sparen, wenn identische Eingaben mehrfach verarbeitet werden
    • input_cache_write: Dies sind die Kosten für das Speichern von Eingabedaten in einem Cache. Einige LLM-Anbieter berechnen möglicherweise Gebühren für diesen Vorgang
  • Die in diesem Dokument aufgeführten Preise gelten pro 1 Million Tokens und basieren auf den zum Zeitpunkt der Erstellung verfügbaren Informationen. Diese Preise können von den LLM-Anbietern geändert werden

Aktuelle Modellfähigkeiten, Preise und Nutzungsbedingungen finden Sie in der Dokumentation des Anbieters.

HIPAA-Konformität

Bestimmte auf unserer Plattform verfügbare LLMs können für den Einsatz in Umgebungen geeignet sein, die HIPAA-Konformität erfordern. Weitere Details finden Sie in der Dokumentation zur HIPAA-Konformität.

Weiterführende Ressourcen

Von ElevenLabs gehostete Modelle

ElevenLabs bietet Zugriff auf eine Vielzahl von KI-Modellen, darunter ausgewählte Modelle von Drittanbietern, die von ElevenLabs gehostet werden.

Wenn ein Modell als „Hosted by ElevenLabs“ gekennzeichnet ist, wird es auf von ElevenLabs verwalteter Infrastruktur bereitgestellt und betrieben. Diese Modelle werden derzeit in den Vereinigten Staaten oder in der Region Ihres Enterprise-Deployments gehostet.

So erkennen Sie von ElevenLabs gehostete Modelle

Von ElevenLabs gehostete Modelle sind in der ElevenLabs-Oberfläche eindeutig gekennzeichnet. Achten Sie beim Durchsuchen oder Auswählen von Modellen auf die Kennzeichnung „Hosted by ElevenLabs“.

So werden Ihre Daten verarbeitet

Anfragen an von ElevenLabs gehostete Modelle werden innerhalb der von ElevenLabs verwalteten Infrastruktur verarbeitet. Das bedeutet, dass der ursprüngliche Modellanbieter die über ElevenLabs übermittelten Eingaben und Ausgaben nicht erhält, darauf nicht zugreift und sie nicht verarbeitet.

Durch das Hosting dieser Modelle kann ElevenLabs eine konsistente Nutzungserfahrung bieten und gleichzeitig die Kontrolle über die Infrastruktur zur Verarbeitung von Modellanfragen behalten.

Häufig gestellte Fragen

Wo werden selbstgehostete Modelle gehostet?

Von ElevenLabs gehostete Modelle werden derzeit auf Infrastruktur in den Vereinigten Staaten oder in der Region Ihres Enterprise-Deployments gehostet.

Greift der ursprüngliche Modellanbieter auf meine Daten oder Metadaten zu meiner Nutzung zu?

Bei von ElevenLabs gehosteten Modellen erhält der ursprüngliche Entwickler des Modells niemals Ihre Eingaben oder Ausgaben und hat keinen Zugriff auf die Daten über das Deployment, das sie verarbeitet.

Wie erkenne ich, ob ein Modell von ElevenLabs gehostet wird?

Von ElevenLabs gehostete Modelle sind in der ElevenLabs-Oberfläche eindeutig mit der Kennzeichnung „Hosted by ElevenLabs“ versehen.