Modelle
Erfahren Sie, wie Sie das passende Modell für Ihren Anwendungsfall auswählen
ElevenAgents bietet eine einheitliche Schnittstelle, um Ihren Agenten mit mehreren Modellen und Anbietern zu verbinden. Das ermöglicht Flexibilität, Zuverlässigkeit und Kostenoptimierung.
Hauptfunktionen
- Einheitlicher Zugriff: Wechseln Sie mit minimalen Codeänderungen zwischen Anbietern und Modellen
- Hohe Zuverlässigkeit: Wechseln Sie automatisch zu einem anderen Anbieter, wenn einer ausfällt
- Ausgabenüberwachung: Überwachen Sie Ihre Ausgaben für verschiedene Modelle
Unterstützte Modelle
Derzeit werden die folgenden Modelle nativ unterstützt und können über die Agenteneinstellungen konfiguriert werden:
Preise werden in der Regel in USD pro 1 Million Tokens angegeben, sofern nicht anders angegeben. Ein Token ist eine grundlegende Einheit von Textdaten für LLMs und entspricht im Durchschnitt etwa 4 Zeichen.
Benutzerdefiniertes LLM
Sie können ein eigenes benutzerdefiniertes LLM verwenden, indem Sie den Endpunkt angeben, an den wir Anfragen senden sollen, und Anmeldedaten über unseren sicheren Secrets-Speicher bereitstellen. Erfahren Sie mehr über die Integration benutzerdefinierter LLMs.
Einige Modelle sind nicht verfügbar, wenn EU-Datenresidenz aktiviert ist. Details zur Verfügbarkeit finden Sie unter DSGVO und Datenresidenz.
Auswahl eines Modells
Bei der Auswahl des passenden LLM für Ihre Anwendung sollten Sie mehrere Faktoren berücksichtigen:
- Aufgabenkomplexität: Bewerten Sie Modelle anhand repräsentativer Aufgaben aus Ihrer Anwendung
- Latenzanforderungen: Wählen Sie für Live-Sprachgespräche ein Modell mit niedriger Latenz und messen Sie die Antwortzeit mit Ihren Prompts und Tools
- Größe des Kontextfensters: Wenn Ihre Anwendung Informationen aus langen Gesprächen oder umfangreichen Dokumenten verarbeiten, verstehen oder abrufen muss, wählen Sie Modelle mit größeren Kontextfenstern
- Kosten-Nutzen-Verhältnis: Wägen Sie die gewünschte Leistung und Funktionen gegen Ihr Budget ab. LLM-Preise können stark variieren. Analysieren Sie daher die Preisstruktur für Eingabe-, Ausgabe- und Cache-Tokens im Verhältnis zu Ihren erwarteten Nutzungsmustern
- HIPAA-Konformität: Wenn Ihre Anwendung geschützte Gesundheitsinformationen (PHI) verarbeitet, ist es entscheidend, ein als HIPAA-konform eingestuftes LLM zu verwenden und sicherzustellen, dass Ihre gesamte Datenverarbeitung regulatorische Standards erfüllt
Die maximale Größe des System-Prompts beträgt 2 MB. Dazu gehören die Anweisungen Ihres Agenten, Inhalte der Wissensdatenbank und weiterer Kontext auf Systemebene.
Modellkonfiguration
Temperatur
Die Temperatur steuert die Zufälligkeit von Modellantworten. Niedrigere Werte erzeugen konsistentere, fokussiertere Ausgaben, während höhere Werte Kreativität und Variation erhöhen.
- Niedrig (0.0-0.3): Deterministische, konsistente Antworten für strukturierte Interaktionen
- Mittel (0.4-0.7): Ausgewogene Kreativität und Konsistenz
- Hoch (0.8-1.0): Kreative, vielfältige Antworten für dynamische Gespräche
Konfiguration von Backup-LLMs
Konfigurieren Sie Backup-LLMs, um die Kontinuität von Gesprächen sicherzustellen, wenn das primäre LLM ausfällt oder nicht verfügbar ist.
Konfigurationsoptionen:
- Standard: Verwendet die von ElevenLabs empfohlene Fallback-Reihenfolge
- Benutzerdefiniert: Definieren Sie Ihre eigene kaskadierende Reihenfolge von Backup-Modellen
- Deaktiviert: Kein Fallback (für den Produktionseinsatz dringend nicht empfohlen)
Wenn Sie Backup-LLMs deaktivieren, enden Gespräche abrupt, falls Ihr primäres LLM ausfällt oder nicht verfügbar ist. Dies wird für den Produktionseinsatz dringend nicht empfohlen.
Erfahren Sie mehr über LLM-Kaskadierung.
Reasoning
Reasoning hilft Agenten bei komplexen Entscheidungen, etwa bei der Auswahl zwischen Tools, der Anwendung von Richtlinien oder der Ausführung mehrstufiger Workflows. Je nach Modell steuern Sie mit einem Thinking-Budget oder einer Reasoning-Aufwandsstufe, wie viel Reasoning durchgeführt wird.
Thinking-Budget
Legen Sie mit dem numerischen Schieberegler die maximale Anzahl an Reasoning-Tokens fest. Größere Budgets können die Antwortzeit erhöhen. Setzen Sie das Budget auf 0, um Thinking zu deaktivieren, wenn das Modell dies zulässt.
Reasoning-Aufwand
Der Reasoning-Aufwand steuert, wie viel Reasoning das Modell vor der Antwort durchführt. Die verfügbaren Stufen hängen vom ausgewählten Modell ab.
Beginnen Sie bei Live-Sprachagenten mit einem niedrigeren Budget oder Aufwand, da zusätzliches Thinking den Sprecherwechsel verzögern kann. Erhöhen Sie ihn für Workflow-Schritte, die komplexere Entscheidungen erfordern.
Reasoning-Zusammenfassung
Aktivieren Sie die Reasoning-Zusammenfassung, um das vom Modell zurückgegebene Reasoning beim Debuggen von Antworten, Tool-Aufrufen oder Workflow-Pfaden zu erfassen. Aktivieren Sie Reasoning-Zusammenfassung in den LLM-Einstellungen des Agenten oder setzen Sie enable_reasoning_summary über die API. Die Einstellung ist standardmäßig deaktiviert.
Für benutzerdefinierte Endpunkte erfahren Sie unter wie ElevenLabs Reasoning anfordert und speichert mehr.
Reasoning-Inhalte unterliegen den Einstellungen für Aufbewahrung und PII-Redaktion. Sie können über die folgenden Kanäle darauf zugreifen:
Mit dem Zero Retention Mode speichert ElevenLabs **keine Reasoning-Inhalte **. Sie werden nur an Chat-Clients und Webhooks nach dem Anruf übermittelt.
Einschränkungen
- Das Anfordern einer Reasoning-Zusammenfassung kann die Antwortlatenz erhöhen. Testen Sie dies, bevor Sie sie für latenzsensitive Sprachagenten aktivieren.
- Anbieter können eine Zusammenfassung, Gedankentext, rohe Reasoning-Deltas oder keine darstellbaren Inhalte zurückgeben.
Preise verstehen
- Tokens: Die LLM-Nutzung wird in der Regel anhand der Anzahl verarbeiteter Tokens abgerechnet. Als allgemeiner Richtwert entsprechen 100 Tokens in englischen Texten ungefähr 75 Wörtern
- Preise für Eingabe und Ausgabe: Anbieter unterscheiden häufig zwischen Preisen für Eingabe-Tokens (die Daten, die Sie an das Modell senden) und Ausgabe-Tokens (die Daten, die das Modell als Antwort erzeugt)
- Cache-Preise:
input_cache_read: Dies bezeichnet die Kosten für das Abrufen zuvor verarbeiteter Eingabedaten aus einem Cache. Die Nutzung zwischengespeicherter Daten kann Kosten sparen, wenn identische Eingaben mehrfach verarbeitet werdeninput_cache_write: Dies sind die Kosten für das Speichern von Eingabedaten in einem Cache. Einige LLM-Anbieter berechnen möglicherweise Gebühren für diesen Vorgang
- Die in diesem Dokument aufgeführten Preise gelten pro 1 Million Tokens und basieren auf den zum Zeitpunkt der Erstellung verfügbaren Informationen. Diese Preise können von den LLM-Anbietern geändert werden
Aktuelle Modellfähigkeiten, Preise und Nutzungsbedingungen finden Sie in der Dokumentation des Anbieters.
HIPAA-Konformität
Bestimmte auf unserer Plattform verfügbare LLMs können für den Einsatz in Umgebungen geeignet sein, die HIPAA-Konformität erfordern. Weitere Details finden Sie in der Dokumentation zur HIPAA-Konformität.
Weiterführende Ressourcen
Von ElevenLabs gehostete Modelle
ElevenLabs bietet Zugriff auf eine Vielzahl von KI-Modellen, darunter ausgewählte Modelle von Drittanbietern, die von ElevenLabs gehostet werden.
Wenn ein Modell als „Hosted by ElevenLabs“ gekennzeichnet ist, wird es auf von ElevenLabs verwalteter Infrastruktur bereitgestellt und betrieben. Diese Modelle werden derzeit in den Vereinigten Staaten oder in der Region Ihres Enterprise-Deployments gehostet.
So erkennen Sie von ElevenLabs gehostete Modelle
Von ElevenLabs gehostete Modelle sind in der ElevenLabs-Oberfläche eindeutig gekennzeichnet. Achten Sie beim Durchsuchen oder Auswählen von Modellen auf die Kennzeichnung „Hosted by ElevenLabs“.
So werden Ihre Daten verarbeitet
Anfragen an von ElevenLabs gehostete Modelle werden innerhalb der von ElevenLabs verwalteten Infrastruktur verarbeitet. Das bedeutet, dass der ursprüngliche Modellanbieter die über ElevenLabs übermittelten Eingaben und Ausgaben nicht erhält, darauf nicht zugreift und sie nicht verarbeitet.
Durch das Hosting dieser Modelle kann ElevenLabs eine konsistente Nutzungserfahrung bieten und gleichzeitig die Kontrolle über die Infrastruktur zur Verarbeitung von Modellanfragen behalten.
Häufig gestellte Fragen
Wo werden selbstgehostete Modelle gehostet?
Von ElevenLabs gehostete Modelle werden derzeit auf Infrastruktur in den Vereinigten Staaten oder in der Region Ihres Enterprise-Deployments gehostet.
Greift der ursprüngliche Modellanbieter auf meine Daten oder Metadaten zu meiner Nutzung zu?
Bei von ElevenLabs gehosteten Modellen erhält der ursprüngliche Entwickler des Modells niemals Ihre Eingaben oder Ausgaben und hat keinen Zugriff auf die Daten über das Deployment, das sie verarbeitet.
Wie erkenne ich, ob ein Modell von ElevenLabs gehostet wird?
Von ElevenLabs gehostete Modelle sind in der ElevenLabs-Oberfläche eindeutig mit der Kennzeichnung „Hosted by ElevenLabs“ versehen.