Zum Inhalt springen

Konversations-KI messen: Wichtige Kennzahlen für den Erfolg

Verfasst von
Jack Limebear
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Tools für Konversations-KI senken die Kosten für einen Kundensupport rund um die Uhr drastisch. Dafür müssen Sie weder Nachtschichten besetzen noch Datenschutzrisiken durch die Auslagerung von Aufgaben ins Ausland eingehen.

Kosteneinsparungen zählen jedoch nur, wenn ein KI-Agent Kundenprobleme lösen kann. Die Messung von Konversations-KI mit den richtigen Leistungskennzahlen zeigt Ihnen, ob sie funktioniert – besonders in Unternehmen mit einem hohen Volumen an Kundenanfragen.

Dieser Artikel zeigt, wie die Bewertung von Gesprächsverlauf und Antwortgenauigkeit sowohl das Kundenerlebnis als auch Ihre Marke schützt. Wir erklären, wie Customer-Experience-Teams effektive A/B-Tests für Begrüßungen von Anrufenden durchführen. Außerdem erfahren Sie, wie Sie eine zuverlässige, mehrsprachige Plattform für Konversations-KI betreiben.

Overview of 10 conversational AI metrics, targets, and how latency affects satisfaction.

Zusammenfassung

  • Die systematische Messung von Konversations-KI anhand von Qualitäts-, Erlebnis- und Betriebskennzahlen liefert die Daten, die Sie zum Schutz des Kundenerlebnisses brauchen.
  • Automatisierte Bewertungstools verfolgen und verbessern Kennzahlen für Konversations-KI kontinuierlich und im großen Maßstab, während Mitarbeitende regelmäßig Stichproben prüfen.
  • Wenn Sie bei A/B-Tests jeweils nur eine Variable isolieren, erkennen Sie genau, was schiefgelaufen ist. So können Sie Lösungen bereitstellen, die identifizierte Probleme direkt beheben.
  • Kontinuierliche Verbesserung ist erforderlich, da KI-Unternehmen die zugrunde liegenden Modelle häufig aktualisieren. Dadurch verhalten sich zuvor zuverlässige Chatbots in der Produktion oft anders.

Was die Messung von Konversations-KI bedeutet und warum sie wichtig ist

Die Messung von Konversations-KI umfasst die systematische Bewertung, wie gut Ihre getesteten oder eingesetzten KI-Agenten Kundenanfragen bearbeiten und Probleme lösen. Ziel ist es, anhand Ihrer festgelegten Leistungsstandards zu bestimmen, wie effektiv Ihre automatisierten Systeme mehrstufige Gespräche in der Praxis führen. Diese Standards spiegeln in der Regel wider, wie gut die Modelle die Nutzerabsicht verstehen, Ihrer Marke entsprechen, genaue Antworten liefern und das Problem erfolgreich lösen.

Modellbewertungen wirken möglicherweise wie viel zusätzliche Arbeit für ein System, das die Aufgaben Ihres Teams reduzieren soll. Ohne eine konsistente Bewertung lässt sich jedoch nur schwer feststellen, wie gut das Modell in realen Anwendungsfällen funktioniert. Anders gesagt: Sie wissen, dass Ihr KI-System die Betriebskosten im Kundensupport senkt – aber können Sie bestätigen, dass es Kunden zufriedenstellt, statt sie nach anderen Lösungen suchen zu lassen?

Eine umfassende Messung erfordert, das Modell in drei Hauptkategorien zu betrachten:

  • Qualität: Bewerten Sie, wie genau, kohärent und relevant die Antworten einer KI im Hinblick auf die ursprüngliche Anfrage des Nutzers sind. Die zentrale Frage lautet: Liegt die KI richtig und liefert Nutzern korrekte Antworten, oder halluziniert sie und macht Fehler?
  • Erlebnis: Bewerten Sie das Kundenerlebnis, etwa ob die KI schnell reagiert hat und wie viele Gesprächsschritte sie für eine zufriedenstellende Antwort benötigte. Die zentrale Frage lautet: Fühlt sich das Erlebnis für Nutzer natürlich und hilfreich an oder eher roboterhaft und frustrierend?
  • Betrieb: Prüfen Sie, ob das System zuverlässig arbeitet und eine kosteneffiziente Lösung für Ihren Kundensupport bleibt. Typische Fragen sind: Hat das System eine hohe Verfügbarkeit und liefert es den nötigen Return on Investment, der seinen Einsatz rechtfertigt?

Erfolg sieht für jedes Team anders aus. Dabei spielen Ihre ursprünglichen Probleme vor der Automatisierung des Supports eine wichtige Rolle. Wenn Ihr Team beispielsweise anfangs Schwierigkeiten hatte, einen 24/7-Kundensupport aufrechtzuerhalten, verbessert die Rund-um-die-Uhr-Verfügbarkeit von KI-Agenten die Supportleistung deutlich. Dennoch sind alle diese Kategorien für den Gesamterfolg wichtig. Ein System, das immer online ist und selten abstürzt, hilft Kunden wenig, wenn es roboterhaft wirkt und Antworten halluziniert.

Conversational AI should be measured by quality, experience, and operations—not one alone.

Wichtige Kennzahlen für Konversations-KI

Verfolgen Sie klare, umsetzbare Kennzahlen, um die Leistung von Agenten im Kundenkontakt und den tatsächlichen geschäftlichen Nutzen Ihrer aktuellen Implementierung zu beurteilen. Kontinuierliche Bewertung schafft außerdem die Grundlage für regelmäßige Verbesserungen. Wenn Sie genau erkennen, wo es in Ihrem Workflow Engpässe gibt oder Anpassungen nötig sind, haben Sie die Daten, um die Ursache wirksam zu beheben.

Nutzen Sie diese Kennzahlen für Konversations-KI als Ausgangspunkt für die Bewertung von Sprachanrufen und der Chatbot-Performance:

  • Containment-Rate: Verfolgen Sie den Prozentsatz der Anfragen, die vollständig im automatisierten Kanal gelöst werden. Ziele unterscheiden sich je nach Branche, Kontext, Anwendungsfall und Bot-Typ. Im Einzelhandel sind beispielsweise 60–80 % ein üblicher Wert, während Reiseseiten Werte zwischen 40–60 % erreichen.
  • Eskalationsrate: Messen Sie, wie oft KI-Agenten Anrufe bearbeiten, ohne sie an Menschen weiterzuleiten. Vorausschauende Unternehmen setzen automatische Schwellenwerte, um Anrufe an Mitarbeitende zu übergeben, sobald die Stimmung negativ wird. Gute Eskalationsraten hängen von Branche und Aufgabenkomplexität ab, sollten aber bei 15–30 % liegen.
  • Wortfehlerrate (WER): Verfolgen Sie, wie gut die KI Wörter während eines Anrufs oder einer Transkription korrekt „hört“. Ein guter Branchenstandard liegt bei 5 %, für Anwendungsfälle in regulierten Bereichen oder mit sensiblen Informationen wie Gesundheitswesen, Finanzen und Rechtswesen benötigen Sie jedoch eine niedrigere WER.
  • Genauigkeit der Absichtserkennung: Erfolgreiche KI-Agenten müssen nicht nur Wörter erkennen, sondern auch das Anliegen und den Bedarf des Nutzers präzise verstehen. Die Genauigkeitsziele variieren je nach Anwendungsfall und Absichtskategorie.
  • Antwortgenauigkeit: Ermitteln Sie, wie zuverlässig das Modell wahrheitsgemäße und sinnvolle Antworten gibt. Das ist entscheidend, damit Kunden ihre Probleme lösen können. Allgemeine Kundensupportanfragen erfordern 80 % oder mehr, sensible Anwendungsfälle wie Zahlungen 99 % oder mehr.
  • Halluzinationsrate: Sie steht in engem Zusammenhang mit der Antwortgenauigkeit, misst jedoch speziell die faktische Genauigkeit von Antworten auf Grundlage der Wissensdatenbank. Niedrige Halluzinationsraten sind entscheidend für hilfreiche Antworten und dafür, dass Modelle keine Versprechen machen, die das Unternehmen nicht halten kann. 
  • Kundenzufriedenheit (CSAT): Erfassen Sie die Kundenstimmung mit Umfragen nach dem Anruf, um die Zufriedenheit zu bestimmen. Unternehmen erheben diese Daten auf einer Fünf-Punkte-Skala, geben die Ergebnisse jedoch häufig in Prozent an. Laut SurveyMonkey beginnen gute CSAT-Werte meist bei etwa 70 %, manche Unternehmen streben 80 % oder mehr an.
  • Mean Opinion Score (MOS): Diese menschenzentrierte Kennzahl verwendet ebenfalls eine Fünf-Punkte-Skala. Sie misst, wie natürlich die KI-Antwort klingt und wie klar die synthetische Stimme ist. Streben Sie einen MOS von etwa 4,3–4,5.
  • End-to-End-Sprachlatenz: Messen Sie die gesamte Verzögerung zwischen dem Abschluss einer Anfrage durch einen Nutzer und dem Beginn der Antwort des Agenten. Produktionstaugliche Agenten streben eine End-to-End-Zeit bis zum ersten Audio (TTFA) von unter 500 Millisekunden an. Das Modell ElevenLabs Flash v2.5 erreicht derzeit eine interne Modell-Inferenzlatenz von etwa 75 ms. Die tatsächliche End-to-End-Latenz hängt von Faktoren wie Ihrem Standort und dem verwendeten Endpoint-Typ ab.
  • Kosten pro Gespräch: Messen Sie die gesamten Betriebskosten jeder automatisierten Kundeninteraktion im Vergleich zu Gesprächen mit Mitarbeitenden. Gespräche mit ElevenLabs beginnen bei 10 Cent pro Minute, während die durchschnittlichen Stundenlöhne im Kundensupport darauf hindeuten, dass menschliche Gespräche etwa 32 Cent pro Minute kosten. Das ergibt Einsparungen von rund 70 %, wobei die Preise je nach Tarif und Nutzung variieren können. Aktuelle Preise finden Sie auf der ElevenLabs-Preisseite.

Berücksichtigen Sie bei der Wahl der Kennzahlen für Ihre Modellleistung die Bereiche, die für Ihre Branche und Ihr Geschäftsmodell am wichtigsten sind. Genauigkeit und Faktentreue sind beispielsweise für Bereiche wie Bankwesen und Patienteninformationen besonders wichtig, während Latenz, MOS und Eskalationsraten für Unternehmen mit Fokus auf das Kundenerlebnis am wichtigsten sind. 

Beachten Sie, dass einige Kennzahlen die Ursachen für andere liefern. So führt eine hohe Latenz wahrscheinlich zu einem niedrigen MOS-Wert und dadurch zu einer niedrigen Kundenzufriedenheit, ausgedrückt als CSAT.

So messen Sie die Genauigkeit von Konversations-KI

Messen Sie die Modellgenauigkeit, indem Sie einen Ground-Truth-Testsatz aus rund 500 bis 1.000 echten historischen Gesprächen erstellen. Reale Protokolle erfassen die unordentlichen, natürlichen Formulierungen, die in synthetischen Daten oft fehlen, etwa Tippfehler, Umgangssprache und Nutzerfehler. Bewerten Sie Ihr System anschließend anhand dieser realen Protokolle bezüglich Absichtserkennung, Antwortgenauigkeit und Halluzinationsrate.

Führen Sie automatisierte Bewertungen dieser Interaktionen mit einer LLM-as-a-Judge-Bewertungsmethode durch. Validieren Sie die automatisierten Bewertungen jedoch stets anhand von menschlich gelabelten Systemen, um ihre Übereinstimmung sicherzustellen. Menschliche Prüfer führen anschließend wöchentlich Stichproben zur Bewertung der Chatbot-Performance anhand einer einfachen Drei-Punkte-Rubrik durch:

  • Korrekt: Die Antwort ist sachlich richtig, im Kontext relevant und erfüllt direkt die primäre Absicht des Nutzers.
  • Akzeptabel: Die Antwort ist technisch korrekt und hilfreich, weist jedoch kleinere stilistische Probleme, einige ungeschickte Formulierungen oder ein nicht markenkonformes Format auf.
  • Falsch: Die Antwort muss sofort korrigiert werden, da sie sachliche Fehler, schwerwiegende Halluzinationen enthält oder die Nutzerabsicht vollständig missversteht.

Idealerweise verwenden Sie eine Methode pro Absicht zur Modellbewertung, da KI-Agenten in einigen Kontexten gut funktionieren und in anderen völlig versagen. Aggregierte Kennzahlen können dazu führen, dass Bereiche mit hoher Leistung kritische Schwachstellen verdecken.

Wir haben diesen Workflow vereinfacht, indem wir Next-Reply-(Szenario)-Tests direkt in unsere ElevenAgents-Tests integriert haben. Die Funktion Next Reply bewertet die Folgenachricht, die ein Agent sendet, statt des gesamten mehrstufigen Gesprächs. Sie stellen jedoch den Chatverlauf bis zum Bewertungszeitpunkt bereit und bewerten die Antwort anhand von Richtlinien, Tonalität und Qualitätsstandards.

So führen Sie A/B-Tests für Antworten von Konversations-KI durch

A/B-Tests erfassen Feedback aus der Praxis, damit Sie nicht raten müssen, was Kunden bevorzugen. Diese empirischen Daten nutzen Sie dann, um die Leistung des KI-Modells zu optimieren. Nachdem Sie Kennzahlen verfolgt haben, hat Ihr Team wahrscheinlich eine Liste mit gewünschten Änderungen oder Experimenten. Wenn Sie jedoch mehrere Dinge gleichzeitig ändern, lässt sich nur schwer herausfinden, was funktioniert hat und was nicht.

Ein valider Test erfordert daher, jeweils eine spezifische Variable zu isolieren und den Rest der zugrunde liegenden Wissensdatenbank konstant zu halten. Mögliche Variablen sind:

  • Begrüßungstext: Ändern Sie die erste Begrüßungsnachricht zu etwas Konkretem wie „Hallo. Brauchen Sie Hilfe bei der Produktauswahl?“ statt nur „Hallo, wie kann ich helfen?“
  • Stimme: Kunden reagieren in bestimmten Situationen möglicherweise positiver auf manche Stimmen als auf andere – abhängig von Maskulinität oder Feminität, Tonfall, Intonation und sogar Akzent.
  • Modell-Routing: Besonders leistungsfähige Modelle kosten meist mehr. Effizient und kostengünstig ist es daher, komplexe und einfache Anfragen entsprechend weiterzuleiten.
  • Prompt: Prompts bestehen aus mehreren Komponenten. Ändern Sie daher jeweils nur einen Aspekt, etwa Kontext, Ziel, Stil, Tonalität, Zielgruppe oder Antwortvorlage (CO-STAR).

Teams sollten auch den Testzeitraum anpassen. Das Gesprächsaufkommen ist meist deutlich geringer als die Zahl der Webseitenaufrufe. Deshalb müssen Sie den Test für statistische Signifikanz über Wochen statt über Tage durchführen. Bei extrem geringem Volumen sollten Sie große, deutliche Änderungen statt kleiner Anpassungen testen.

Ein praktischer Workflow benötigt außerdem Agenten-Versionierung, Vergleichs- und Rollback-Tools. Diese haben wir direkt in ElevenAgents integriert. 

Measuring conversational AI A/B testing guide for conversational AI: greeting copy, voice, model routing, and prompts.

So testen Sie einen KI-Agenten für Konversationen vor der Bereitstellung

Der Kundenservice ist ein direkter Kontaktpunkt zu den Menschen, die Ihren Geschäftserfolg beeinflussen. KI reagiert auf kleine Änderungen manchmal unvorhersehbar. Testen Sie daher einen neuen oder überarbeiteten KI-Agenten für Konversationen immer, bevor Sie ihn in der Produktion einsetzen. Reines „Vibe-Testing“ reicht nicht aus.

Wir haben unser ElevenAgents-Testframework auf drei zentrale Testtypen ausgerichtet, die bestimmte Ebenen Ihrer Pipeline für Konversations-KI abdecken:

  • Simulationstest: Führt ein vollständiges mehrstufiges Gespräch mit einer simulierten Nutzerpersona durch, um zu prüfen, ob der Dialog die gewünschten Leistungsniveaus erreicht.
  • Next-Reply-Test: Testet nur die unmittelbaren Antworten des Agenten anhand bestimmter Tonalitäts-, Richtlinien- oder anderer Vorgaben, um Angemessenheit und Genauigkeit der Antworten zu bestätigen.
  • Tool-Call-Test: Stellt sicher, dass Agenten verbundene APIs korrekt aufrufen und die exakten Parameter für kritische Datenbankabfragen oder Übertragungen übergeben.

Da viele Angreifer versuchen, Modelle für bösartige Zwecke zu jailbreaken, benötigen Sie vor dem Livegang zusätzlich eine Ebene für adversariale Tests. Arbeiten Sie mit QA-Teams, Prompt Engineers und Red-Team-Fachleuten für Cybersicherheit zusammen, um Prompt Injection, themenfremde Köder und Versuche zum Umgehen von Regeln zu testen.

Zum Schluss sollten Sie die Einführung schrittweise gestalten: Starten Sie Pilotversionen für eine kleine Nutzergruppe und überwachen Sie ihr Verhalten in der Praxis. Legen Sie strenge Kriterien fest, die das Modell erfüllen muss, bevor Sie es für eine größere Gruppe oder Ihren gesamten Kundenstamm freigeben. Benennen Sie eine verantwortliche Person für die Einführung und erstellen Sie einen Rollback-Pfad, falls eine Anpassung zu einem Rückgang der Leistungskennzahlen führt.

Pre-deployment tests: simulation, next reply, tool calls, and adversarial testing.

Chatbot-Performance in der Produktion bewerten

Definieren Sie vor dem Start Ihres Modells für Konversations-KI, wie Erfolg für jeden Anwendungsfall aussieht. Das ist besonders wichtig für Anwendungen in stark regulierten Bereichen, in denen Genauigkeit und Datenschutz höheren Maßstäben und strengeren Anforderungen unterliegen.

Automatisierte Antworten erleichtern A/B-Tests von Modellen im großen Maßstab. Objektive Tests erfordern jedoch zusätzlich die spontane Prüfung von Transkripten und Feedback von menschlichen Testern. Menschen im Kreislauf erkennen Gesprächsnuancen, die KI-Modelle übersehen, sowie Besonderheiten in den Daten, die in aggregierten Kennzahlen sonst verloren gehen. Eine umfassende Bewertungsstrategie umfasst auch Sentimentanalyse und direktes Nutzerfeedback.

Kontinuierliche Verbesserung unterscheidet reife Systeme mit hohem Return on Investment zusätzlich. Während Wettbewerber Tests und Monitoring als getrennte Aufgaben behandeln, kombiniert eine reife Pipeline beides. Produktionsfehler fließen dabei direkt in Ihren Testsatz ein, um den nächsten optimierten Agenten zu trainieren.

Regelmäßige Anpassungen werden auch nötig, wenn KI-Unternehmen die Basismodelle aktualisieren, auf denen Ihr Agent läuft. Dadurch kann ein zuvor effektiver Prompt plötzlich zu unzuverlässigen oder sogar unangemessenen Antworten beitragen.

Wir haben diese Feedbackschleife direkt in unsere Plattform integriert. Nutzen Sie unsere Tools zur Gesprächsanalyse zur Automatisierung strukturierter Datenerfassung und zur einfachen Bewertung von Stimmungen. Große Unternehmen nutzen außerdem unsere Enterprise-Infrastruktur für Konversations-KI , um ihre Agenten weltweit zuverlässig zu überwachen und zu skalieren.

Starten Sie mit ElevenAgents für Kundensupport-Kennzahlen

Der erfolgreiche Einsatz von Konversations-KI im großen Maßstab erfordert mehr als hochwertige Stimmen und Modelle mit niedriger Latenz. Sie benötigen ein integriertes Ökosystem für das Entwerfen, Erstellen, Testen, Bereitstellen und Anpassen von Multi-Agent-Workflows.

ElevenAgents bietet Ihnen die skalierbare Infrastruktur, die Sie brauchen. Ihr Team erhält Zugriff auf Tools wie Next-Reply-Verifizierung, Sentiment-Tracking und automatische Datenerfassung, um Modelle kontinuierlich zu überwachen und für optimale Ergebnisse zu verbessern. Noch besser: Sie erkennen Regressionen, bevor sie Ihre Kunden erreichen.

Möchten Sie die Messung von Konversations-KI vereinfachen? Entdecken Sie unsere Funktionen für Agenten-Tests und erfahren Sie, wie unsere Enterprise-Teams zuverlässige Agenten bereitstellen, die Ihre Kundensupport-Kennzahlen verbessern. 

Erfahren Sie mehr über ElevenAgents oder registrieren Sie sich und starten Sie noch heute.

Häufig gestellte Fragen zur Messung von Konversations-KI

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio