Webinar-Rückblick: Wie einer der größten Versicherer Europas KI-Agenten in Produktion brachte
- Verfasst von
- Anna Neely
- Veröffentlicht
AnhörenArtikel anhören
Versicherungskunden rufen selten an, wenn alles gut läuft. Sie rufen nach einem Unfall an, um einen Schaden zu melden, oder mitten in einer echten Krise. Dieses Gespräch prägt alles, was danach folgt, und ist oft der einzige echte Kontakt eines Kunden mit seinem Versicherer.
Admiral führt jedes Jahr Millionen solcher Gespräche im Vereinigten Königreich, Italien, Frankreich und Spanien. Jetzt setzt das Unternehmen KI-Agenten ein, um diese Gespräche zu unterstützen und gleichzeitig Compliance sicherzustellen.
In diesem Webinar erklärte uns das Team von Admiral, wie es vorgegangen ist: einen ersten Anwendungsfall auswählen, Rechts- und Compliance-Teams ab Tag null einbinden und vom funktionierenden Prototypen zu Produktionsänderungen gelangen, die heute in Stunden statt Wochen bereitgestellt werden.
Wichtigste Erkenntnisse
- Klein anfangen, aber praxisnah. Admirals erster Anwendungsfall in Produktion – Ablöseangebote im britischen Kreditgeschäft – war klar genug eingegrenzt, um ihn in einem realistischen Zeitrahmen bereitzustellen, bezog aber dennoch Telefonie und Backend-Integrationen ein. So ließ sich die Architektur validieren, ohne alles gleichzeitig lösen zu müssen.
- Vor der Skalierung die Messlatte höher legen, nicht niedriger. Admiral entwickelte von Tag eins an für den Produktionseinsatz, gestaltete seine Governance-Zyklen passend zur Geschwindigkeit der Technologie neu und band Rechts- und Compliance-Teams ab Tag null mit einem klar abgegrenzten Pilotprojekt ein.
- Regulierung ist die Mindestanforderung, nicht das gesamte Design. Admiral ergänzt regulatorische Vorgaben durch eigene interne Regeln, nutzt deterministische Logik für alles, was nachweisbar sein muss, und leitet besonders schutzbedürftige oder belastete Kunden an menschliche Mitarbeitende weiter.
- In Produktion beginnt die eigentliche Arbeit. Jede Agentenänderung durchläuft eine vollständige Suite von Simulationstests und wird schrittweise von 1 Prozent auf 100 Prozent des Verkehrs ausgerollt. Dieser Zyklus dauert heute Stunden statt Wochen.
Klein anfangen, aber nicht zu klein
Admirals erster Anwendungsfall in Produktion waren Ablöseangebote im britischen Kreditgeschäft – ein bewusst kontrollierter Einstieg statt des schwierigsten Problems auf der Liste. Kampa beschrieb den Ansatz so: Zunächst in einem Land und einer Geschäftssparte experimentieren, bevor die Lösung ausgeweitet wird.
Neely erklärte, dass dies erfolgreiche Produktionsimplementierungen von Projekten unterscheidet, die ins Stocken geraten: Der Anwendungsfall muss eng genug abgegrenzt sein, um ihn in einem realistischen Zeitrahmen zu lösen, aber komplex genug, um die umgebenden Systeme tatsächlich zu testen. Ablöseangebote funktionierten, weil das Gespräch nur eine begrenzte Zahl von Pfaden hat, aber dennoch Telefonie und Backend-Integrationen berührt. So ließ sich die Architektur validieren, ohne alles gleichzeitig lösen zu wollen.
Bei dieser Wahl waren einige Punkte entscheidend:
- Klarer Umfang, echte Komplexität. Der Anwendungsfall braucht genügend Varianten, um Telefonie und Backend-Integration zu testen – nicht nur einen vorgegebenen Idealfall.
- Schnell in Produktion. Je länger sich eine Entwicklung hinzieht, desto länger dauert es, bis echte Gespräche das Feedback liefern, das den Agenten wirklich verbessert. Neely nannte das „die letzten 20 Prozent“ – den Teil, der erst sichtbar wird, wenn echte Kunden mit dem System sprechen.
- Volumen und Wirkung zusammen betrachten. Admiral begann mit einfachen Interaktionen mit hohem Volumen, bei denen kürzere Wartezeiten und schnellere Lösungen die Kundenerfahrung sichtbar verbessern würden.
Vor der Skalierung die Messlatte höher legen, nicht niedriger
Die Führung von Admiral stellte klar, dass KI-Agenten die Standards für Compliance und Tests erhöhen sollten, nicht senken. Kampa formulierte es direkt: Der Validierungsstandard muss strenger sein als bisher, denn das Risiko, dass ein Agent vom Skript abweicht oder eine Regel verletzt, unterscheidet sich grundlegend von der Ermessensentscheidung eines menschlichen Mitarbeitenden.
Dieser Standard zeigte sich in drei frühen Zusagen des Teams:
- Für Produktion entwickeln, nicht für einen Proof of Concept. Kampa forderte ihre Teams auf, von Tag eins an mit dem Ziel eines Livegangs zu entwickeln, statt ein kleines Experiment durchzuführen, das nie skaliert.
- Governance im Tempo der Technologie. Kampa merkte an, dass ein Governance-Prozess, der sechs Monate für eine Freigabe benötigt, Gefahr läuft, Technologie zu genehmigen, die bei der Bereitstellung bereits veraltet ist. Admiral gestaltete seinen Prüfzyklus neu, damit er der Geschwindigkeit folgt, mit der sich zugrunde liegende Modelle und Tools verändern.
- Recht und Compliance ab Tag null. Auf die Frage, wann Rechts- und Compliance-Teams zum Projekt stießen, antworteten Kampa und Clark sofort: an Tag null – mit einem klar abgegrenzten Pilotprojekt, also einer definierten Anzahl von Anrufen, statt einer offenen Anfrage zur Freigabe.
Regulierung als Mindestanforderung verstehen, nicht als gesamtes Design
Clark stellte klar, dass regulatorische Anforderungen – etwa Kunden darüber zu informieren, dass sie mit einer KI sprechen, und in einigen Rechtsräumen die Weiterleitung an einen Menschen anzubieten – im Vereinigten Königreich, Italien, Frankreich und Spanien unterschiedlich sind. Admiral entwickelte seine Agenten so, dass sie diese Unterschiede bewältigen, ohne dass ein Anrufer sich durch eine „Eskalation“ einer lösbaren Unterhaltung entziehen kann.
Bestimmte Gespräche werden vollständig von Agenten ferngehalten: Admiral leitet besonders schutzbedürftige oder belastete Kunden an menschliche Mitarbeitende weiter. Die KI ist darauf trainiert, die Signale zu erkennen, die diese Übergabe auslösen.
Kampa beschrieb den umfassenderen Ansatz als mehrschichtig: „Regulierung ist nur die Mindestanforderung.“ Darüber liegen Admirals eigene interne Regeln und Kulturstandards, die teils über regulatorische Anforderungen hinausgehen.
Diese Schichtung bestimmte auch, wo Admiral deterministische und nicht deterministische Logik einsetzt. Clark erklärte, dass sich nicht deterministisches Schlussfolgern gut dafür eignet, die Absicht eines Anrufers zu verstehen oder Belastung zu erkennen. Alles, was das Unternehmen nachweisen können muss, jede verpflichtende regulatorische Aussage und jeder Gesprächspfad, den ein Kunde durchlaufen muss, muss dagegen deterministisch ablaufen – ohne Spielraum für Improvisation durch den Agenten.
Neely beschrieb, wie die Workflow-Struktur von ElevenLabs dies praktisch unterstützt: Agenten bestehen aus spezialisierten Sub-Agenten mit deterministischen Kontrollpunkten, etwa zur Authentifizierung. Je nachdem, ob eine Bedingung erfüllt ist, geben diese Funktionen frei oder halten sie zurück, statt das Modell selbst ableiten zu lassen, was es tun darf.
Gemeinsam mit den Verantwortlichen für den Prozess entwickeln
Statt einer traditionellen Übergabe zwischen Geschäftsanforderungen und Entwicklung führten Admiral und ElevenLabs Workshops vor Ort durch. Sie brachten die Personen mit Kenntnis des Anwendungsfalls, das Engineering-Team und das Telefonie-Team in einem Raum zusammen. Laut Neely entstand im ersten Workshop innerhalb von vier oder fünf Stunden eine funktionierende Version 0 des Agenten, verbunden mit Backend und Telefonie. Kampa und Clark konnten sie anschließend intern demonstrieren, um die Freigabe für die weitere Entwicklung zu erhalten.
Clark sagte, diese Nähe sei über den ersten Prototypen hinaus wichtig gewesen: Die fachlich Verantwortlichen sind der Technologie inzwischen nah genug, um einige Änderungen selbst vorzunehmen. Der Workshop behandelte die Plattform als Möglichkeit, einen bestehenden Geschäftsprozess zu übertragen, statt etwas völlig Unbekanntes einzuführen. Kampa stellte den Bezug zum Change Management her: Führungskräfte, mittlere Managementebene und Mitarbeitende an der Front werden früh einbezogen. So wird die Technologie Teil des tatsächlichen Geschäftsbetriebs statt zu einem Nebenprojekt.
In Produktion beginnt die eigentliche Arbeit
Nach dem Livegang behandelt Admiral jede Agentenänderung – ob groß oder klein – gleich: als Branch, der eine vollständige Suite von Simulationstests durchläuft, bevor Kunden damit in Kontakt kommen. Clark beschrieb, wie ein Rollout mit 1 Prozent des Verkehrs beginnt, während Kundenzufriedenheit und Lösungskennzahlen in Echtzeit beobachtet werden. Sobald die Kennzahlen stabil bleiben, wird auf 100 Prozent ausgeweitet. Dieser Zyklus dauert heute Stunden statt Wochen.
Aus diesem Iterationsprozess stachen zwei Erkenntnisse hervor:
- Die Sprache lokalisieren, nicht nur die Wörter. Admiral schrieb zunächst alle Prompts und Workflows auf Englisch und stellte fest, dass die Leistung in Frankreich, Spanien und Italien nicht dem Niveau im Vereinigten Königreich entsprach. Als die Prompts in der jeweiligen Sprache des Markts neu formuliert wurden, statt sie aus dem Englischen zu übersetzen, entsprachen die Antworten den lokalen Kundenerwartungen und der Kultur.
- Simulationstests müssen ernst genommen werden, nicht als Formalität. Neely sagte, einen Prompt zu schreiben, der einige simulierte Tests besteht, wirke einfach. Anspruchsvoller und wichtiger sei es, Test-Suites zu entwickeln, die den Agenten tatsächlich fordern, und klare Erfolgskriterien im Voraus zu definieren. Admiral führt heute vor jeder Bereitstellung Hunderte bis Tausende simulierte Gespräche für jede Änderung durch.
Bei den Ergebnissen hob Kampa die Bearbeitungszeit als wichtigste Kennzahl hervor: KI-geführte Gespräche erreichen oft schneller dieselbe Lösung wie von Menschen geführte Gespräche – auch weil keine Stille entsteht, während ein System lädt. Sie berichtete außerdem, dass CSAT und Lösungsquoten durch wiederholte Test- und Anpassungsrunden schrittweise stiegen, Markt für Markt, statt durch einen einzigen großen Sprung.
Was Sie daraus mitnehmen können, wenn Sie beginnen
Neelys Rat an Teams, die mit dieser Arbeit beginnen: Wählen Sie einen klar abgegrenzten Anwendungsfall, bringen Sie ihn schnell in Produktion und lassen Sie echte Kundengespräche – nicht weitere Tests vor dem Launch – die Sonderfälle aufdecken. Clark ergänzte, dass die Skalierung auf weitere Anwendungsfälle zunehmend schneller geht, sobald die Integrationen an beiden Enden – Telefonie und interne Systeme – nachgewiesen sind. Denn das Team weiß dann bereits, welche Evaluierungen und Kennzahlen relevant sind.
Kampas abschließender Punkt ging noch weiter: Die Ambition beschränkt sich nicht auf die Automatisierung von Gesprächen. Dieselbe KI-Schicht soll auch menschliche Mitarbeitende direkt unterstützen – durch Live-Transkripte, Hinweise zur nächstbesten Aktion und Trainingssimulationen.
Wie unser Host zusammenfasste, lautet die zentrale Erkenntnis aus diesem Gespräch: Regulierung und KI stehen nicht im Widerspruch. Von Tag eins an auf Prüfbarkeit, Konsistenz und die Weiterleitung an Menschen zu setzen, machte Admirals Agenten disziplinierter, nicht weniger diszipliniert.
Gesamte Session ansehen
Sehen Sie sich hier die gesamte Session an – einschließlich Live-Build und Fragen und Antworten aus dem Publikum.
.webp&w=3840&q=80)



