Wie man ein Konversations-KI-System anleitet
- Verfasst von
- Cindy Liu
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Heute bilden LLMs das Herzstück konversationeller KI-Systeme. Insbesondere ermöglichen LLMs konversationelle KI — ursprünglich auf komplexen Telefonmenüs aufgebaut — mit dynamischen Funktionen und menschenähnlichen Interaktionen. LLMs sind jedoch kein Allheilmittel: Sie erfordern spezialisierte Prompts, da sie standardmäßig nicht auf menschliche Sprache abgestimmt sind.
Entwickler machen beim Prompting von LLMs für konversationelle KI oft denselben Fehler: Sie übernehmen die Leitlinien, die für die Schulung menschlicher Mitarbeitender verwendet wurden. Diese Strategie klingt zwar naheliegend, führt aber selten zum Erfolg. LLMs treffen andere Annahmen als Menschen, und ihr Standardton sowie ihr Umfang eignen sich nicht für gesprochene Interaktionen.
Heute zeigen wir, wie Sie LLMs prompten, um erfolgreiche konversationelle KI-Systeme zu entwickeln. Einen umfassenderen technischen Leitfaden dazu finden Sie auch in der ElevenLabs-Entwicklerdokumentation.
Das alte System
Vor LLMs nutzten konversationelle KI-Systeme komplexe Entscheidungsbäume, die Anfragen anhand gesprochener Eingaben weiterleiteten. Diese Struktur war bei Kundenservice-Nummern, etwa Airline-Hotlines, und Zahlungssystemen, etwa Kreditkarten-Telefonservices, verbreitet.
Diese älteren Systeme waren langsam, wirkten roboterhaft und erlaubten nur sehr begrenzte menschliche Eingaben. Vielleicht haben Sie das selbst erlebt und zur Beantwortung einer Aufforderung ein entschiedenes „JA“ ins Telefon gerufen. Diese schlechte Erfahrung brachte viele Nutzer dazu, das System auszutricksen, um mit einem menschlichen Mitarbeitenden zu sprechen.
Diese Telefonmenüs hatten jedoch einen Vorteil — sie waren begrenzt. Ein Gespräch konnte nur eine bestimmte Anzahl von Pfaden nehmen, und Entwickler konnten einfach Sicherheitsvorkehrungen implementieren, um unzulässige Eingaben zu ignorieren. Diese Einschränkung verdeutlicht die Vor- und Nachteile von LLMs: Sie gehen weit über die Grenzen von Telefonmenüs hinaus, sind aber auch unvorhersehbar. Das öffnet die Büchse der Pandora für Probleme — etwa unmögliche Versprechen, Ärger mit Kunden oder Verstöße gegen sensible Daten.
Standardmäßige Lücken
Werden LLMs lediglich mit einem ursprünglich für Menschen entwickelten Handbuch trainiert, bleiben sie aufgrund einiger grundlegender Lücken nur mäßig erfolgreich. Wenn Sie diese Lücken verstehen, können Sie Prompts entwickeln, die sie schließen:
Unpassender Ton
LLMs werden durch Reinforcement Learning trainiert. Dabei motiviert menschliches Feedback sie dazu, strukturierte Antworten zu geben. LLM-Antworten sind daher oft ausführlich und voller Aufzählungen, Hervorhebungsblöcke und Überschriften.
Im Kontext konversationeller KI müssen LLMs jedoch die prägnante und lineare Natur gesprochener Interaktionen nachbilden.
Lücken bei Annahmen
LLMs neigen dazu, Unbekanntes mit abgeleitetem Wissen zu füllen, statt Fragen zu stellen. Das kann zu falschen Annahmen führen, die Nutzer in die Irre führen oder kostspielige Fehler verursachen, etwa versprochene Rückerstattungen. Später sehen wir, wie eine Wissensdatenbank und Sicherheitsvorkehrungen LLMs besser auf korrekte Informationen stützen, damit sie keine falschen Versprechen machen oder unzulässige Aktionen ausführen.
Latenz
LLMs können Funktionsaufrufe programmatisch ausführen und im Namen von Menschen Daten abrufen und schreiben. Das ist meist einer der größten Vorteile von LLMs. Damit sind frühere Schulungsanweisungen, nach denen Callcenter-Mitarbeitende während Aufgaben Zeit gewinnen sollten, jedoch nicht mehr nötig. Funktionsaufrufe erfolgen allerdings auch nicht sofort. LLMs müssen Nutzer daher zuverlässig vorwarnen, wenn mit einer Verzögerung zu rechnen ist, etwa: „Geben Sie mir einen Moment, um Ihren Fall zu prüfen.“
Konfigurationen
Persönlichkeit
LLMs können ihren Ton recht gut an einen Stil anpassen. Ein LLM kann so konfiguriert werden, dass es freundlich, humorvoll, prägnant, formell oder in einer Kombination dieser Stile klingt. Das ist ein wichtiger Input beim Prompting eines LLMs.
Entwickler einer konversationellen KI-Anwendung für den Kundenservice, die unzufriedene Airline-Kunden unterstützt, könnten beispielsweise folgenden Prompt verwenden:
Nicole
Format
LLMs benötigen explizite Anweisungen dazu, wie sie antworten sollen. Damit sie keinen zusätzlichen Fülltext einfügen, sollten LLMs eine Struktur erhalten, die die an Nutzer übermittelte Antwort umfasst.
LLMs könnten beispielsweise zu Folgendem aufgefordert werden:
Diese Struktur ermutigt das LLM, eine Antwort zu geben, die zum Vorlesen bestimmt ist.
LLMs können jedoch manchmal bei Dingen scheitern, die sich nicht offensichtlich von geschriebenen Inhalten unterscheiden. Ein häufiges Beispiel sind Zahlen — ein LLM könnte eine Postleitzahl wie 10023 ausgeben, worauf das Text to Speech-Modell „zehntausenddreiundzwanzig“ sagt. Stattdessen sollte das LLM explizit angewiesen werden, die Ziffern einzeln auszusprechen und ihre Bedeutung zu nennen, etwa: „Die Postleitzahl lautet eins null null zwei drei.“
Temperatur
Die Temperatur ist ein entscheidender Parameter bei der Konfiguration von LLMs für konversationelle KI. Eine niedrigere Temperatur erzeugt fokussiertere, deterministische Antworten, die sich ideal für aufgabenorientierte Gespräche eignen. Höhere Temperaturen führen dagegen zu kreativeren, vielfältigeren Antworten.
Eine niedrige Temperatur eignet sich ideal für konversationelle KI-Systeme, die konsistente Antworten bevorzugen, etwa eine Kundenservice-Hotline für Rückerstattungen. Systeme, die Kunden ein ansprechenderes und realistischeres Erlebnis bieten sollen, etwa ein digitaler Coach, profitieren dagegen von einer hohen Temperatur:
High Temperature: Hey hey! You've landed at ElevenLabs support—ready to tackle your tech troubles! What's on your mind?
Wissensdatenbanken
Für konversationelle KI-Systeme, die auf größere Wissensbestände zugreifen, sollte eine Wissensdatenbank genutzt werden, um die Prompt-Länge zu reduzieren. In der Produktion geschieht dies typischerweise über eine Vektordatenbank wie Pinecone oder Elasticsearch oder über den direkten Wissensspeicher des LLM-Anbieters.
Wissensdatenbanken sind grundsätzlich entscheidend, um LLM-Antworten auf faktische, freigegebene Informationen zu stützen. Wenn Sie ein konversationelles KI-System entwickeln, sollten Sie dem LLM eine umfassende Wissensdatenbank mit genauen, aktuellen Informationen zu Produkten, Dienstleistungen, Richtlinien und Prozessen bereitstellen. Das verhindert Halluzinationen und erfundene Informationen und fördert zugleich konsistente, zuverlässige Antworten in allen Gesprächen.
Prozess
Da LLMs häufig im Namen des Nutzers Funktionen aufrufen, müssen sie auch wissen, welche Eingaben ausdrücklich erforderlich sind. Soll ein LLM beispielsweise einem Nutzer helfen, einen Friseurtermin zu vereinbaren, muss es sicherstellen, dass folgende Angaben vorliegen:
- Der Name des Nutzers
- Das gewünschte Datum und die gewünschte Uhrzeit
- Die Adresse des Nutzers
- Die gewünschte Dienstleistung
Eine einfache Implementierung könnte dazu führen, dass das LLM in einem Gesprächszug nach allen Informationen fragt. Als Text ist das völlig in Ordnung, in einem Gespräch kann es jedoch überfordern:
Customer: My name is Mathew and anytime Wednesday afternoon works. What else did you ask for?
Da Informationen in Gesprächen meist schrittweise erfasst werden, müssen LLMs dazu angeleitet werden, diese Informationen nach und nach einzuholen. Das Ergebnis ist ein deutlich natürlicheres Gesprächserlebnis:
Customer: My name is Mathew Pregasen.
Support Agent: Thanks Mathew. When would you like to make an appointment?
Customer: Anytime on Wednesday afternoon works fine.
Support Agent: Great. Now can I get your address to find the nearest location?
Customer: 555 West Main Street
Support Agent: Perfect. Now what service are you look for?
Customer: I'm looking for a haircut and if you could also do my beard that would be great!
Sicherheitsvorkehrungen
Berechtigungen
Beim Aufbau verteilter Systeme gehen Sie davon aus, dass Ihr Server irgendwann ausfällt. Genauso sollten Sie beim Aufbau von KI-Systemen davon ausgehen, dass Ihr LLM irgendwann einen Fehler macht. Um die Auswirkungen dieses Fehlers zu begrenzen, sollten Sie diesen Systemen nur die für die jeweilige Aufgabe erforderlichen Mindestberechtigungen erteilen. Hier sind einige Möglichkeiten:
- Lese-/Schreibberechtigungen korrekt festlegen: Muss das LLM Informationen nur aus einer Datenquelle lesen, stellen Sie sicher, dass es einen schreibgeschützten Endpunkt erhält.
- Zugriff auf API-Endpunkte begrenzen: Benötigt das LLM nur Zugriff auf bestimmte Endpunkte, stellen Sie sicher, dass es keine anderen aufrufen kann.
- Eskalationen mit menschlicher Beteiligung: Wenn eine risikoreiche Aktion erforderlich ist, erwägen Sie einen Human-in-the-Loop-Workflow, der vor der Ausführung der Aktion eine „Genehmigung durch einen Manager“ erfordert.
Validierung und Verifizierung
Beim Erstellen von KI-Sprachagenten-Systemen, die über Tools Aktionen ausführen, hilft ein Validierungs- und Verifizierungsprozess sicherzustellen, dass Sie die richtigen Informationen von Nutzern erfassen. Wenn Sie heute mit einem menschlichen Mitarbeitenden sprechen, wiederholt dieser wichtige Angaben, um zu prüfen, ob er sie richtig verstanden hat und der Kunde sich nicht versprochen hat. LLMs könnten von einem ähnlichen Niveau der Fehlerprüfung profitieren:
Customer: 555 West Main Street
Support Agent: I got five five five west main street. Did I miss anything?
Zur Validierung sollten alle vom Kunden erhaltenen Informationen mit ihrer üblichen Struktur abgeglichen werden. Hat die Telefonnummer die richtige Anzahl von Ziffern? Liegt das vom Kunden genannte Alter in einem plausiblen Bereich? Hat der Kunde eine gültige Adresse angegeben?
Customer: 317-798-97289
Support Agent: I think I might have misheard you. I heard 11 numbers. Would you mind repeating that again?
Je nach Anwendungsfall können Sie alle erhaltenen Informationen prüfen oder nur Angaben, die die Verifizierung nicht bestanden haben. Außerdem können Sie jede Information direkt beim Eingang prüfen oder alles erst am Ende verifizieren.
Abschließender Gedanke
Das erfolgreiche Prompting eines konversationellen KI-Agenten-Systems erfordert ausgewogene Konfigurationen und Sicherheitsvorkehrungen, um ein Erlebnis zu schaffen, das ein Gespräch mit einem Menschen bei höherer Effizienz nachbildet. Der Prozess ist nicht so einfach, wie alte Schulungsunterlagen zum Prompting eines LLMs zu verwenden. LLMs sind vielmehr Tools, die eine spezialisierte Struktur und Strategie benötigen, um vorhersehbare, wirksame Ergebnisse zu erzielen.

