Sprechen Sie mit DeepSeek R1 über ElevenLabs Conversational AI
- Verfasst von
- Thor Schaeff
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
In letzter Zeit spricht jeder über DeepSeek, doch niemand hat gefragt: Wie würde DeepSeek klingen, wenn es sprechen könnte? Hier kommt ElevenLabs Conversational AI ins Spiel, um Gespräche mit DeepSeek R1 zu ermöglichen.
ElevenLabs Conversational AI ist eine Plattform für den Einsatz maßgeschneiderter Konversations-Sprachagenten in Echtzeit. Ein zentraler Vorteil der Plattform ist ihre Flexibilität: Sie können je nach Bedarf verschiedene LLMs anbinden.

Die Option Custom LLM funktioniert mit jedem OpenAI-kompatiblen API-Anbieter, sofern das Modell Tool Use bzw. Function Calling unterstützt. In unserer Dokumentation finden Sie Anleitungen für GroqCloud, Together AI und Cloudflare. Für die folgende Demo verwenden wir Cloudflare.
Wir verwenden das Modell DeepSeek-R1-Distill-Qwen-32B, eine auf Qwen2.5 basierende, aus DeepSeek-R1 destillierte Version. Es übertrifft OpenAI-o1-mini in verschiedenen Benchmarks und erzielt neue Spitzenwerte für dichte Modelle.
Wir verwenden die destillierte Version hauptsächlich, weil die reinen Versionen mit Function Calling noch nicht zuverlässig funktionieren. Tatsächlich unterstützt das R1-Reasoning-Modell Function Calling bisher überhaupt nicht. Unter diesem Issue können Sie den Fortschritt verfolgen.
Erste Schritte mit ElevenLabs Conversational AI
Ein benutzerdefiniertes LLM anzubinden, ist unkompliziert und beginnt mit dem Erstellen eines Agenten. Für dieses Projekt verwenden wir die Vorlage „Math Tutor“. Wenn Sie nur hören möchten, wie DeepSeek klingt, können Sie eine Demo des Agenten selbst ausprobieren.
Öffnen Sie zunächst die App-Seite von ElevenLabs Conversational AI und erstellen Sie einen neuen KI-Agenten mit dem Namen „DeepSeeker“. Wählen Sie die Vorlage „Math Tutor“, denn hier kann DeepSeeks Reasoning seine Stärken ausspielen. Wählen Sie dann „Create Agent“.
Die Mathematikvorlage enthält einen System Prompt, der sicherstellt, dass Zahlen und Gleichungen in natürlicher Sprache vorgelesen werden, statt so, wie sie vom LLM geschrieben sind. Zum Beispiel weisen wir den Agenten an, „Alpha mal x zum Quadrat gleich 4“ zu schreiben, wenn die Antwort des LLM „ax^2=4“ lautet.

Reasoning-Modelle erklären in der Regel ihre „Gedankenkette“. Sie können den System Prompt aber auch erweitern, um sicherzustellen, dass Sie eine gute Mathematik-Erklärung erhalten. Legen Sie etwa fest, dass der Lösungsweg Schritt für Schritt erläutert wird. Sie können dies allgemein halten oder den Prompt um konkrete Beispiele ergänzen, auf die das Modell zurückgreifen kann.
Wenn Sie dagegen ein Gefühl für die Persönlichkeit von DeepSeek R1 bekommen möchten, können Sie eine leere Vorlage erstellen. Bitten Sie den Agenten darin, sich als DeepSeek AI vorzustellen, und legen Sie im System Prompt fest, dass er Fragen zu verschiedenen Themen beantworten soll.
DeepSeek R1 mit Cloudflare Workers AI einrichten
Als Nächstes benötigen wir einen Endpunkt für eine DeepSeek-R1-Version, die unser Agent verwenden kann. In diesem Beispiel nutzen wir Cloudflare. Dort ist DeepSeek-R1-Distill-Qwen-32B auf der Workers-AI-Plattform zu Evaluierungszwecken verfügbar. Sie können jedoch auch andere Hosting-Optionen in Betracht ziehen, etwa fireworks.ai, GroqCloud und together.ai
Öffnen Sie zunächst dash.cloudflare.com und erstellen Sie ein Konto oder melden Sie sich an. Wählen Sie in der Navigation AI > Workers AI und klicken Sie dann auf das Widget „Use REST API“.

Um einen API-Schlüssel zu erhalten, klicken Sie auf „Create a Workers AI API Token“ und speichern Sie ihn sicher.
Sobald Sie Ihren API-Schlüssel haben, können Sie ihn direkt mit einer curl-Anfrage testen. Cloudflare bietet einen OpenAI-kompatiblen API-Endpunkt, was die Einrichtung erleichtert. Notieren Sie sich jetzt das Modell und den vollständigen Endpunkt — einschließlich der Account-ID.
Zum Beispiel: https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}c/ai/v1/
curl https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/v1/chat/completions \ -X POST \ -H "Authorization: Bearer {API_TOKEN}" \ -d '{ "model": "@cf/deepseek-ai/deepseek-r1-distill-qwen-32b", "messages": [ {"role": "system", "content": "You are a helpful assistant."}, {"role": "user", "content": "How many Rs in the word Strawberry?"} ], "stream": false }'
Ihr benutzerdefiniertes LLM in ElevenLabs konfigurieren
Als Nächstes fügen Sie diese Angaben zu Ihrem Agenten in ElevenLabs hinzu. Öffnen Sie zunächst Ihren DeepSeeker-KI-Agenten in der ElevenLabs-App und fügen Sie ganz unten Ihren neu erstellten API-Schlüssel als Secret hinzu. Vergeben Sie einen Namen wie CLOUDFLARE_AUTH_TOKEN und speichern Sie die Änderungen.

Wählen Sie anschließend unter LLM die Option „Custom LLM“ und geben Sie den OpenAI-kompatiblen Cloudflare-Workers-AI-API-Endpunkt ein: https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/v1
Ersetzen Sie „{ACCOUNT_ID}“ in der URL durch die in Cloudflare angezeigte Account-ID.
Fügen Sie die Modell-ID hinzu: @cf/deepseek-ai/deepseek-r1-distill-qwen-32b
Wählen Sie abschließend das soeben erstellte Secret aus.

Testen
Alles ist eingerichtet. Klicken Sie jetzt auf „Test AI agent“ und testen Sie den Agenten mit folgender Mathematikaufgabe:
„Zwei Züge fahren einander in Ost-West-Richtung mit Geschwindigkeiten von 65 mph bzw. 85 mph entgegen. Wie lange dauert es, bis sie 330 Meilen voneinander entfernt sind?“
Hinweis: Wenn Sie keine Zahlungsmethode eingerichtet haben, wird die Cloudflare Workers AI API gedrosselt. Dadurch können die Antwortzeiten länger sein. Richten Sie Ihr Abrechnungskonto ein, bevor Sie in die Produktion gehen. Bei anderen Hosting-Plattformen ist das möglicherweise kein Problem.
Fazit
Der Aufbau von Konversations-KI-Agenten in Echtzeit mit der Plattform ElevenLabs Conversational AI ermöglicht es Ihnen, schnell auf neue Modelle zu reagieren. Dazu binden Sie benutzerdefinierte LLMs über jeden OpenAI-kompatiblen API-Anbieter an.
Solange das gewünschte Modell OpenAI-kompatibel ist und Function Calling unterstützt, können Sie es in einen Echtzeit-Sprachagenten integrieren. Dazu können auch Modelle gehören, die Sie auf eigenen Datensätzen feinabgestimmt haben. Sie können außerdem jede Stimme aus der ElevenLabs-Bibliothek verwenden — oder Ihre eigene, wenn Sie Ihre eigene Stimme geklont haben.



