Unterstützung für mehrere Stimmen

Ermöglichen Sie Ihrem KI-Agenten, für Gespräche mit mehreren Charakteren und besseres Storytelling zwischen verschiedenen Stimmen zu wechseln.

Überblick

Mit der Unterstützung für mehrere Stimmen kann Ihr ElevenLabs-Agent während eines einzelnen Gesprächs dynamisch zwischen verschiedenen ElevenLabs-Stimmen wechseln. Diese Funktion ermöglicht:

  • Storytelling mit mehreren Charakteren: Verschiedene Stimmen für verschiedene Charaktere in Erzählungen
  • Sprachunterricht: Muttersprachliche Stimmen für verschiedene Sprachen
  • Emotionale Agenten: Stimmwechsel je nach emotionalem Kontext
  • Rollenspielszenarien: Unterschiedliche Stimmen für verschiedene Personas
Konfigurationsoberfläche für mehrere Stimmen

Funktionsweise

Wenn die Unterstützung für mehrere Stimmen aktiviert ist, kann Ihr Agent während der Textgenerierung XML-ähnliches Markup verwenden, um zwischen konfigurierten Stimmen zu wechseln. Der Agent kehrt automatisch zur Standardstimme zurück, wenn keine bestimmte Stimme angegeben ist.

The teacher said, <spanish>¡Hola estudiantes!</spanish>
Then the student replied, <student>Hello! How are you today?</student>

Konfiguration

Unterstützte Stimmen hinzufügen

Jede unterstützte Stimme hat die folgenden Eigenschaften:

  • Stimmbezeichnung: Eindeutige Kennung (z. B. „Joe“, „Spanisch“, „Fröhlich“)
  • Stimme: Wählen Sie aus Ihren verfügbaren ElevenLabs-Stimmen
  • Modellfamilie: Wählen Sie Turbo, Flash oder Multilingual (optional)
  • Sprache: Überschreiben Sie die Standardsprache für diese Stimme (optional)
  • Beschreibung: Wann der Agent diese Stimme verwenden soll

Öffnen Sie Ihren Agenten im Dashboard, wechseln Sie zum Tab Voice und suchen Sie den Bereich Unterstützung für mehrere Stimmen. Klicken Sie auf Stimme hinzufügen, um eine neue unterstützte Stimme zu konfigurieren.

Konfigurationsoberfläche für mehrere Stimmen

Stimmeigenschaften

Eine eindeutige Kennung, die das LLM verwendet, um auf diese Stimme zu verweisen. Wählen Sie aussagekräftige Bezeichnungen wie: - Charakternamen: „Alice“, „Bob“, „Erzähler“ - Sprachen: „Spanisch“, „Französisch“, „Deutsch“ - Emotionen: „Fröhlich“, „Traurig“, „Aufgeregt“ - Rollen: „Lehrer“, „Schüler“, „Guide”

Überschreiben Sie die Standard-Modellfamilie des Agenten für diese spezifische Stimme: - Flash: Schnellste Generierung, optimiert für die Echtzeitnutzung - Turbo: Ausgewogene Geschwindigkeit und Qualität - Multilingual: Höchste Qualität, optimal für nicht englische Sprachen - Wie Agent: Standardeinstellung des Agenten verwenden

Geben Sie eine andere Sprache für diese Stimme an. Dies ist nützlich für: - Mehrsprachige Gespräche - Sprach- lernanwendungen - Regionsspezifische Aussprachen

Geben Sie Kontext dazu, wann der Agent diese Stimme verwenden soll. Beispiele:

  • „Für alle spanischen Wörter oder Ausdrücke“
  • „Wenn der Nachrichteninhalt fröhlich oder aufgeregt ist“
  • „Immer wenn der Charakter Joe spricht“

Implementierung

XML-Markup-Syntax

Ihr Agent verwendet XML-ähnliche Tags, um zwischen Stimmen zu wechseln:

<VOICE_LABEL>text to be spoken</VOICE_LABEL>

Wichtige Hinweise:

  • Ersetzen Sie VOICE_LABEL durch die exakt konfigurierte Bezeichnung
  • Text außerhalb von Tags verwendet die Standardstimme
  • Bei Tags wird Groß- und Kleinschreibung berücksichtigt
  • Verschachtelte Tags werden nicht unterstützt

Integration in den System-Prompt

Wenn Sie unterstützte Stimmen konfigurieren, fügt das System automatisch Anweisungen zum Prompt Ihres Agenten hinzu:

When a message should be spoken by a particular person, use markup: "<CHARACTER>message</CHARACTER>" where CHARACTER is the character label.
Available voices are as follows:
- default: any text outside of the CHARACTER tags
- Joe: Whenever Joe is speaking
- Spanish: For any Spanish words or phrases
- Narrator: For narrative descriptions

Anwendungsbeispiel

Teacher: Let's practice greetings. In Spanish, we say <Spanish>¡Hola! ¿Cómo estás?</Spanish>
Student: How do I respond?
Teacher: You can say <Spanish>¡Hola! Estoy bien, gracias.</Spanish> which means Hello! I'm fine, thank you.

Best Practices

  • Wählen Sie Stimmen, die Charaktere oder Kontexte klar voneinander abgrenzen
  • Testen Sie Stimmkombinationen, um sicherzustellen, dass sie gut zusammen funktionieren
  • Berücksichtigen Sie für jede Stimme den emotionalen Ton und die Persönlichkeit
  • Stellen Sie sicher, dass Stimmen beim Sprachwechsel zu Sprache und Akzent passen
  • Verwenden Sie aussagekräftige, intuitive Bezeichnungen, die das LLM verstehen kann
  • Halten Sie Bezeichnungen kurz und einprägsam
  • Vermeiden Sie Sonderzeichen oder Leerzeichen in Bezeichnungen
  • Beschränken Sie die Anzahl unterstützter Stimmen auf das tatsächlich Benötigte
  • Verwenden Sie nach Möglichkeit dieselbe Modellfamilie, um den Wechselaufwand zu reduzieren
  • Testen Sie mit Ihren erwarteten Gesprächsmustern
  • Überwachen Sie Antwortzeiten bei mehreren Stimmwechseln
  • Geben Sie klare Beschreibungen dafür an, wann jede Stimme verwendet werden soll
  • Testen Sie Grenzfälle, bei denen der Stimmwechsel unklar sein könnte
  • Berücksichtigen Sie das Fallback-Verhalten bei mehrdeutigen Stimmbezeichnungen
  • Stellen Sie sicher, dass Stimmwechsel das Gespräch verbessern, statt davon abzulenken

Einschränkungen

  • Maximal 10 unterstützte Stimmen pro Agent (einschließlich Standardstimme)
  • Stimmwechsel fügen während der Generierung minimale Latenz hinzu
  • XML-Tags müssen korrekt formatiert und geschlossen sein
  • Bei Stimmbezeichnungen im Markup wird Groß- und Kleinschreibung berücksichtigt
  • Verschachtelte Stimm-Tags werden nicht unterstützt

FAQ

Wenn der Agent eine Stimmbezeichnung verwendet, die nicht konfiguriert wurde, wird der Text mit der Standardstimme gesprochen. Die XML-Tags werden ignoriert.

Ja, Sie können innerhalb einer einzelnen Antwort die Stimme wechseln. Jeder mit Tags versehene Abschnitt verwendet die angegebene Stimme, während Text ohne Tags die Standardstimme verwendet.

Stimmwechsel verursachen minimalen Mehraufwand. Bei der ersten Verwendung jeder Stimme in einem Gespräch kann die Latenz leicht höher sein, da die Stimme initialisiert wird.

Ja, Sie können mehrere Bezeichnungen konfigurieren, die dieselbe ElevenLabs-Stimme verwenden, aber unterschiedliche Modell- familien, Sprachen oder Kontexte haben.

Geben Sie in Ihrem System-Prompt klare Beispiele und testen Sie gründlich. Sie können konkrete Szenarien angeben, in denen Stimmwechsel stattfinden sollen, sowie Beispiele für das XML-Markup-Format.