Text zu Dialog

Erfahren Sie, wie Sie mit ElevenLabs immersive, natürlich klingende Dialoge erstellen.

Übersicht

Die ElevenLabs-API für Text to Dialogue erstellt mit dem Modell Eleven v3 natürlich klingende, ausdrucksstarke Dialoge aus Text. Beliebte Anwendungsfälle:

  • Perfekt abgestimmte Gespräche für Videospiele generieren
  • Immersive Dialoge für Podcasts und andere Audioinhalte erstellen
  • Hörbücher mit ausdrucksstarker Erzählung zum Leben erwecken

Um die gewünschten Ergebnisse zu erzielen, können mehrere Generierungen erforderlich sein. Wenn Sie Text to Dialogue in Ihre Anwendung integrieren, sollten Sie mehrere Generierungen erstellen und Nutzerinnen und Nutzern die Auswahl der besten ermöglichen.

Hören Sie sich ein Beispiel an:

Stimmoptionen

ElevenLabs bietet über verschiedene Erstellungsmethoden Tausende Stimmen in mehr als 70 Sprachen:

Erfahren Sie mehr über unsere Stimmoptionen.

Prompting

Die Modelle interpretieren emotionale Zusammenhänge direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus textuellen Hinweisen stammt.

Weitere Details finden Sie im Prompting-Leitfaden.

Emotionale Sprechweisen mit Audiotags

Diese Funktion befindet sich noch in aktiver Entwicklung. Die tatsächlichen Ergebnisse können variieren.

Das Modell Eleven v3 ermöglicht die Verwendung von Nicht-Sprach-Audioereignissen, um die Sprechweise des Dialogs zu beeinflussen. Dazu werden die Audioereignisse in eckigen Klammern in die Texteingabe eingefügt.

Bei Text to Dialogue hat jeder Dialogzug eigenen Text und eine eigene Stimme. Fügen Sie Audiotags in den Text des Dialogzugs ein, den sie beeinflussen sollen. voice_id wählt weiterhin die Sprecherstimme für diesen Zug aus, während die Tags die Sprechweise steuern.

Ein Sprecher kann beispielsweise eine Stimme verwenden, während der Text mit [giggling] beginnt. Der nächste Sprecher kann eine andere Stimme verwenden, während sein Text mit [whispering] beginnt. Ein API-Beispiel, das Tags mit voice_id kombiniert, finden Sie im Text-to-Dialogue-Schnellstart.

Audiotags sind natürlichsprachliche Anweisungen, kein Enum-Parameter. Setzen Sie die Anweisung in eckige Klammern und platzieren Sie sie dort im Text, wo sich die Sprechweise ändern soll. Die folgenden Beispiele sind nicht vollständig. Weitere Hinweise zu wirksamen Tags finden Sie im Eleven-v3-Prompting-Leitfaden.

Audiotags gibt es in verschiedenen Formen:

Emotionen und Sprechweise

Zum Beispiel [sad], [laughing] und [whispering]

Audioereignisse

Zum Beispiel [leaves rustling], [gentle footsteps] und [applause].

Allgemeine Anweisung

Zum Beispiel [football], [wrestling match] und [auctioneer].

Einige Beispiele:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

Sie können auch Satzzeichen verwenden, um den Gesprächsverlauf anzuzeigen, etwa bei Unterbrechungen:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Auslassungspunkte können unvollendete Sätze anzeigen:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.

  • MP3
    • Abtastraten: 22,05 kHz–44,1 kHz
    • Bitraten: 32 kbps–192 kbps
    • 22,05 kHz bei 32 kbps
    • 44,1 kHz bei 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
  • PCM (S16LE)
    • Abtastraten: 16 kHz–44,1 kHz
    • Bitraten: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
    • 16-Bit-Tiefe
  • μ-law
    • Abtastrate: 8 kHz
    • Optimiert für Telefonieanwendungen
  • A-law
    • Abtastrate: 8 kHz
    • Optimiert für Telefonieanwendungen
  • Opus
    • Abtastrate: 48 kHz
    • Bitraten: 32 kbps–192 kbps

Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .

Unterstützte Sprachen

Das Modell Eleven v3 unterstützt mehr als 70 Sprachen, darunter:

Afrikaans (afr), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Katalanisch (cat), Cebuano (ceb), Chichewa (nya), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Galicisch (glg), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Irisch (gle), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kannada (kan), Kasachisch (kaz), Kirgisisch (kir), Koreanisch (kor), Lettisch (lav), Lingala (lin), Litauisch (lit), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Mandarin-Chinesisch (cmn), Marathi (mar), Nepalesisch (nep), Norwegisch (nor), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch (por), Panjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Sindhi (snd), Slowakisch (slk), Slowenisch (slv), Somali (som), Spanisch (spa), Suaheli (swa), Schwedisch (swe), Tamil (tam), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Urdu (urd), Vietnamesisch (vie), Walisisch (cym).

FAQ

Text to Dialogue ist nur mit dem Modell Eleven v3 verfügbar.

Ja. Sie behalten das Eigentum an allen von Ihnen generierten Audioinhalten. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audioinhalte kommerziell nutzen und die Ergebnisse monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.

Mit einer kostenlosen Neugenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:

  • Nur im ElevenLabs-Dashboard verfügbar.
  • Sie können jeden Inhalt bis zu zweimal kostenlos neu generieren.
  • Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen am Text, an Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung.

Kostenlose Neugenerierungen sind nützlich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Neugenerierungen etwa die Hälfte der Qualitätsprobleme. Die übrigen Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.

Die Anzahl der Sprecher in einem Dialog ist nicht begrenzt.

Die Modelle sind nicht deterministisch. Verwenden Sie für konsistentere Ergebnisse den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.

Halten Sie die Gesamtlänge aller inputs[].text-Werte pro Anfrage bei höchstens 2.000 Zeichen, um zuverlässige Generierungen zu erhalten. Teilen Sie längere Texte in Abschnitte auf und fügen Sie die resultierenden Audiodateien in Ihrer Anwendung zusammen.

Wichtige Fakten

  • Modell: Nur mit Eleven v3 verfügbar
  • Sprecher: Keine Begrenzung der Sprecherzahl pro Dialog
  • Anfragegröße: Halten Sie die Gesamtlänge aller inputs[].text-Werte pro Anfrage bei höchstens 2.000 Zeichen
  • Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter seed für konsistentere Ergebnisse
  • Kostenlose Neugenerierungen: Bis zu zwei kostenlose Neugenerierungen pro Generierung (gleicher Inhalt, gleiche Parameter, nur im Dashboard)
  • Eigentum: Sie behalten das Eigentum an generierten Audioinhalten; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif