Text zu Dialog
Erfahren Sie, wie Sie mit ElevenLabs immersive, natürlich klingende Dialoge erstellen.
Übersicht
Die ElevenLabs-API für Text to Dialogue erstellt mit dem Modell Eleven v3 natürlich klingende, ausdrucksstarke Dialoge aus Text. Beliebte Anwendungsfälle:
- Perfekt abgestimmte Gespräche für Videospiele generieren
- Immersive Dialoge für Podcasts und andere Audioinhalte erstellen
- Hörbücher mit ausdrucksstarker Erzählung zum Leben erwecken
Um die gewünschten Ergebnisse zu erzielen, können mehrere Generierungen erforderlich sein. Wenn Sie Text to Dialogue in Ihre Anwendung integrieren, sollten Sie mehrere Generierungen erstellen und Nutzerinnen und Nutzern die Auswahl der besten ermöglichen.
Hören Sie sich ein Beispiel an:
Stimmoptionen
ElevenLabs bietet über verschiedene Erstellungsmethoden Tausende Stimmen in mehr als 70 Sprachen:
- Stimmbibliothek mit über 3.000 von der Community geteilten Stimmen
- Professionelles KI-Stimme klonen für Repliken mit höchster Detailtreue
- Sofortiges KI-Stimme klonen für schnelle Stimmreplikation
- Stimmgestaltung, um benutzerdefinierte Stimmen aus Textbeschreibungen zu generieren
Erfahren Sie mehr über unsere Stimmoptionen.
Prompting
Die Modelle interpretieren emotionale Zusammenhänge direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus textuellen Hinweisen stammt.
Weitere Details finden Sie im Prompting-Leitfaden.
Emotionale Sprechweisen mit Audiotags
Das Modell Eleven v3 ermöglicht die Verwendung von Nicht-Sprach-Audioereignissen, um die Sprechweise des Dialogs zu beeinflussen. Dazu werden die Audioereignisse in eckigen Klammern in die Texteingabe eingefügt.
Bei Text to Dialogue hat jeder Dialogzug eigenen Text und eine eigene Stimme. Fügen Sie Audiotags in den Text des Dialogzugs ein, den sie beeinflussen sollen. voice_id wählt weiterhin die Sprecherstimme für diesen Zug aus, während die Tags die Sprechweise steuern.
Ein Sprecher kann beispielsweise eine Stimme verwenden, während der Text mit [giggling] beginnt. Der nächste Sprecher kann eine andere Stimme verwenden, während sein Text mit [whispering] beginnt. Ein API-Beispiel, das Tags mit voice_id kombiniert, finden Sie im Text-to-Dialogue-Schnellstart.
Audiotags sind natürlichsprachliche Anweisungen, kein Enum-Parameter. Setzen Sie die Anweisung in eckige Klammern und platzieren Sie sie dort im Text, wo sich die Sprechweise ändern soll. Die folgenden Beispiele sind nicht vollständig. Weitere Hinweise zu wirksamen Tags finden Sie im Eleven-v3-Prompting-Leitfaden.
Audiotags gibt es in verschiedenen Formen:
Emotionen und Sprechweise
Zum Beispiel [sad], [laughing] und [whispering]
Audioereignisse
Zum Beispiel [leaves rustling], [gentle footsteps] und [applause].
Allgemeine Anweisung
Zum Beispiel [football], [wrestling match] und [auctioneer].
Einige Beispiele:
Sie können auch Satzzeichen verwenden, um den Gesprächsverlauf anzuzeigen, etwa bei Unterbrechungen:
Auslassungspunkte können unvollendete Sätze anzeigen:
Unterstützte Ausgabeformate
Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.
- MP3
- Abtastraten: 22,05 kHz–44,1 kHz
- Bitraten: 32 kbps–192 kbps
- 22,05 kHz bei 32 kbps
- 44,1 kHz bei 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
- PCM (S16LE)
- Abtastraten: 16 kHz–44,1 kHz
- Bitraten: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
- 16-Bit-Tiefe
- μ-law
- Abtastrate: 8 kHz
- Optimiert für Telefonieanwendungen
- A-law
- Abtastrate: 8 kHz
- Optimiert für Telefonieanwendungen
- Opus
- Abtastrate: 48 kHz
- Bitraten: 32 kbps–192 kbps
Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .
Unterstützte Sprachen
Das Modell Eleven v3 unterstützt mehr als 70 Sprachen, darunter:
Afrikaans (afr), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Katalanisch (cat), Cebuano (ceb), Chichewa (nya), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Galicisch (glg), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Irisch (gle), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kannada (kan), Kasachisch (kaz), Kirgisisch (kir), Koreanisch (kor), Lettisch (lav), Lingala (lin), Litauisch (lit), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Mandarin-Chinesisch (cmn), Marathi (mar), Nepalesisch (nep), Norwegisch (nor), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch (por), Panjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Sindhi (snd), Slowakisch (slk), Slowenisch (slv), Somali (som), Spanisch (spa), Suaheli (swa), Schwedisch (swe), Tamil (tam), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Urdu (urd), Vietnamesisch (vie), Walisisch (cym).
FAQ
Welche Modelle kann ich verwenden?
Text to Dialogue ist nur mit dem Modell Eleven v3 verfügbar.
Besitze ich die Audioausgabe?
Ja. Sie behalten das Eigentum an allen von Ihnen generierten Audioinhalten. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audioinhalte kommerziell nutzen und die Ergebnisse monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.
Was gilt als kostenlose Neugenerierung?
Mit einer kostenlosen Neugenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:
- Nur im ElevenLabs-Dashboard verfügbar.
- Sie können jeden Inhalt bis zu zweimal kostenlos neu generieren.
- Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen am Text, an Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung.
Kostenlose Neugenerierungen sind nützlich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Neugenerierungen etwa die Hälfte der Qualitätsprobleme. Die übrigen Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.
Wie viele Sprecher kann mein Dialog haben?
Die Anzahl der Sprecher in einem Dialog ist nicht begrenzt.
Warum ist meine Ausgabe manchmal inkonsistent?
Die Modelle sind nicht deterministisch. Verwenden Sie für konsistentere Ergebnisse den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.
Was ist die beste Vorgehensweise für die Konvertierung großer Textmengen?
Halten Sie die Gesamtlänge aller inputs[].text-Werte pro Anfrage bei höchstens 2.000 Zeichen, um zuverlässige Generierungen zu erhalten. Teilen Sie längere Texte in Abschnitte auf und fügen Sie die resultierenden Audiodateien in Ihrer Anwendung zusammen.
Wichtige Fakten
- Modell: Nur mit Eleven v3 verfügbar
- Sprecher: Keine Begrenzung der Sprecherzahl pro Dialog
- Anfragegröße: Halten Sie die Gesamtlänge aller
inputs[].text-Werte pro Anfrage bei höchstens 2.000 Zeichen - Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter
seedfür konsistentere Ergebnisse - Kostenlose Neugenerierungen: Bis zu zwei kostenlose Neugenerierungen pro Generierung (gleicher Inhalt, gleiche Parameter, nur im Dashboard)
- Eigentum: Sie behalten das Eigentum an generierten Audioinhalten; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif