Text to Speech
Übersicht
Die ElevenLabs-API für Text to Speech (TTS) wandelt Text mit nuancierter Intonation, natürlichem Tempo und emotionalem Verständnis in lebensechte Audioinhalte um. Unsere Modelle reagieren in 32 Sprachen und mehreren Stimmstilen auf textuelle Hinweise und können für Folgendes verwendet werden:
- Globale Medienkampagnen und Werbung vertonen
- Hörbücher in mehreren Sprachen mit komplexer emotionaler Sprechweise produzieren
- Echtzeit-Audio aus Text streamen
Hören Sie sich ein Beispiel an:
Entdecken Sie unsere Stimmbibliothek, um die passende Stimme für Ihr Projekt zu finden.
Stimmqualität
Für Echtzeitanwendungen bietet Flash v2.5 eine extrem niedrige Latenz von 75 ms, während Multilingual v2 Audio in höchster Qualität mit nuancierterem Ausdruck liefert.
Stimmoptionen
ElevenLabs bietet über verschiedene Erstellungsmethoden Tausende Stimmen in 32 Sprachen:
- Stimmbibliothek mit über 3.000 von der Community geteilten Stimmen
- Professionelles KI-Stimme klonen für Repliken mit höchster Detailtreue
- Sofortiges KI-Stimme klonen für schnelle Stimmreplikation
- Stimmgestaltung, um benutzerdefinierte Stimmen aus Textbeschreibungen zu generieren
Erfahren Sie mehr über unsere Stimmoptionen.
Unterstützte Ausgabeformate
Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.
- MP3
- Abtastraten: 22,05 kHz–44,1 kHz
- Bitraten: 32 kbps–192 kbps
- 22,05 kHz bei 32 kbps
- 44,1 kHz bei 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
- PCM (S16LE)
- Abtastraten: 16 kHz–44,1 kHz
- Bitraten: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
- 16-Bit-Tiefe
- μ-law
- Abtastrate: 8 kHz
- Optimiert für Telefonieanwendungen
- A-law
- Abtastrate: 8 kHz
- Optimiert für Telefonieanwendungen
- Opus
- Abtastrate: 48 kHz
- Bitraten: 32 kbps–192 kbps
Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .
Unterstützte Sprachen
Unsere mehrsprachigen v2-Modelle unterstützen 29 Sprachen:
Englisch (USA, UK, Australien, Kanada), Japanisch, Chinesisch, Deutsch, Hindi, Französisch (Frankreich, Kanada), Koreanisch, Portugiesisch (Brasilien, Portugal), Italienisch, Spanisch (Spanien, Mexiko), Indonesisch, Niederländisch, Türkisch, Filipino, Polnisch, Schwedisch, Bulgarisch, Rumänisch, Arabisch (Saudi-Arabien, VAE), Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch, Slowakisch, Dänisch, Tamil, Ukrainisch & Russisch.
Flash v2.5 unterstützt 32 Sprachen – alle Sprachen der v2-Modelle sowie:
Ungarisch, Norwegisch & Vietnamesisch
Geben Sie einfach Text in einer unserer unterstützten Sprachen ein und wählen Sie eine passende Stimme aus unserer Stimmbibliothek. Für möglichst natürliche Ergebnisse wählen Sie eine Stimme mit einem Akzent, der zu Ihrer Zielsprache und Region passt.
Prompting
Die Modelle interpretieren emotionale Zusammenhänge direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus textuellen Hinweisen stammt.
Weitere Details finden Sie im Prompting-Leitfaden.
Beschreibender Text wird vom Modell mitgesprochen und muss bei Bedarf manuell aus dem Audio entfernt oder herausgeschnitten werden.
FAQ
Kann ich meine eigene Stimme klonen?
Ja, Sie können aus kurzen Audioaufnahmen sofortige Stimmklone Ihrer eigenen Stimme erstellen. Für Klone mit hoher Detailtreue nutzen Sie unsere Funktion für professionelles KI-Stimme klonen.
Besitze ich die Audioausgabe?
Ja. Sie behalten das Eigentum an allen von Ihnen generierten Audioinhalten. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audioinhalte kommerziell nutzen und die Ergebnisse monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.
Was gilt als kostenlose Neugenerierung?
Mit einer kostenlosen Neugenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:
- Sie können jeden Inhalt bis zu zweimal kostenlos neu generieren
- Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen am Text, an Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung
Kostenlose Neugenerierungen sind nützlich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Neugenerierungen etwa die Hälfte der Qualitätsprobleme. Die übrigen Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.
Wie reduziere ich die Latenz für Echtzeitanwendungen?
Verwenden Sie die latenzarmen Flash-Modelle (Flash v2 oder v2.5), die für nahezu Echtzeit-Gesprächs- oder Interaktionsszenarien optimiert sind. Weitere Details finden Sie in unserem Leitfaden zur Latenzoptimierung .
Warum ist meine Ausgabe manchmal inkonsistent?
Die Modelle sind nicht deterministisch. Verwenden Sie für konsistentere Ergebnisse den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.
Was ist die beste Vorgehensweise für die Konvertierung großer Textmengen?
Teilen Sie lange Texte in Abschnitte auf und verwenden Sie Streaming für Echtzeitwiedergabe und effiziente Verarbeitung. Um einen natürlichen Prosodiefluss zwischen Abschnitten zu erhalten, schließen Sie die Parameter für vorherigen/nächsten Text oder vorherige/nächste Anfrage-ID ein.
Wichtige Fakten
- Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter
seedfür konsistentere Ergebnisse - Kostenlose Neugenerierungen: Bis zu zwei kostenlose Neugenerierungen pro Generierung (nur gleicher Inhalt und gleiche Parameter)
- Eigentum: Sie behalten das Eigentum an generierten Audioinhalten; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif
- Anwendungsfälle mit niedriger Latenz: Verwenden Sie Flash-Modelle (
eleven_flash_v2odereleven_flash_v2_5) — siehe Leitfaden zur Latenzoptimierung - Lange Texte: Teilen Sie lange Texte in Abschnitte auf; verwenden Sie die Parameter
previous_text/next_text, um eine natürliche Prosodie über Abschnitte hinweg zu erhalten