Text to Speech

Erfahren Sie, wie Sie mit ElevenLabs Text in lebensechte gesprochene Audioinhalte umwandeln.

Übersicht

Die ElevenLabs-API für Text to Speech (TTS) wandelt Text mit nuancierter Intonation, natürlichem Tempo und emotionalem Verständnis in lebensechte Audioinhalte um. Unsere Modelle reagieren in 32 Sprachen und mehreren Stimmstilen auf textuelle Hinweise und können für Folgendes verwendet werden:

  • Globale Medienkampagnen und Werbung vertonen
  • Hörbücher in mehreren Sprachen mit komplexer emotionaler Sprechweise produzieren
  • Echtzeit-Audio aus Text streamen

Hören Sie sich ein Beispiel an:

Entdecken Sie unsere Stimmbibliothek, um die passende Stimme für Ihr Projekt zu finden.

Die Stimmbibliothek ist für Nutzerinnen und Nutzer des kostenlosen Tarifs nicht über die API verfügbar.

Stimmqualität

Für Echtzeitanwendungen bietet Flash v2.5 eine extrem niedrige Latenz von 75 ms, während Multilingual v2 Audio in höchster Qualität mit nuancierterem Ausdruck liefert.

Stimmoptionen

ElevenLabs bietet über verschiedene Erstellungsmethoden Tausende Stimmen in 32 Sprachen:

Erfahren Sie mehr über unsere Stimmoptionen.

Das Standard-Antwortformat ist mp3, aber auch andere Formate wie pcm und ulaw sind verfügbar.

  • MP3
    • Abtastraten: 22,05 kHz–44,1 kHz
    • Bitraten: 32 kbps–192 kbps
    • 22,05 kHz bei 32 kbps
    • 44,1 kHz bei 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
  • PCM (S16LE)
    • Abtastraten: 16 kHz–44,1 kHz
    • Bitraten: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
    • 16-Bit-Tiefe
  • μ-law
    • Abtastrate: 8 kHz
    • Optimiert für Telefonieanwendungen
  • A-law
    • Abtastrate: 8 kHz
    • Optimiert für Telefonieanwendungen
  • Opus
    • Abtastrate: 48 kHz
    • Bitraten: 32 kbps–192 kbps

Audiooptionen mit höherer Qualität sind nur in kostenpflichtigen Tarifen verfügbar. Details finden Sie auf unserer Preisseite .

Unterstützte Sprachen

Unsere mehrsprachigen v2-Modelle unterstützen 29 Sprachen:

Englisch (USA, UK, Australien, Kanada), Japanisch, Chinesisch, Deutsch, Hindi, Französisch (Frankreich, Kanada), Koreanisch, Portugiesisch (Brasilien, Portugal), Italienisch, Spanisch (Spanien, Mexiko), Indonesisch, Niederländisch, Türkisch, Filipino, Polnisch, Schwedisch, Bulgarisch, Rumänisch, Arabisch (Saudi-Arabien, VAE), Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch, Slowakisch, Dänisch, Tamil, Ukrainisch & Russisch.

Flash v2.5 unterstützt 32 Sprachen – alle Sprachen der v2-Modelle sowie:

Ungarisch, Norwegisch & Vietnamesisch

Geben Sie einfach Text in einer unserer unterstützten Sprachen ein und wählen Sie eine passende Stimme aus unserer Stimmbibliothek. Für möglichst natürliche Ergebnisse wählen Sie eine Stimme mit einem Akzent, der zu Ihrer Zielsprache und Region passt.

Prompting

Die Modelle interpretieren emotionale Zusammenhänge direkt aus der Texteingabe. Beispielsweise beeinflussen beschreibender Text wie „sagte sie aufgeregt“ oder Ausrufezeichen die emotionale Wirkung der Sprache. Stimmeinstellungen wie Stabilität und Ähnlichkeit helfen, die Konsistenz zu steuern, während die zugrunde liegende Emotion aus textuellen Hinweisen stammt.

Weitere Details finden Sie im Prompting-Leitfaden.

Beschreibender Text wird vom Modell mitgesprochen und muss bei Bedarf manuell aus dem Audio entfernt oder herausgeschnitten werden.

FAQ

Ja, Sie können aus kurzen Audioaufnahmen sofortige Stimmklone Ihrer eigenen Stimme erstellen. Für Klone mit hoher Detailtreue nutzen Sie unsere Funktion für professionelles KI-Stimme klonen.

Ja. Sie behalten das Eigentum an allen von Ihnen generierten Audioinhalten. Kommerzielle Nutzungsrechte sind jedoch nur mit kostenpflichtigen Tarifen verfügbar. Mit einem kostenpflichtigen Abonnement dürfen Sie generierte Audioinhalte kommerziell nutzen und die Ergebnisse monetarisieren, wenn Sie die IP-Rechte an den Eingabeinhalten besitzen.

Mit einer kostenlosen Neugenerierung können Sie denselben Text-to-Speech-Inhalt ohne zusätzliche Kosten erneut generieren, sofern diese Bedingungen erfüllt sind:

  • Sie können jeden Inhalt bis zu zweimal kostenlos neu generieren
  • Der Inhalt muss exakt mit der vorherigen Generierung übereinstimmen. Änderungen am Text, an Stimmeinstellungen oder anderen Parametern erfordern eine neue, kostenpflichtige Generierung

Kostenlose Neugenerierungen sind nützlich, wenn die Audioausgabe leicht verzerrt ist. Laut internen Benchmarks von ElevenLabs lösen Neugenerierungen etwa die Hälfte der Qualitätsprobleme. Die übrigen Probleme sind meist auf schlechte Trainingsdaten zurückzuführen.

Verwenden Sie die latenzarmen Flash-Modelle (Flash v2 oder v2.5), die für nahezu Echtzeit-Gesprächs- oder Interaktionsszenarien optimiert sind. Weitere Details finden Sie in unserem Leitfaden zur Latenzoptimierung .

Die Modelle sind nicht deterministisch. Verwenden Sie für konsistentere Ergebnisse den optionalen seed- Parameter, obwohl weiterhin geringfügige Unterschiede auftreten können.

Teilen Sie lange Texte in Abschnitte auf und verwenden Sie Streaming für Echtzeitwiedergabe und effiziente Verarbeitung. Um einen natürlichen Prosodiefluss zwischen Abschnitten zu erhalten, schließen Sie die Parameter für vorherigen/nächsten Text oder vorherige/nächste Anfrage-ID ein.

Wichtige Fakten

  • Determinismus: Die Ausgabe ist nicht deterministisch — verwenden Sie den Parameter seed für konsistentere Ergebnisse
  • Kostenlose Neugenerierungen: Bis zu zwei kostenlose Neugenerierungen pro Generierung (nur gleicher Inhalt und gleiche Parameter)
  • Eigentum: Sie behalten das Eigentum an generierten Audioinhalten; die kommerzielle Nutzung erfordert einen kostenpflichtigen Tarif
  • Anwendungsfälle mit niedriger Latenz: Verwenden Sie Flash-Modelle (eleven_flash_v2 oder eleven_flash_v2_5) — siehe Leitfaden zur Latenzoptimierung
  • Lange Texte: Teilen Sie lange Texte in Abschnitte auf; verwenden Sie die Parameter previous_text / next_text, um eine natürliche Prosodie über Abschnitte hinweg zu erhalten