Text to Speech

Anleitung zum Umwandeln von Text in Sprache mit ElevenLabs

Überblick

Die Text-to-Speech-Technologie von ElevenLabs ist ein zentraler Bestandteil unseres Angebots. Sie ermöglicht weltweit hochwertige KI-generierte Sprache für verschiedene Anwendungen. Wahrscheinlich haben Sie unsere Stimmen bereits gehört und realistische Audioerlebnisse erlebt.

Die erste Audiodatei mit Text to Speech zu erstellen, ist sehr einfach. Um diese Funktion optimal zu nutzen, sollten Sie jedoch einige Punkte beachten.

Anleitung

Text-to-Speech-Demo

1

Texteingabe

Geben Sie Ihren Text in das Eingabefeld auf der Text-to-Speech-Seite ein oder fügen Sie ihn ein.

2

Stimme auswählen

Wählen Sie unten links auf dem Bildschirm unter Ihren Stimmen die gewünschte Stimme aus.

3

Einstellungen anpassen (optional)

Passen Sie die Stimmeinstellungen für die gewünschte Ausgabe an.
4

Generieren

Klicken Sie auf „Generieren“, um Ihre Audiodatei zu erstellen.

Einstellungen

Machen Sie sich mit Stimmen, Modellen und Einstellungen für hochwertige Sprachgenerierung vertraut.

Die verwendeten Einstellungen, insbesondere Stimme und Modell, beeinflussen die Ausgabe erheblich. Es ist wichtig, sich mit ihnen vertraut zu machen und einige Best Practices zu verstehen. Auch andere Einstellungen beeinflussen die Ausgabe, jedoch weniger stark als die ausgewählte Stimme und das Modell.

Die Reihenfolge der Wichtigkeit: Die Auswahl der Stimme ist am wichtigsten, gefolgt von der Auswahl des Modells und dann den Einstellungen des Modells. All diese Faktoren und ihre Kombination beeinflussen die Ausgabe.

Stimmen

Text-to-Speech-Stimm-
auswahl

Wir bieten viele Arten von Stimmen: die kuratierten Standardstimmen, unsere umfangreiche Stimmbibliothek wmit fast allen vorstellbaren Stimmen, vollständig synthetische Stimmen, die mit unserem Tool Voice Design erstellt wurden, sowie Ihre eigene Sammlung geklonter Stimmen mit unseren zwei Technologien: Instant Voice Cloning und Professional Voice Cloning.

Nicht alle Stimmen sind gleich. Viel hängt vom Quellaudio ab, das für ihre Erstellung verwendet wurde. Manche Stimmen liefern eine bessere, menschlichere Performance und Sprechweise, während andere stabiler sind.

Die richtige Stimme für Ihre Inhalte auszuwählen, ist entscheidend. Dies ist wahrscheinlich die wichtigste Entscheidung und hat den größten Einfluss auf die endgültige Ausgabe. Sie bestimmt Geschlecht, Tonfall, Akzent, Rhythmus und Sprechweise. Es lohnt sich, zusätzliche Zeit für die Auswahl und sorgfältige Tests der passenden Stimme zu investieren, damit sie konsistent ist und Ihren Erwartungen entspricht.

Für die Sprachgenerierung in einer bestimmten Sprache erzielen Sie die besten Ergebnisse mit einer muttersprachlichen Stimme aus der Stimmbibliothek oder durch das Klonen einer Stimme, die diese Sprache mit dem richtigen Akzent spricht. Technisch kann jede Stimme jede Sprache sprechen, behält dabei jedoch ihren ursprünglichen Akzent. Wenn Sie beispielsweise mit einer englischen Muttersprachler-Stimme französische Sprache generieren, ist die Ausgabe wahrscheinlich Französisch mit englischem Akzent, da die KI ableiten muss, wie diese Stimme in einer Sprache klingt, auf der sie nicht trainiert wurde.

Mehr über Stimmen erfahren

Wenn Ihnen eine Stimme gefällt, Sie aber eine andere Sprechweise wünschen, kann unser Tool Voice Remixing helfen. Damit können Sie die Sprechweise, den Rhythmus, den Tonfall, das Geschlecht und sogar Akzente einer Stimme mit Prompts in natürlicher Sprache ändern. Beim Ändern von Akzenten sind die Basisstimme und der Zielakzent sehr wichtig. Die Ergebnisse können variieren: Manchmal funktioniert es perfekt, manchmal sind mehrere Versuche nötig.

Mit Voice Remixing können Sie sehr gute Ergebnisse erzielen, sie sind jedoch meist nicht so gut wie mit einem korrekt geklonten Professional Voice Clone. Sie ähneln eher einem Instant Voice Clone.

Beachten Sie, dass Voice Remixing nur für bestimmte Stimmen funktioniert. Sie können beispielsweise keine Stimmen aus der Stimmbibliothek remixen, sondern nur selbst erstellte Stimmen oder Standardstimmen.

Modelle

Text-to-Speech-Modell-
auswahl

Wir bieten zwei Modellfamilien: Standardmodelle (hohe Qualität) und Flash-Modelle, die für extrem niedrige Latenz optimiert sind. Die meisten Familien umfassen sowohl rein englische als auch mehrsprachige Versionen.

Das Modell Eleven v3 ist derzeit nur in einer Version verfügbar: als mehrsprachige Standardversion.

Die Modellauswahl hat nach der Stimmwahl den zweitgrößten Einfluss auf Ihre endgültige Audioausgabe. Wir empfehlen, verschiedene Modelle mit der gewählten Stimme zu testen, um die beste Kombination zu finden. Alle unsere Modelle haben Stärken und Schwächen und funktionieren mit manchen Stimmen besser als mit anderen. Eine gute Kombination zu finden, ist daher wichtig.

Wenn Ihre Ausgabe ausschließlich auf Englisch sein wird, empfehlen wir dringend eines unserer rein englischen Modelle. Sie sind oft einfacher zu verwenden, stabiler und bieten für ausschließlich englische Inhalte in der Regel eine bessere Leistung. Wenn Ihre Inhalte in einer anderen Sprache oder möglicherweise mehrsprachig sind, müssen Sie eines der mehrsprachigen Modelle verwenden.

Mehr über unsere Modelle erfahren

Stimmeinstellungen

Text-to-Speech-Stimm-
einstellungen

Üblich sind eine Stabilität von etwa 50, eine Ähnlichkeit von etwa 75 und ein Stilwert von 0, danach mit möglichst wenigen Änderungen. Das hängt natürlich von der ursprünglichen Stimme und der gewünschten Art der Performance ab.

Wichtig: Die KI ist nicht deterministisch. Bestimmte Reglerwerte garantieren nicht jedes Mal dieselben Ergebnisse. Die Regler funktionieren vielmehr als Bereich und legen fest, wie stark die Zufälligkeit zwischen den einzelnen Generierungen variieren kann.

Geschwindigkeit

Mit der Geschwindigkeitseinstellung können Sie die generierte Sprache beschleunigen oder verlangsamen. Der Standardwert ist 1.0; die Geschwindigkeit wird dann nicht angepasst. Werte unter 1.0 verlangsamen die Stimme bis zu einem Minimum von 0.7. Werte über 1.0 beschleunigen die Stimme bis zu einem Maximum von 1.2. Extreme Werte können die Qualität der generierten Sprache beeinträchtigen.

Geschwindigkeit ist für das Modell Eleven v3 nicht verfügbar.

Stabilität

Der Stabilitätsregler bestimmt, wie stabil die Stimme ist und wie stark die Zufälligkeit zwischen den einzelnen Generierungen ausfällt. Ein niedrigerer Wert erweitert die emotionale Bandbreite der Stimme. Wie bereits erwähnt, wird dies auch stark von der ursprünglichen Stimme beeinflusst. Ein zu niedriger Wert kann zu ungewöhnlichen, übermäßig zufälligen Performances führen, bei denen die Stimme zu schnell spricht. Ein zu hoher Wert kann dagegen eine monotone Stimme mit wenig Emotionen erzeugen.

Für eine lebendigere und dramatischere Performance empfehlen wir, den Stabilitätsregler niedriger einzustellen und einige Male zu generieren, bis Sie eine passende Performance finden.

Wenn Sie dagegen eine ernstere Performance wünschen, die bei sehr hohen Werten sogar an Monotonie grenzt, empfehlen wir einen höheren Stabilitätswert. Da die Ergebnisse konsistenter und stabiler sind, müssen Sie in der Regel nicht so viele Samples generieren, um das gewünschte Ergebnis zu erzielen. Experimentieren Sie, um herauszufinden, was für Sie am besten funktioniert.

Ähnlichkeit

Der Ähnlichkeitsregler legt fest, wie genau die KI die ursprüngliche Stimme bei der Reproduktion nachbilden soll. Wenn das Originalaudio von schlechter Qualität ist und der Ähnlichkeitsregler zu hoch eingestellt ist, kann die KI beim Versuch, die Stimme nachzuahmen, Artefakte oder Hintergrundgeräusche reproduzieren, sofern diese in der Originalaufnahme vorhanden waren.

Ähnlichkeit ist für das Modell Eleven v3 nicht verfügbar.

Stilübertreibung

Mit den neueren Modellen haben wir auch eine Einstellung für Stilübertreibung eingeführt. Sie verstärkt den Stil des ursprünglichen Sprechers. Sie benötigt zusätzliche Rechenressourcen und kann die Latenz erhöhen, wenn sie auf einen anderen Wert als 0 gesetzt wird. Beachten Sie, dass diese Einstellung das Modell etwas weniger stabil machen kann, da es den Stil der ursprünglichen Stimme stärker hervorheben und nachahmen soll.

Im Allgemeinen empfehlen wir, diese Einstellung immer auf 0 zu belassen.

Speaker Boost

Diese Einstellung erhöht die Ähnlichkeit mit dem ursprünglichen Sprecher. Sie erfordert jedoch eine etwas höhere Rechenlast und erhöht dadurch die Latenz. Die durch diese Einstellung erzeugten Unterschiede sind in der Regel eher subtil.

Speaker Boost ist für das Modell Eleven v3 nicht verfügbar.

Generieren

Nachdem Sie Ihre Stimme ausgewählt, ein Modell gewählt und die Einstellungen konfiguriert haben, ist der Generierungsprozess einfach: Sie geben Text ein, drücken „Sprache generieren“ und das Audio wird generiert.

Auch wenn der Prozess oberflächlich betrachtet sehr einfach ist, ist die Texteingabe für die gewünschte Ausgabe äußerst wichtig. Wenn Sie Wörter verwenden, die möglicherweise „außerhalb der Verteilung“ liegen – also Dinge, denen die KI während des Trainings selten begegnet ist –, etwa ungewöhnliche Namen, seltene Abkürzungen, Symbole oder sogar Emojis, können Sie die KI verwirren und die Ausgabe instabiler machen. Emojis und bestimmte Symbole sind für die KI besonders schwer korrekt zu interpretieren.

Bei der Verwendung von Text to Speech über die Benutzeroberfläche führen wir für Ihre Eingabe einen automatischen Normalisierungsschritt aus, um die Lesbarkeit des Textes zu verbessern und die Verarbeitung durch die KI zu erleichtern. Dieser Schritt wandelt Symbole und Zahlen im Allgemeinen in ausgeschriebenen Text um und hilft der KI so bei der korrekten Aussprache.

Als Best Practice empfehlen wir dringend, Zahlen nicht als Ziffern zu schreiben und keine Symbole zu verwenden, besonders bei mehrsprachigen Modellen. Dies gilt aber auch für rein englische Modelle. Da Zahlen und Symbole in vielen Sprachen gleich geschrieben, aber unterschiedlich ausgesprochen werden, führen Ziffern für die KI zu Mehrdeutigkeit. Die Zahl „1“ wird beispielsweise im Englischen und vielen anderen Sprachen identisch geschrieben, aber unterschiedlich ausgesprochen. Wenn Sie die Zahl ausschreiben, etwa „eins“, muss die KI nicht mehr interpretieren, was sie tun soll.

Wir arbeiten an erweiterten Workflows, mit denen Sie die Sprechweise und Performance der KI über sogenannte Audio Tags beeinflussen können. Diese Funktion ist in unserem Modell Eleven v3 verfügbar. Wenn Sie mehr über diese Funktion erfahren möchten, empfehlen wir unsere Dokumentation zu Eleven v3.

FAQ

Der erste und einer der wichtigsten Faktoren ist: Gute, hochwertige und konsistente Eingaben führen zu guten, hochwertigen und konsistenten Ausgaben.

Wenn Sie der KI Audio bereitstellen, das nicht optimal ist – etwa Audio mit viel Rauschen, Hall auf klarer Sprache, mehreren Sprechern oder uneinheitlicher Lautstärke, Performance oder Sprechweise –, wird die KI instabiler und die Ausgabe unvorhersehbarer.

Wenn Sie Ihre eigene Stimme klonen möchten, empfehlen wir dringend, unsere Richtlinien in der Dokumentation zum Erstellen hochwertiger Stimmklone zu lesen. So schaffen Sie die bestmögliche Grundlage. Auch wenn Sie nur Instant Voice Clones verwenden möchten, sollten Sie den Abschnitt zu Professional Voice Cloning lesen. Er enthält wertvolle Informationen zum Erstellen von Stimmklonen, auch wenn die Anforderungen dieser beiden Technologien leicht unterschiedlich sind.

Der zweite wichtige Faktor ist, dass die ausgewählte Stimme die Ausgabe erheblich beeinflusst. Wie beim ersten Faktor erwähnt, sind nicht nur Qualität und Konsistenz der Samples für diesen Klon entscheidend, sondern auch Sprache und Tonalität der Stimme.

Wenn eine Stimme fröhlich und heiter klingen soll, sollten Sie eine Stimme verwenden, die mit fröhlichen und heiteren Samples geklont wurde. Wenn Sie hingegen eine nachdenkliche und grüblerische Stimme wünschen, wählen Sie eine Stimme mit diesen Eigenschaften.

Es ist jedoch ebenso wichtig, eine Stimme zu verwenden, die in der richtigen Sprache trainiert wurde. Alle standardmäßig verfügbaren professionellen Stimmklone sind beispielsweise englische Stimmen und wurden mit englischen Samples trainiert. Wenn Sie sie andere Sprachen sprechen lassen, kann ihre Leistung in diesen Sprachen unvorhersehbar sein. Verwenden Sie daher eine Stimme, die aus Samples geklont wurde, in denen die Person die Sprache spricht, die die KI anschließend sprechen soll.

Das mag nebensächlich wirken, kann aber einen großen Unterschied machen. Die KI versucht anhand des Textkontexts zu verstehen, wie etwas gelesen werden soll. Dazu gehören nicht nur die verwendeten Wörter, sondern auch ihre Anordnung, Zeichensetzung, Grammatik und die allgemeine Textformatierung.

Das kann die Sprechweise der KI geringfügig, aber deutlich beeinflussen. Wenn Sie ein Wort falsch schreiben, korrigiert die KI es nicht, sondern versucht, es wie geschrieben zu lesen.

Die Einstellungen der KI sind nicht deterministisch. Das bedeutet, dass Sie selbst bei denselben Ausgangsbedingungen – Stimme, Einstellungen und Modell – leicht unterschiedliche Ausgaben erhalten, ähnlich wie ein Sprecher jedes Mal eine etwas andere Performance liefert.

Diese Variabilität kann verschiedene Ursachen haben, darunter die zuvor genannten Optionen: Stimme, Einstellungen und Modell. In der Regel lässt sich ihr Umfang über den Stabilitätsregler steuern. Eine niedrigere Stabilität bedeutet eine größere Variabilität zwischen den Generierungen, ermöglicht der KI aber auch eine ausdrucksstärkere Performance.

Eine größere Variabilität ist oft wünschenswert, da eine zu hohe Stabilität bestimmte Stimmen monoton klingen lassen kann. Dann hat die KI weniger Spielraum, variablere Inhalte zu erzeugen. Eine zu niedrige Stabilität kann jedoch ebenfalls Probleme verursachen und die Generierungen instabil machen – insbesondere bei bestimmten Stimmen, für deren Klonprozess weniger optimale Audiodaten verwendet wurden.

Die Standardeinstellung von 50 ist für die meisten Anwendungen ein guter Ausgangspunkt.

Eleven v3 ist unser neuestes und ausdrucksstärkstes Text to Speech-Modell und bietet:

  • Menschlichere Generierungen mit insgesamt höherer Qualität
  • Unterstützung für Audiotags
    • Emotionen: [sad] [angry] [happily]
    • Anweisungen zur Sprechweise: [whispers] [shouts]
    • nonverbale Reaktionen: [laughs] [clears throat] [sighs]
  • Dialogmodus für natürlich klingendes Audio mit mehreren Sprechern
  • Unterstützung für über 70 Sprachen

Es kann beeindruckende Ergebnisse erzeugen, doch seine stärker schwankende Konsistenz und höhere Latenz machen es ungeeignet für Echtzeit- oder Gesprächsanwendungsfälle. Dafür empfehlen wir Flash v2 (Englisch) oder v2.5 (mehrsprachig). Wir arbeiten an einer Echtzeitversion von Eleven v3.

Sie können mit v3 über die API generieren, indem Sie unsere Endpunkte Create speech und Stream speech nutzen und die Modell-ID eleven_v3 angeben.

Sie können auch unsere Endpunkte Create dialogue und Stream dialogue verwenden, um einen natürlich klingenden Dialog mit mehreren Sprechern zu erstellen.

Weitere Informationen finden Sie in folgenden Ressourcen:

Die Steuerung der Sprechgeschwindigkeit ist für Text to Speech über Speech Synthesis, Studio, ElevenAgents und unsere API verfügbar.

Mit der Einstellung „Geschwindigkeit“ können Sie die Sprechgeschwindigkeit steuern.

Mögliche Werte reichen von 0.7 bis 1.2. Werte unter 1 verlangsamen die Sprache, Werte über 1 beschleunigen sie. Extreme Werte können die Qualität der generierten Sprache beeinträchtigen. 

Diese Einstellung ist für alle Stimmen und Modelle verfügbar. Sie finden sie in den Stimmeinstellungen.

Informationen zur Steuerung der Sprache über die API finden Sie in unserer API-Referenz.

Jede Stimme kann jede der unterstützten Sprachen sprechen.

Beim aktuellen Modell wählen Sie keine bestimmte Sprache aus. Stattdessen schreiben Sie in der Sprache, die die KI sprechen soll, und die KI erkennt sie automatisch. Da sich verschiedene Sprachen bei ähnlichen Wörtern und Vokabular überschneiden können, deren Aussprache und Akzente aber sehr unterschiedlich sind, sollten Sie eine geklonte Stimme verwenden, die in der Sprache mit dem richtigen Akzent geklont wurde.

Die Sprache wird durch den Text bestimmt, Akzent und Aussprache durch die Stimme selbst. Für optimale Ergebnisse benötigt das Modell beide Kontexte.

Wir entwickeln neue Technologien, um die Sprachauswahl zu erleichtern. Aufgrund der Funktionsweise der KI befindet sich dies jedoch noch in Entwicklung.

Sie können generierte Dateien auf zwei Arten herunterladen:

Sie können eine generierte Datei direkt nach der Erstellung des Inhalts über die Download-Schaltfläche unten rechts herunterladen.

Zuvor generierte Dateien können Sie über Ihren Verlauf herunterladen. 

Um auf Ihren Verlauf zuzugreifen, melden Sie sich bei Ihrem Konto an, wählen Sie in der Seitenleiste Text to Speech und klicken Sie dann im Bereich auf der rechten Bildschirmseite auf den Tab „Verlauf“. Auf schmalen Bildschirmen können Sie über das Verlaufssymbol über der Schaltfläche Sprache generieren auf Ihren Verlauf zugreifen.

In Ihrem Verlauf können Sie auf das Download-Symbol klicken und die Datei als MP3 (128 kbps) oder WAV herunterladen. 

Sie können auch auf Erweitert klicken, um zusätzliche Dateiformate herunterzuladen:

  • MP3 (192 kbps)
  • MP3 (256 kbps)
  • M4A
  • FLAC

Ja. Mit Eleven v3 können Sie Audiotags wie [sighs] oder [exhales] verwenden, um generierter Sprache Atemgeräusche und ähnliche Reaktionen hinzuzufügen.

Weitere Details zu Audiotags und der Steuerung der Sprechweise finden Sie im Eleven-v3-Prompting-Leitfaden.

Unsere Flash- und Turbo-Modelle wurden speziell für Anwendungen mit niedriger Latenz entwickelt.

Flash v2 und Flash v2.5 sind unsere Modelle mit extrem niedriger Latenz und erzeugen Audio in weniger als 75 ms. Flash v2 unterstützt nur Englisch, während Flash v2.5 32 Sprachen unterstützt. Eine vollständige Liste aller unterstützten Sprachen finden Sie hier.

Unsere Turbo-Modelle bieten ebenfalls niedrige Latenz. Da die Flash-Modelle jedoch sehr ähnliche Ergebnisse liefern, empfehlen wir Flash statt Turbo. Turbo v2 unterstützt nur Englisch, während Turbo v2.5 32 Sprachen unterstützt und mit einer Audiogenerierung in etwa 300 ms 25 % schneller ist als Turbo v2.

Flash und Turbo sind hochoptimierte Modelle, die speziell auf Anwendungen mit niedriger Latenz zugeschnitten sind. Dabei behalten sie die Stimmqualität bei, die Nutzer von unseren Modellen erwarten.

Beide Modelle sind bei der Generierung über die API günstiger. Details finden Sie in unseren API-Preisen.

Wir bieten außerdem ElevenAgents, unsere Plattform für die Bereitstellung angepasster, interaktiver Sprachagenten. Weitere Informationen finden Sie in unserer ElevenAgents-Dokumentation.

Es gibt mehrere Möglichkeiten, Pausen einzufügen und Rhythmus sowie Sprechtempo zu beeinflussen. Welche Methode Sie verwenden, hängt vom Modell ab.

Audiotags (nur Eleven v3)

Verwenden Sie mit Eleven v3 Audiotags und Satzzeichen, um Tempo und Sprechweise zu steuern. Eleven v3 unterstützt keine SSML-Break-Tags.

Hinweise zum Prompting von Pausen und Sprechweise mit v3 finden Sie im Eleven-v3-Prompting-Leitfaden.

Break-Tags (Multilingual v2, Flash v2 und Flash v2.5)

Die zuverlässigste Methode, mit Multilingual v2, Flash v2 und Flash v2.5 eine Pause hinzuzufügen, ist die SSML-Break-Tag-Syntax <break time="1.5s" />. Sie erzeugt eine genaue und natürliche Sprechpause. Dabei wird nicht einfach Stille zwischen Wörtern eingefügt – das Modell versteht die Syntax und fügt eine natürliche Pause ein.

Wie das Modell diese Pausen verarbeitet, kann variieren. Die verwendete Stimme spielt dabei eine entscheidende Rolle. Manche Stimmen, die mit einigen „Ähms“ und „Ähs“ trainiert wurden, fügen solche stimmlichen Eigenheiten während Pausen ein, wie es auch ein echter Sprecher tun könnte.

Ein Beispiel könnte so aussehen:

„Geben Sie mir eine Sekunde, um darüber nachzudenken.“ <break time="1.0s" /> „Ja, das würde funktionieren.“

Die Pausenlänge sollte in Sekunden angegeben werden. Die KI kann Pausen von bis zu 3 Sekunden verarbeiten und sie können in Text to Speech sowie über die API verwendet werden.

Wenn Sie eine übermäßige Anzahl von SSML-Pausen in Ihrem Text verwenden, kann dies zu Problemen führen. Die Sprache kann schneller werden oder das Audio kann mehr Rauschen und andere Artefakte enthalten. Wir arbeiten an einer Lösung.

Satzzeichen

Diese Optionen sind weniger zuverlässig als Break-Tags oder Audiotags, können das Tempo aber dennoch beeinflussen.

Ein einfacher Bindestrich - oder der Gedankenstrich — funktioniert oft gut. Für eine längere Pause können Sie mehrere Bindestriche wie -- -- einfügen.

„Es - wird - spät.“

Auslassungspunkte ... können manchmal eine Pause zwischen Wörtern einfügen, verleihen der Stimme aber meist auch etwas Zögern oder Nervosität, was nicht immer passt.

„Ich … ja, ich denke schon …“

Eleven v3 unterstützt das Internationale Phonetische Alphabet (IPA) nativ. Weitere Informationen finden Sie unter IPA mit Eleven v3.

SSML-Phonem-Tags (nur Flash v2 und Turbo v2)

Mit Flash v2 und Turbo v2 können Sie eine bestimmte Aussprache mit SSML-Phonem-Tags erzwingen. Wir unterstützen sowohl IPA als auch CMU. CMU ist bei der aktuellen Implementierung tendenziell etwas vorhersehbarer und konsistenter. Weitere Informationen finden Sie in unserem Ausspracheleitfaden.

Alternative Schreibweisen

Alternativ können Sie eine andere Schreibweise wählen und ein Wort phonetischer schreiben. Sie können verschiedene Tricks einsetzen, etwa Großbuchstaben, Bindestriche, Apostrophe oder sogar einfache Anführungszeichen um einzelne Buchstaben oder Buchstabengruppen.

Beispielsweise könnte ein Wort wie „trapezii“ als „trapezIi“ geschrieben werden, um das „ii“ stärker zu betonen.

Eleven v3 unterstützt Audiotags und ermöglicht eine präzise Steuerung Ihres generierten Audios:

  • Emotionen: [curious] [crying] [mischievously]
  • Anweisungen zur Sprechweise: [whispers] [shouts]
  • Menschliche Reaktionen: [laughs] [clears throat] [sighs]

Detailliertere Informationen finden Sie in unserem Leitfaden zum Prompting mit Eleven v3.

Sie können mit v3 über die API generieren, indem Sie bei unseren Endpunkten Create speech und Stream speech die Modell-ID eleven_v3 angeben.

Mit unseren Endpunkten Create dialogue und Stream dialogue können Sie außerdem natürlich klingende Dialoge mit mehreren Sprechern erstellen.

Weitere Informationen finden Sie in folgenden Ressourcen:

Dateien, die Sie mit Text to Speech oder Stimmenverzerrer generiert haben, können Sie als MP3-, WAV-, M4A- oder FLAC-Dateien herunterladen. WAV-, M4A- und FLAC-Dateien müssen Sie über Ihren Verlauf herunterladen.   

WAV-Dateien herunterladen

Wählen Sie in der Seitenleiste entweder Text to Speech oder Stimmenverzerrer und klicken Sie dann im Bereich auf der rechten Bildschirmseite auf den Tab „Verlauf“. Auf schmalen Bildschirmen können Sie über das Verlaufssymbol über der Schaltfläche Sprache generieren auf Ihren Verlauf zugreifen.

In Ihrem Verlauf können Sie auf das Download-Symbol klicken und die Datei als MP3 oder WAV herunterladen.

FLAC- oder M4A-Dateien herunterladen

Wählen Sie in der Seitenleiste entweder Text to Speech oder Stimmenverzerrer und klicken Sie dann im Bereich auf der rechten Bildschirmseite auf den Tab „Verlauf“. Auf schmalen Bildschirmen können Sie über das Verlaufssymbol über der Schaltfläche Sprache generieren auf Ihren Verlauf zugreifen.

In Ihrem Verlauf können Sie auf das Download-Symbol klicken und die Datei als MP3 oder WAV herunterladen. Um auf weitere Dateiformate einschließlich FLAC und M4A zuzugreifen, klicken Sie auf Erweitert und wählen Sie das gewünschte Format.

Sprache bei der Generierung über die Website

Wenn Sie Audio auf der ElevenLabs-Website generieren, erkennt unsere KI die Sprache anhand des Kontexts Ihres Prompt-Texts automatisch. Verwenden Sie daher möglichst nicht mehrere Sprachen in einem einzelnen Prompt, da dies zu Unklarheit darüber führen kann, welche Sprache verwendet werden soll. Derzeit können Sie bei der Generierung über die Website keine Sprache festlegen. 

Sprache bei der Generierung über die API

Wenn Sie Audio über die API generieren, können Sie die Sprache Ihres Prompts mit dem Parameter language_code manuell festlegen. Dieser optionale Parameter akzeptiert ISO-639-1-Sprachcodes. 

Das kann bei kurzen oder mehrdeutigen Prompts hilfreich sein, etwa wenn der Text nur Zahlen enthält. Durch die Angabe der Sprache wendet der Normalisierer die richtigen Regeln für diese Sprache an.

Weitere Informationen zur Normalisierung finden Sie in diesem Artikel. 

Akzent

Der für Ihre Generierung verwendete Akzent stammt von der verwendeten Stimme. Wenn Sie eine Stimme nutzen, die nicht in der Sprache trainiert wurde, die Sie generieren, hören Sie möglicherweise einen leichten Akzent aus der ursprünglichen Sprache der Stimme.

Für die besten Ergebnisse empfehlen wir eine Stimme, die mit Audio in der Sprache und dem gewünschten Akzent trainiert wurde, die Sie generieren. So kann die KI Aussprache und Intonation genauer verstehen.

Das ist besonders wichtig bei ähnlichen Sprachen oder Sprachen mit vielen gemeinsamen Wörtern. Mit einer Stimme, die in der richtigen Sprache trainiert wurde, stellt die KI die korrekte Aussprache und den passenden Akzent sicher.

Sie können:

  • Eine geklonte Stimme erstellen, indem Sie Audio in Ihrer bevorzugten Sprache und mit Ihrem bevorzugten Akzent verwenden.
  • Die Stimmbibliothek durchsuchen und die Suchfilter verwenden, um passende Stimmen zu finden, die Ihren Anforderungen entsprechen.

Die Generierung mit Eleven v3 kostet auf der Website 1 Credit pro Zeichen. API-Generierungen sind günstiger – Details finden Sie unter API-Preise. 

Weitere Informationen finden Sie in folgenden Ressourcen:

Mit Eleven v3 können Sie Audiotags wie [laughs] verwenden, um Lachen und andere Reaktionen zur generierten Sprache hinzuzufügen. Weitere Details finden Sie im Leitfaden für Prompts mit Eleven v3.

Bei anderen Modellen hängt die emotionale Ausdrucksweise von Kontext, Zeichensetzung und Stimmeinstellungen ab. Siehe Wie erzeuge ich Emotionen?.

Das Modell berücksichtigt den weiteren Kontext jeder Äußerung. Es bewertet, ob etwas Sinn ergibt, indem es die Verbindung zum vorhergehenden und folgenden Text betrachtet. Diese umfassendere Perspektive ermöglicht es ihm, längere Textabschnitte korrekt zu intonieren, indem es einen Gedankengang über mehrere Sätze mit einem einheitlichen emotionalen Muster überlagert.

Tipps zum Erzeugen von Emotionen:

  • Der Kontext ist entscheidend, um bestimmte Emotionen zu erzeugen. Wenn Sie lachenden oder lustigen Text eingeben, erhalten Sie möglicherweise eine fröhliche Ausgabe. Das Gleiche gilt für Wut, Traurigkeit und andere Emotionen – der Kontext ist entscheidend.
  • Zeichensetzung und Stimmeinstellungen bestimmen maßgeblich, wie die Ausgabe gesprochen wird.
  • Setzen Sie relevante Wörter oder Formulierungen in Anführungszeichen, um sie zu betonen.
  • Bei Sprache, die mit einer geklonten Stimme generiert wird, wird der Sprechstil der für das Klonen hochgeladenen Beispiele in der Ausgabe nachgebildet. Ist die Sprache im hochgeladenen Beispiel monoton, wird es für das Modell schwierig, eine ausdrucksstarke Ausgabe zu erzeugen.

Mit Eleven v3 können Sie auch Audiotags verwenden, um Emotion und Sprechweise direkter zu steuern, zum Beispiel [happy], [sad], [angry], [whispers] und [laughs]. Weitere Details finden Sie im Leitfaden für Prompts mit Eleven v3.

Diese Tipps helfen dabei, die emotionale Ausdrucksweise zu steuern, garantieren aber kein bestimmtes Ergebnis.

Derzeit bieten wir leider keine Abrechnung beim Download als Alternative zur Abrechnung bei der Generierung an. Es gibt aktuell keine Möglichkeit, Generierungen vorzuhören, ohne Kontingent zu verbrauchen.

Wenn Sie auf der Website auf „Generate“ klicken, werden Credits abgezogen, da die Server gestartet und das Audio generiert werden muss. Sie können eine Stimme nicht mit Ihrem eigenen Text testen oder vorhören, ohne Credits zu verwenden.

Unter folgenden Umständen erlauben wir auf der Website zwei kostenlose Neugenerierungen in Text to Speech:

  • Prompt (für Text to Speech) bzw. Datei (für Stimmenverzerrer), Stimme und Modell bleiben gleich. Sie können die Regler für die Stimmeinstellungen ändern.
  • Die erste Generierung wurde vor weniger als zwei Stunden erstellt.
  • Sie haben die Seite seit der Generierung des ursprünglichen Audios nicht aktualisiert.

Wenn dies zutrifft, sehen Sie „Regenerate speech“. Wenn Sie mit der Maus über die Schaltfläche „Regenerate speech“ fahren, wird die Anzahl der verbleibenden kostenlosen Neugenerierungen angezeigt:

Sobald Sie Ihre kostenlosen Neugenerierungen aufgebraucht haben, wird auf der Schaltfläche wieder „Generate speech“ angezeigt. Außerdem wird die Anzahl der Credits angezeigt, die für die Generierung verwendet werden:

Kostenlose Neugenerierungen sind nur für Text to Speech über die Website verfügbar. Sie sind nicht über die API verfügbar.

Wir prüfen, ob wir Vorschauen in dieser Qualität ermöglichen können, ohne Preise oder Kosten zu erhöhen. Außerdem suchen wir nach Wegen, die KI besser steuerbar zu machen, damit Sie nicht mehr vorhören müssen und stattdessen idealerweise direkt beim ersten Versuch das gewünschte Ergebnis erhalten.

Eleven v3 bietet einen Dialogmodus, mit dem Sie dynamische Gespräche mit mehreren Sprechern und natürlichem Tempo generieren können. Er berücksichtigt Unterbrechungen, Tonwechsel und emotionale Signale anhand des Gesprächskontexts.

Der Dialogmodus ist verfügbar, wenn Sie über die Website mehrere Sprecher verwenden. 

Wir haben außerdem neue Text-to-Dialogue-API-Endpunkte für die Generierung von Interaktionen mit mehreren Sprechern entwickelt. Weitere Informationen finden Sie in unserer API-Dokumentation:

Weitere Informationen finden Sie in folgenden Ressourcen:

Jede Stimme kann jede Sprache sprechen, die derzeit von der KI unterstützt wird. Wenn Sie jedoch keine Stimme verwenden, die Muttersprachler der Sprache ist, die die KI sprechen soll – etwa eine generierte Stimme oder eine Stimme, die beim Englischsprechen geklont wurde –, kann die KI einen leichten englischen Akzent haben oder zwischen ähnlichen Sprachen wechseln.

Eine vollständige Liste aller unterstützten Sprachen finden Sie in diesem Artikel: Welche Sprachen unterstützen Sie?

Beim aktuellen Modell wählen Sie keine bestimmte Sprache aus. Stattdessen schreiben Sie in der Sprache, die die KI sprechen soll, und die KI versteht dies automatisch. Da es jedoch Überschneidungen zwischen verschiedenen Sprachen geben kann, die ähnliche Wörter und Vokabeln, aber deutlich unterschiedliche Aussprachen und Akzente haben, sollten Sie eine geklonte Stimme verwenden, die beim Sprechen der Sprache mit dem richtigen Akzent geklont wurde. So erhält die KI den meisten Kontext dazu, wie und in welcher Sprache etwas gesprochen werden soll.

Die Sprache wird durch den Text bestimmt, während Akzent und Aussprache von der Stimme selbst bestimmt werden.

Wir arbeiten an neuen Technologien zur Auswahl der Sprache. Aufgrund der Funktionsweise der KI befindet sich dies jedoch noch in Entwicklung.

In Text to Speech können Sie über die Website mit jedem kostenpflichtigen Tarif bis zu 5.000 Zeichen und mit allen kostenlosen Tarifen bis zu 2.500 Zeichen in einer einzelnen Generierung erstellen.

Wenn Sie jedoch längere Inhalte mit mehr als einigen Tausend Zeichen erstellen möchten, empfehlen wir dringend Studio. Damit können Sie sehr lange Inhalte wie Bücher und Romane einfach erstellen. Weitere Informationen finden Sie hier.

Wenn Sie über die API generieren, hängt die maximale Eingabelänge vom verwendeten Modell ab:

Text to Speech

Flash v2.5 – bis zu 40.000 Zeichen (~40 Minuten Audio)

Turbo v2.5 – bis zu 40.000 Zeichen (~40 Minuten Audio)

Flash v2 – bis zu 30.000 Zeichen (~30 Minuten Audio)

Turbo v2 – bis zu 30.000 Zeichen (~30 Minuten Audio)

Multilingual v2 – bis zu 10.000 Zeichen (~10 Minuten Audio)

Stimmenverzerrer

Multilingual v2 – bis zu 10 Minuten Audio

Alle vorgefertigten und generierten Stimmen sind englischsprachig. Das bedeutet, dass sie beim Sprechen anderer Sprachen möglicherweise nicht den richtigen Akzent oder die richtige Aussprache haben.

In der Stimmbibliothek finden Sie unter der Kategorie „Professional“ Stimmen, die die Community mit uns geteilt hat. Dabei handelt es sich um eigene Professional Voice Clones ihrer Stimmen. Diese Stimmen haben in der Regel ein Sprach-Tag, das angibt, in welcher Sprache sie geklont wurden. Dadurch sind sie in dieser Sprache muttersprachlich. Sie können auch den Sprachsuchfilter verwenden, um nach bestimmten Sprachen zu filtern.

Zahlen, Daten, Symbole und Akronyme können für die KI schwierig sein, da sie oft auf mehrere korrekte Arten gesprochen werden können. Dies kann auch von der verwendeten Sprache abhängen. Beispielsweise kann „11“ als „Eleven“ gelesen werden, auf Spanisch aber auch „Once“ oder auf Deutsch „Elf“.

Es gibt mehrere Möglichkeiten, die korrekte Aussprache von Zahlen, Daten, Akronymen und Symbolen sicherzustellen.

Vollständig ausschreiben

Für die besten Ergebnisse empfehlen wir, Zahlen, Akronyme, Daten und Symbole vollständig in Worten auszuschreiben – so, wie die KI sie aussprechen soll. Dadurch erhält die KI den meisten Kontext und kann die richtige Ausgabe erzeugen. Bei „$100“ empfehlen wir beispielsweise, entweder „hundert Dollar“ oder „einhundert Dollar“ zu schreiben, damit Sie das gewünschte Ergebnis erhalten.

Verwendung eines LLM

Wenn Sie ein Large Language Model verwenden, um Ihre Texteingaben zu erstellen, etwa bei der Nutzung von ElevenAgents, können Sie das Modell anweisen, Zahlen, Daten, Symbole und Akronyme stets so in Worten auszuschreiben, wie die KI sie aussprechen soll.

Normalisierung

Wenn Sie über die API generieren, können Sie mit dem Parameter apply_text_normalization festlegen, ob eine Textnormalisierung angewendet werden soll. Die Textnormalisierung schreibt Zahlen und Daten aus, um die Aussprache zu verbessern. Diese Option erhöht die Latenz, da der Normalisierungsprozess zusätzliche Verarbeitungszeit benötigt.

Der Parameter apply_text_normalization hat drei Modi:

  • on: wird immer angewendet
  • off: wird nie angewendet
  • auto: Die KI entscheidet automatisch, wann die Textnormalisierung angewendet wird

Mit dem Parameter language_code können Sie auch die Sprache Ihrer Eingabe festlegen. Dies ist ein optionaler Parameter, der ISO-639-1-Sprachcodes akzeptiert. 

Das kann bei kurzen oder mehrdeutigen Eingaben nützlich sein, etwa wenn der Text nur Zahlen oder Symbole enthält. Durch die Angabe der Sprache wendet die Normalisierung die richtigen Regeln für diese Sprache an.

Weitere Informationen finden Sie in unserer API-Referenz.

Bei der Generierung mit Text to Speech über die Website ist die Normalisierung standardmäßig aktiviert.

In Studio wird die Normalisierung standardmäßig automatisch angewendet. Das bedeutet, dass die KI entscheidet, wann eine Textnormalisierung erforderlich ist. Sie können die Normalisierung auch dauerhaft aktivieren. Diese Option finden Sie unter Projekteinstellungen im Tab Erweitert.

Falsche Aussprachen können verschiedene Ursachen haben. Am häufigsten ist das Wort einfach falsch geschrieben. Die KI korrigiert keine falsch geschriebenen Wörter, sondern versucht, sie genau so zu lesen, wie sie geschrieben sind. Prüfen Sie den Text daher noch einmal und stellen Sie sicher, dass er korrigiert und fertig ist, bevor die KI ihn vorliest.

Wenn Sie eine bestimmte Aussprache erzwingen möchten, können Sie mit unserem Modell Flash v2 SSML-Phonem-Tags verwenden. Weitere Informationen finden Sie in unserem Ausspracheleitfaden.

Manchmal spricht die KI Wörter möglicherweise falsch aus oder verwendet einen unerwarteten Akzent. Das kann verschiedene Ursachen haben und hängt in den meisten Fällen stark von Stimme und Sprache ab. Die beste Methode, den richtigen Akzent und die richtige Aussprache sicherzustellen, ist das Klonen einer Stimme mit dem gewünschten Akzent und der gewünschten Aussprache. Dadurch erhält die KI bei der Audiogenerierung den meisten Kontext.

Die Sprache wird durch den Text festgelegt, der Akzent durch die Stimme. Wenn Sie also in einer Sprache schreiben, die viele Wörter mit einer anderen Sprache gemeinsam hat oder eng mit ihr verwandt ist, kann es für die KI schwierig sein, bestimmte Wörter richtig auszusprechen oder zwischen Akzenten zu wechseln.

Unter bestimmten Umständen kann die KI jedoch auch korrekt geschriebene Wörter falsch aussprechen, selbst auf Englisch. Dies scheint stark von der verwendeten Stimme und dem verwendeten Text abzuhängen, sollte aber selten vorkommen.

No results