Pausen in KI-Voiceovers mit Eleven v4 hinzufügen
- Verfasst von
- Jack Limebear
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Bei einem KI-Text-to-Speech-Modell entscheidet die Darbietung über alles. Die Qualität einer Stimme und das Verständnis von Prosodie sind wichtig, doch ohne Timing zerfällt ein Satz. Ein zusätzlicher Moment nach einer Zeile oder längere Stille kann entscheidend für ein hochwertiges Ergebnis sein.
Allgemeine Text-to-Speech-Tools überlassen Pausen dem Zufall. Eine Generierung trifft vielleicht genau das, was Sie suchen, doch bei der nächsten Regenerierung ist es wieder weg. Eleven v4 bietet verbesserte Workflows zur Regenerierung und macht das zur Vergangenheit. Optimieren Sie einzelne Zeilen oder Phrasen in Ihrem Skript ganz einfach.
Damit Sie von Anfang an das bestmögliche Skript erstellen, bietet Eleven v4 drei Möglichkeiten, Pausen direkt in Ihren Text für KI-Voiceovers einzubauen. Hier erfahren Sie, was sie jeweils bewirken und wann Sie sie einsetzen sollten.
Eleven v4 in Aktion
Eleven v4 entdeckenZusammenfassung
- SSML-Tags funktionieren nicht in Eleven v4. Das System verwendet Audio Tags, bei denen Sie Regieanweisungen wie [long pause] oder [whispers] direkt in Ihr Skript schreiben.
- Durch veränderte Satzzeichen können Sie mit dem Rhythmus eines Satzes spielen. Gedankenstriche, Auslassungspunkte und kurze Sätze prägen, wie Ihr TTS-Output klingt.
- Setzen Sie wirkungsvolle Pausen dort, wo ein Mensch beim Sprechen natürlich innehalten würde.
- Verwenden Sie bei längeren Audioinhalten durchgehend dieselben Pausenkonventionen, damit Ihr Output konsistent bleibt.
Was hat sich gegenüber früheren Modellen geändert?
Frühere ElevenLabs-Modelle wie Multilingual v2 unterstützten SSML-Syntax. Mit einer Struktur wie <break time=”2.0s” /> konnten Sie innerhalb eines Satzes eine Pause von zwei Sekunden einfügen. Eleven v4 führt den mit Eleven v3 eingeführten Ansatz fort und ersetzt SSML-Tags durch die deutlich intuitivere Alternative Audio Tags.
Für Autorinnen und Autoren macht der Ersatz das Erstellen von Pausen in KI-Voiceovers deutlich einfacher. Statt wissen zu müssen, welches SSML-Tag Sie genau verwenden müssen, schreiben Sie einfach in natürlicher Sprache – [pause] und [long pause] erledigen den Rest. Diese Tags werden zu Anweisungen für das Modell. Es reagiert darauf und nutzt den Kontext der Szene, um eine nuancierte finale Darbietung zu erzeugen. Die genaue Länge der Pause passt zum Moment, statt eine vordefinierte, mechanische Stille zu sein.
Auch wenn dies nicht der Schwerpunkt dieses Artikels ist, können Sie Audio Tags auch verwenden, um emotionales Text to Speech zu erstellen, indem Sie die Emotionen innerhalb eines Absatzes variieren.

Die drei Pausensteuerungen in Eleven v4
Eleven v4 bietet Ihnen drei Möglichkeiten, Pausen in KI-Voiceovers hinzuzufügen.
Wir zeigen Ihnen im Texteditor, wie diese Methoden in der Praxis funktionieren, und veranschaulichen ihre Wirkung mit Audiobeispielen.
![Eleven v4 pause controls: [pause], [long pause], and punctuation, with context-based timing. Discover how to add pauses in AI voiceover with these tags](/_next/image?url=https%3A%2F%2Feleven-public-cdn.elevenlabs.io%2Fpayloadcms%2Ft0acu8ggm9-three-pause-controls-eleven-v4.webp&w=3840&q=80)
[pause]
Eine Pause ist ein kurzer Moment. Sie entspricht ungefähr einem Atemzug oder dem natürlichen Raum, den sich jemand nimmt, bevor er einen Satz fortsetzt. Der beste Ort für das Audio Tag [pause] ist nach einem einleitenden Satz, zwischen zwei Ideen, die Sie trennen möchten, nach einer Phrase, die zusätzliche Betonung braucht, oder überall dort, wo ein Punkt allein zu gehetzt wirkt.
Im folgenden Beispiel verwenden wir dieselbe Zeile mit und ohne das Audio Tag [pause]. Auch ohne die Audioclips zu hören, sehen Sie: Einer dauert vier, der andere sechs Sekunden. Die zusätzlichen Momente durch [pause] summieren sich in den finalen Clips.
Beispiel mit [pause]
Die obigen Clips wurden mit Flint in Eleven v4 generiert.
[long pause]
Eine lange Pause ist bewusster gesetzt und erzeugt Momente der Stille in Ihren Audioclips. Sie können diese Stille für dramatische Spannung, zwischen Szenen, vor einer Enthüllung oder überall dort einsetzen, wo Sie Stille betonen möchten.
Hier ist ein Beispiel für [long pause] in einer Szene.
Dieser Audioclip wurde von Spuds Oxley mit Eleven v4 vertont.
Satzzeichen
Eleven v4 nutzt Satzzeichen als Anweisung für das Tempo. Auslassungspunkte verlangsamen die Darbietung einer Zeile und ermöglichen Momente des Zögerns. Eine variierte Satzstruktur durchbricht die Monotonie eines längeren Abschnitts. Kurz. Prägnant. Direkt.
Sie können Audio Tags im gesamten Skript verwenden – und sollten es tun, um die Darbietung zu verbessern. Doch allein mit Satzzeichen lässt sich bereits viel erreichen.
Im folgenden Abschnitt sehen Sie, wie Satzzeichen einen Text zum Leben erwecken – selbst ohne Audio Tags.
Dieses Audiobeispiel wurde mit Lauren B in Eleven v4 zum Leben erweckt.
Pausen in längeren Audioinhalten
Längere Audioinhalte gelingen am besten, wenn Sie über die gesamte Länge Ihres Skripts einen konsistenten Ansatz verfolgen. Wenn Sie beispielsweise in den ersten 1.500 Zeichen nur Satzzeichen verwenden und in den letzten 1.000 Zeichen plötzlich Audio Tags wie [long pause] einsetzen, kann der Output seltsam klingen.
Entscheiden Sie vor dem Schreiben Ihres Skripts, welchen Ansatz Sie wählen möchten. Oder sorgen Sie, falls Sie es bereits geschrieben haben, dafür, Audio Tags durchgehend konsistent einzusetzen. Die Schaltfläche „v4 Enhance“ neben „Generate speech“ fügt Ihrem Text automatisch Audio Tags hinzu.

Starten Sie mit Eleven v4 in ElevenCreative
Eleven v4 erweckt Ihre Szenen zum Leben.
Indem Sie das Tempo Ihres Textes steuern und Audio Tags hinzufügen, können Sie aus über 17.500 Stimmen unserer Stimmbibliothek ausdrucksstarke stimmliche Darbietungen erstellen.
Lesen Sie den vollständigen Leitfaden zu emotionalem Text to Speech für weitere Einblicke oder registrieren Sie sich, um noch heute Ihre erste Generierung zu starten.



