Zum Inhalt springen

7 Tipps zur Erstellung eines professionellen Voice Clones in ElevenLabs

Verfasst von
Ryan Morrison
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

KI-Stimme klonen hat sich von einer Science-Fiction-Kuriosität zu einem festen Bestandteil der Produktion entwickelt. Ob Sie ein Spiel lokalisieren, eine Markenstimme entwickeln oder Hörbücher im großen Maßstab produzieren: Eine hochwertige KI-Stimme kann Arbeitsabläufe vereinfachen und Ihren kreativen Spielraum erweitern.

ElevenLabs Text to Speech ermöglicht Ergebnisse in Studioqualität – ganz ohne Machine-Learning-Kenntnisse. Doch selbst das beste Modell braucht sorgfältig aufbereitete Eingaben. 

1. Beginnen Sie mit makellosen Aufnahmen

Bei generativem Audio gilt „garbage in, garbage out“ doppelt. Schlechte Trainingsdaten begrenzen die Audioqualität, und fehlerhafte Prompts führen selbst bei gut trainierten Modellen zu unbefriedigenden Ergebnissen. 

Hochwertige Trainingsdaten und präzise Prompts sind für gute generative Audioausgaben entscheidend. Fehlerhafte Eingaben in einer der beiden Phasen beeinträchtigen das Endergebnis erheblich.

Requirement Why it matters
Quiet, treated room (no HVAC, pets, traffic) Model learns background noise as part of the voice
Cardioid condenser or broadcast dynamic mic Off-axis rejection and low self-noise
44.1 kHz, 16-bit but as long as it isn't overly compressed MP3 will work fine. Matches ingestion spec and preserves fidelity
Pop filter / windscreen Reduces plosives and low-end rumble
Flat EQ, no compression Preserves natural dynamics

Nehmen Sie immer zuerst kurz die Raumstille auf. Wenn Ihre DAW sichtbares Rauschen zeigt, beheben Sie es, bevor Sie auch nur eine Zeile einsprechen.

2. Nehmen Sie ausdrucksstarke, abwechslungsreiche Sprache auf

Original
Voice clone
Lily
Lily
Original
Lily
Lily
Klon
Chris
Chris
Original
Chris
Chris
Klon
Laura
Laura
Original
Laura
Laura
Klon
Erstellen Sie eine Klon Ihrer Stimme, die genau wie Sie klingt.

ElevenLabs kann die feinen Details menschlicher Sprache nachbilden, darunter Emotionen, Tempo und Prosodie. Die Qualität dieser Wiedergabe hängt jedoch direkt davon ab, ob diese Elemente in den Audiodaten für das Training des Modells vorhanden und vielfältig sind. 

Mit anderen Worten: Die KI kann nur das effektiv nachbilden, was ihr im Training gezeigt wurde. Fehlen dem Datensatz ausdrucksstarke Variationen oder enthält er flache, monotone Sprache, wird die geklonte Stimme diese Eigenschaften wahrscheinlich ebenfalls widerspiegeln.

Berücksichtigen Sie:

  • Neutrale Erzählung
  • Dialoge mit wechselnder Energie
  • Lächeln, Flüstern und Betonungen

Fügen Sie zwischen Absätzen kurze Pausen von 1–1,5 Sekunden ein, zwischen Sätzen kürzere. So lernt das Modell ein natürliches Pausenverhalten. Vermeiden Sie Vocal Fry oder Räuspern, es sei denn, Sie möchten diese nachbilden.

Nehmen Sie für Charaktere mehrere „Stimmungsdurchgänge“ auf, etwa ruhig, aufgeregt oder verzweifelt.

3. Bereinigen Sie Ihren Datensatz

Nach der Aufnahme:

  • Entfernen Sie wiederholte Takes, Stottern, Füllwörter und störende Atemgeräusche
  • Normalisieren Sie auf –3 dBFS, vermeiden Sie jedoch Kompression

Das Ziel: ein Datensatz, der bereits veröffentlichungsreif klingt. Diese Qualität überträgt sich auf jede Ausgabe.

4. Sorgen Sie für konstante Bedingungen

Für meine erste Professional Voice Clone habe ich mehrere Audiodateien verwendet, die an unterschiedlichen Orten aufgenommen wurden, weil ich dachte: Stimme ist Stimme. Für die finale Version habe ich alles in meinem Homeoffice mit demselben Skript aufgenommen. Perfekt war sie noch nicht, aber deutlich besser als die Instant Voice Clone.

Ryan Morrison Professional Voice Clone (PVC)
00:00
00:00
Ryan Morrison Instant Voice Clone (IVC)
00:00
00:00

Ein Wechsel der Mikrofonkette während der Aufnahme verwirrt das Modell.

Bei Projekten mit mehreren Sessions:

  • Halten Sie Mikrofonposition und Gain konstant
  • Nehmen Sie innerhalb desselben Zeitfensters von 24–48 Stunden auf, um Stimmveränderungen zu vermeiden
  • Bei alten und neuen Aufnahmen trainieren Sie separate Stimmen und mischen sie mit Voice Mixing – statt einen einzelnen Klon zu verwässern

5. Nutzen Sie die richtige Datenmenge

Für das gewünschte Gleichgewicht aus Geschwindigkeit und Qualität Ihrer geklonten Stimme brauchen Sie eine passende Menge an Trainingsdaten. Die folgende Tabelle enthält Richtwerte für die Datenlänge je nach Einsatzzweck.

Use Case Minimum Sweet Spot Why
Quick demo / scratch track 2–3 min 5 min Fast iteration
YouTube / explainer videos 5 min 10–15 min Smooth cadence, good style range
Audiobooks / podcast host 10 min 20–30 min Natural inflection over hours
Multilingual brand or character 15 min 30–45 min per language Cross-language continuity

Mehr als etwa 60 Minuten bringen zunehmend weniger Nutzen. Bei differenzierten Anforderungen erstellen Sie Unterklone, die auf Akzent, Emotion oder Alter abgestimmt sind.

6. Passen Sie die ElevenLabs-Einstellungen an

Für das beste Gleichgewicht aus Geschwindigkeit und Qualität Ihrer geklonten Stimme ist die richtige Menge an Trainingsdaten wichtig. Die folgende Tabelle zeigt empfohlene Datenlängen, abhängig davon, wie Sie die Stimme einsetzen möchten.

Setting Effect Typical Range
Stability Lower = more variation; higher = consistent delivery 0.4–0.7 for narration; 0.2–0.4 for dialog
Similarity Boost Controls how strictly timbre matches training audio ≥ 0.75 for branded voices

Profi-Tipp: Speichern Sie nach der Abstimmung ein „Gold Preset“. Wenden Sie es gesammelt auf Kapitelaufnahmen oder Werbespots an.

7. Testen Sie unter realen Bedingungen

In the ancient land of Eldoria, where skies shimmered and forests, whispered secrets to the wind, lived a dragon named Zephyros. [sarcastically] Not the “burn it all down” kind... [giggles] but he was gentle, wise, with eyes like old stars. [whispers] Even the birds fell silent when he passed.
294/1000

Erzähltest: Generieren Sie Audio mit allen verfügbaren 5.000 Zeichen, um zu prüfen, ob die Audioqualität nachlässt.

Mehrsprachigkeitstest: Testen Sie bei zweisprachigen Stimmen gemischtsprachige Zeilen. Bewerten Sie, wie flüssig der Sprachwechsel gelingt.

Führen Sie ein Feedback-Protokoll – kleine Anpassungen am Datensatz wirken oft besser als große Änderungen der Einstellungen.

Verwaltung Ihrer Bibliothek geklonter Stimmen

Benennung: Verwenden Sie [Projekt]_[Sprecher]_[Emotion]_[v1]. Beispiel: RPG_TavernKeeper_Jovial_v1

Versionskontrolle: Klonen Sie die Stimme vor größeren Änderungen, um Änderungen per A/B-Vergleich zu prüfen.

Metadaten: Dokumentieren Sie Mikrofonmodell, Raum-Setup, Datum und Rechteinhaber – unerlässlich für Compliance.

Archivierung: Sichern Sie rohe WAV-Dateien und Trainingspakete, etwa auf S3 oder LTO, falls Sie künftig mit neuen Engine-Versionen neu trainieren müssen.

Fazit und nächste Schritte

Eine überzeugende geklonte Stimme erfordert zu gleichen Teilen Technik und Regie: saubere Eingaben, durchdachtes Design und präzise Abstimmung.

Bereit, Ihre eigene Stimme zu hören?

  1. Bei ElevenLabs Studio anmelden (kostenloser Tarif verfügbar)
  2. Sie benötigen eine beträchtliche Menge an Audiodaten. Eine Stunde oder mehr ist ideal. Laden Sie 5–6 Segmente mit jeweils 10 Minuten hochwertigem Audiomaterial hoch.
  3. Erste Ausgaben in Sekunden generieren
  4. Mit den Einstellungen für Stabilität und Stil verfeinern

Sie benötigen mehr Kontrolle? Führen Sie ein Upgrade für Voice Mixing, mehrsprachiges Klonen und längere Inhaltsgenerierung durch. Optimieren Sie weiter. Die Stimme, die Sie sich vorstellen, ist in Reichweite.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio