KI-Stimme klonen
KI-Stimme klonen
Erfahren Sie, wie Sie Ihre Stimme mit unseren führenden Modellen klonen.
Übersicht
Beim Klonen einer Stimme gibt es zwei Hauptoptionen: Instant Voice Cloning und Professional Voice Cloning. Instant Voice Cloning ist eine schnelle und einfache Möglichkeit, Ihre Stimme zu klonen, während Professional Voice Cloning eine präzisere und anpassbarere Option ist.
Instant Voice Cloning

Mit Instant Voice Cloning können Sie nahezu sofort Stimmklone aus kürzeren Samples erstellen. Beim Erstellen eines Instant Voice Clone (IVC) wird kein individuelles KI-Modell trainiert oder erstellt. Stattdessen nutzt es Vorwissen aus Trainingsdaten, um eine fundierte Einschätzung vorzunehmen, anstatt auf die exakte Stimme trainiert zu werden.
Das funktioniert für viele Stimmen sehr gut. Die größte Einschränkung von IVCs besteht jedoch darin, dass Sie eine sehr einzigartige Stimme oder eine Stimme mit einem Akzent klonen möchten, den die KI während des Trainings möglicherweise nicht umfassend kennengelernt hat. In solchen Fällen ist Professional Voice Cloning möglicherweise die beste Option, um ein individuelles Modell mit explizitem Training zu erstellen.
Professional Voice Cloning

Professional Voice Cloning ist in unserem Creator-Abo oder höher verfügbar. Mit Professional Voice Cloning können Sie durch das Training eines dedizierten Modells auf einem größeren Satz von Sprachdaten ein realistischeres Modell Ihrer Stimme trainieren. So entsteht ein Modell, das praktisch nicht von der Originalstimme zu unterscheiden ist.
Da individuelle Modelle Fine-Tuning und Training erfordern, dauert das Training von PVCs länger als bei IVCs. Fine-Tuning dauert in der Regel 3–6 Stunden, kann aber abhängig von der Anzahl anderer PVCs in der Fine-Tuning-Warteschlange auch etwas länger dauern.
Leitfaden für Einsteiger zur Audioaufnahme
Wenn Sie neu in der Audioaufnahme sind, helfen Ihnen diese Tipps beim Einstieg.
Aufnahmeort
Wählen Sie für Audioaufnahmen einen geeigneten Ort und richten Sie ihn so ein, dass Raumecho und Hall minimiert werden. Der Raum sollte möglichst stark gedämpft werden. Genau dafür ist eine akustisch behandelte Gesangskabine gedacht. Wenn Sie keine Gesangskabine zur Verfügung haben, können Sie Ideen für eine DIY-Gesangskabine, eine „Deckenburg“ oder einen Kleiderschrank ausprobieren.
Hier sind einige YouTube-Beispiele für DIY-Akustikideen:
- Ich habe eine Gesangskabine für 0,00 $ gebaut!
- So nehmen Sie GUTE Vocals in einem SCHLECHTEN Raum auf
- Die 5 BESTEN Tipps für Gesangsaufnahmen zu Hause!
Mikrofon, Popschutz und Audiointerface
Ein gutes Mikrofon ist entscheidend. Mikrofone können zwischen $100 und $10.000 kosten, doch für die meisten Voiceover-Arbeiten reicht ein professionelles XLR-Mikrofon für $150 bis $300 aus.
Für ein erschwingliches, aber hochwertiges Setup für Voiceover-Arbeiten empfiehlt sich ein Focusrite-Interface mit einem Audio-Technica AT2020 oder Rode NT1-Mikrofon. Dieses Setup kostet zwischen $300 und $500 und bietet hochwertige Aufnahmen für den professionellen Einsatz mit geringem Eigenrauschen und klaren Ergebnissen.
Achten Sie beim Aufnehmen darauf, dass sich ein geeigneter Popschutz vor dem Mikrofon befindet. So vermeiden Sie Plosivlaute sowie Atemgeräusche und Luft, die direkt auf Membran beziehungsweise Mikrofon trifft. Das klingt schlecht und verursacht außerdem Probleme beim Klonprozess.
Digitale Audio-Workstation (DAW)
Es gibt viele verschiedene Aufnahmelösungen, die alle dasselbe tun: Audio aufnehmen. Sie sind jedoch nicht alle gleich gut. Solange sie WAV-Dateien mit 44,1 kHz oder 48 kHz und einer Bittiefe von mindestens 24 Bit aufnehmen können, sind sie geeignet. Sie benötigen keine aufwendige Nachbearbeitung, Plugins, Entrauscher oder Ähnliches, denn die Audioaufnahme soll einfach bleiben.
Wenn Sie eine Empfehlung möchten, schlagen wir REAPER vor – eine ausgezeichnete DAW mit hoher Flexibilität. Sie ist für viele Audioarbeiten Branchenstandard. Eine weitere gute kostenlose Option ist Audacity.
Halten Sie optimale Aufnahmepegel ein – nicht zu laut und nicht zu leise –, um digitale Verzerrungen und übermäßiges Rauschen zu vermeiden. Streben Sie für Voiceover-Arbeiten Spitzenwerte von -6 dB bis -3 dB und eine durchschnittliche Lautheit von -18 dB an. So gewährleisten Sie Klarheit und minimieren gleichzeitig den Rauschpegel. Überwachen Sie die Pegel genau und passen Sie sie je nach Projekt und Aufnahmeumgebung für optimale Ergebnisse an.
Positionierung
Eine hilfreiche Richtlinie ist, etwa zwei Fäuste Abstand zum Mikrofon zu halten – ungefähr 20 cm (7–8 Zoll) –, mit einem Popschutz zwischen Ihnen und dem Mikrofon. Manche positionieren den Popschutz ganz nah, sodass sie ihn direkt berühren können. So können sie leichter einen konstanten Abstand zum Mikrofon einhalten.
Eine weitere gängige Technik, um nicht direkt in das Mikrofon zu atmen oder Plosivlaute zu erzeugen, ist das Sprechen im Winkel. Dadurch trifft die ausgeatmete Luft weniger wahrscheinlich direkt auf das Mikrofon, sondern strömt daran vorbei.
Darbietung
Ihre Darbietung ist einer der wichtigsten Aspekte der gesamten Aufnahmesitzung. Die KI versucht, alles an Ihrer Stimme so gut wie möglich zu klonen – und das sehr genau. Das bedeutet, dass sie Ihren Sprachrhythmus, Ihre Klangfarbe, Ihren Darbietungsstil, die Länge Ihrer Pausen sowie Stottern, tiefe Atemzüge, eine hauchige Stimme oder viele „Ähms“ und „Ähs“ nachzubilden versucht – sogar diese kann sie reproduzieren. Daher sollte die Audiodatei genau die Darbietung und Stimme enthalten, die Sie klonen möchten: nicht weniger und nicht mehr. Deshalb ist es auch wichtig, einen Text zu finden, den Sie in der angestrebten Klangfarbe vorlesen können.
Bei Aufnahmen für KI ist Konsistenz sehr wichtig. Wenn Sie eine Stimme aufnehmen, halten Sie sie entweder durchgehend sehr lebhaft oder durchgehend sehr zurückhaltend. Mischen Sie beides nicht, sonst kann die KI instabil werden, weil sie nicht weiß, welchen Teil der Stimme sie klonen soll. Gleiches gilt für Akzente: Behalten Sie während der gesamten Aufnahme denselben Akzent bei. Konsistenz ist entscheidend für einen guten Klon.






