Sofortiges KI-Stimme klonen

Erfahren Sie, wie Sie Ihre Stimme mit unseren leistungsstarken Modellen sofort klonen.
Produktfunktion für KI-Stimme klonen

Instant Voice Clone erstellen

Beim Klonen einer Stimme ist es wichtig zu berücksichtigen, worauf die KI trainiert wurde: welche Sprachen und welche Art von Datensatz. Weitere Informationen zu den einzelnen Modellen und ihren Stärken finden Sie auf der Modellseite.

Anleitung

Wenn Sie sich nicht sicher sind, was rechtlich zulässig ist, lesen Sie bitte die Nutzungsbedingungen und unsere Informationen zur KI-Sicherheit.

1

Zur Seite für Instant Voice Cloning navigieren

Wählen Sie im ElevenLabs-Dashboard links den Bereich Stimmen und klicken Sie dann auf das Plus-Symbol.

Wählen Sie im Dialogfenster Instant Voice Clone aus.

2

Audio hochladen oder aufnehmen

Folgen Sie den Anweisungen auf dem Bildschirm, um Ihr Audio hochzuladen oder aufzunehmen.

3

Stimmdetails bestätigen

Dialogfenster für KI-Stimme klonen mit IVC

Benennen und kennzeichnen Sie Ihren Stimmklon, bestätigen Sie, dass Sie das Recht und die Zustimmung zum Klonen der Stimme haben, und klicken Sie dann auf Stimme speichern.

4

Stimmklon verwenden

Klicken Sie im Bereich Stimmen des Dashboards auf Meine Stimmen und dann auf Stimme verwenden, um sie zu nutzen.

Best Practices

Mindestens 1 Minute Audio aufnehmen

Vermeiden Sie Aufnahmen von mehr als 3 Minuten. Dies bringt nur geringe Verbesserungen und kann dem Klon in einigen Fällen sogar schaden.

Wie das Audio aufgenommen wurde, ist wichtiger als die Gesamtlänge (Gesamtlaufzeit) der Samples. Die Anzahl der verwendeten Samples spielt keine Rolle; entscheidend ist ihre kombinierte Gesamtlänge (Gesamtlaufzeit).

Empfohlen werden etwa 1–2 Minuten klares Audio ohne Hall, Artefakte oder Hintergrundgeräusche. Mit „Audio- oder Aufnahmequalität“ meinen wir nicht den Codec wie MP3 oder WAV, sondern wie das Audio aufgenommen wurde. Bei Audiocodecs empfehlen wir jedoch MP3 mit 128 kbit/s oder mehr. Höhere Bitraten haben keinen wesentlichen Einfluss auf die Qualität des Klons.

Audio konsistent halten

Die KI versucht, alles nachzuahmen, was sie im Audio hört. Dazu gehören Sprechgeschwindigkeit, Betonung, Akzent, Klangfarbe, Atemmuster und -stärke sowie Geräusche und Mundgeräusche. Auch Rauschen und Artefakte, die sie verwirren können, werden berücksichtigt.

Stellen Sie sicher, dass die Stimme durchgehend einen einheitlichen Ton und eine konsistente Darbietung hat. Achten Sie auch darauf, dass die Audioqualität der Stimme über alle Samples hinweg gleich bleibt. Selbst wenn Sie nur ein einzelnes Sample verwenden, sollte es über die gesamte Länge konsistent sein. Sehr dynamisches Audio mit starken Schwankungen in Tonhöhe und Lautstärke führt zu weniger vorhersehbaren Ergebnissen.

Ihre Darbietung nachbilden

Beachten Sie auch, dass die KI versucht, die Darbietung der von Ihnen bereitgestellten Stimme nachzubilden. Wenn Sie langsam, monoton und mit wenig Emotion sprechen, wird die KI dies nachahmen. Wenn Sie hingegen schnell und emotional sprechen, wird die KI auch das zu reproduzieren versuchen.

Die Stimme muss über alle Samples hinweg konsistent bleiben – nicht nur im Ton, sondern auch in der Darbietung. Zu starke Abweichungen können die KI verwirren und zu unterschiedlicheren Ergebnissen zwischen den Generierungen führen.

Eine gute Lautstärkebalance finden

Finden Sie eine gute Lautstärkebalance, damit das Audio weder zu leise noch zu laut ist. Ideal sind -23 dB bis -18 dB RMS bei einem True Peak von -3 dB.

FAQ

Mit Professional Voice Cloning können Sie im Gegensatz zu Instant Voice Cloning, mit dem Sie Stimmen mit weniger als 2 Minuten Audio schnell klonen können, ein realistischeres Modell Ihrer Stimme trainieren. Dazu wird ein eigenes Modell mit einem großen Satz an Sprachdaten trainiert, um ein Modell zu erzeugen, das von Ihrer Originalstimme praktisch nicht zu unterscheiden ist.

Da Professional Voice Clones Finetuning und Training erfordern, dauert es etwas, bevor Sie Ihren Stimmklon verwenden können. Eine genaue Schätzung ist schwierig, da sie von der Anzahl der Personen vor Ihnen in der Warteschlange und einigen weiteren Faktoren abhängt. In der Regel dauert das Finetuning jedoch 3–6 Stunden.

Sobald Ihr Professional Voice Clone bereit ist, erhalten Sie eine E-Mail-Benachrichtigung.

Das Klonen mit Instant Voice Cloning kann etwas komplex sein. Es gibt einige allgemeine Richtlinien, die jedoch genau das sind: Richtlinien. Für die Anzahl oder Länge der Proben gibt es keine festen Regeln. Einige Nutzer erzielen mit nur 30 Sekunden Audio hervorragende Ergebnisse, während andere mit 10 Minuten Audio schlechtere Ergebnisse erhalten. Es gibt jedoch einige Punkte, die Sie beachten sollten.

  • Die Audioqualität ist beim Einsatz von Instant Voice Cloning der wichtigste Faktor.
  • Die Anzahl der Proben ist nicht relevant. Entscheidend ist die Gesamtlaufzeit. Mehr als 2–3 Minuten Audio bringen kaum Verbesserungen und können in einigen Fällen sogar die Stabilität des Klons beeinträchtigen.

Für Instant Voice Cloning und Professional Voice Cloning akzeptieren wir verschiedene Dateitypen. Wir empfehlen dringend MP3 mit 192 kbps oder höher.

Empfohlenes Format

  • MP3, 192 kbps oder höher

Empfohlene Länge

  • Instant Voice Cloning: 1–2 Minuten gutes Audio
  • Professional Voice Cloning: 30–180 Minuten gutes Audio

Unkomprimierte Formate wie WAV verbessern die Qualität des Klons in der Regel nicht und können Probleme beim Upload verursachen. Konzentrieren Sie sich stattdessen auf die Aufnahmequalität: Verwenden Sie eine saubere Aufnahme ohne Hintergrundgeräusche, Raumhall oder mehrere Sprecher, mit gleichbleibender Lautstärke und Stimmfarbe sowie ohne lange Sprechpausen.

Weitere Informationen finden Sie unter Instant Voice Cloning (IVC) und Professional Voice Cloning (PVC).

Bei ElevenLabs setzen wir uns uneingeschränkt dafür ein, sowohl geistige Eigentumsrechte zu respektieren als auch Schutzmaßnahmen gegen den möglichen Missbrauch unserer Technologie umzusetzen:

  • Wir arbeiten nur mit Kunden zusammen, die unsere Nutzungsbedingungen und Richtlinie zur verbotenen Nutzung einhalten. Diese untersagen die böswillige Nutzung unserer Technologie für Zwecke, die als illegal oder schädlich gelten können;
  • Wir unterstützen Stimmeninhaber und ihre Lizenzgeber dabei, ihre Rechte geltend zu machen. Alle bekannten Verstöße werden geprüft und bearbeitet;
  • Alle von unseren Modellen generierten Audios können sofort bis zum für die Generierung verantwortlichen Nutzer zurückverfolgt werden.

Die von uns entwickelte Technologie ist neu, und klare Regulierungen müssen erst noch eingeführt werden. Als KI-Forschungslabor wollen wir auch das Bewusstsein für diese Technologie, ihr Potenzial und ihre Grenzen stärken.

Eine vollständige Anleitung finden Sie in unserer Dokumentation zu Instant Voice Cloning und Professional Voice Cloning.

Kurz gesagt: Gute, konsistente Eingaben = gute, konsistente Ausgaben.

Länge

  • Instant Voice Cloning: 1–2 Minuten gutes Audio
  • Professional Voice Cloning: 30–180 Minuten gutes Audio

Verwenden Sie die besten und klarsten Audio-Clips, die Sie finden können. Es sollte nur ein Sprecher ohne Hintergrundgeräusche oder Störungen zu hören sein. Die Stimme sollte laut und deutlich sein.

Statt viele Clips unterschiedlicher Qualität nur zur Verlängerung zu verwenden, sollten Sie Clips mit offensichtlich sehr hoher Mikrofonqualität priorisieren, deren Qualität und Klang durchgehend konsistent sind. Konzentrieren Sie sich nicht nur darauf, die Gesamtdauer zu erhöhen.

Stellen Sie sicher, dass die meisten Dialoge in Ihren Clips dem von Ihnen bevorzugten Sprechstil und der gewünschten Intonation des Sprechers entsprechen. Es sollten nicht zu viele Dialogabschnitte enthalten sein, in denen der Sprecher von den gewünschten Sprachmustern abweicht.

Verwenden Sie bei Bedarf eine Rauschunterdrückung, um Hintergrundgeräusche zu reduzieren.

Weitere Informationen finden Sie hier in unserer Dokumentation.

Ja. Sie können Ihre Stimme in jeder von Flash v2.5 und Multilingual v2 unterstützten Sprache klonen. Die vollständige Liste der unterstützten Sprachen finden Sie hier.

Sie können auch eine Stimme klonen, die eine Sprache spricht, die die KI nicht unterstützt. Der Klon kann den Klang des Sprechers erfassen, wird diese Sprache jedoch nicht sprechen können. Die Ergebnisse können unvorhersehbar sein. Davon raten wir ab.

Sie können Ihre Stimmklone nicht als eigenständige Dateien herunterladen oder exportieren. Stimmklone bleiben in Ihrem ElevenLabs-Konto.

Sie können Ihre ElevenLabs-Stimmen dennoch außerhalb der ElevenLabs-Website nutzen. Mit Ihrem API-Schlüssel können Drittanbieterdienste die ElevenLabs API aufrufen und mit den Stimmen in Ihrem Konto Sprache generieren.

Wenn Sie einen Klon später erneut erstellen möchten, bewahren Sie die ursprünglichen Audio-Beispiele auf, die Sie dafür verwendet haben. Jeder Klon klingt etwas anders, auch wenn Sie dasselbe Audio verwenden.

ElevenLabs bietet zwei Optionen zum Klonen:

  • Sofortige Stimmklonung: Schnelle Ergebnisse mit etwa 1–3 Minuten Audiomaterial. Funktioniert gut für die meisten Stimmen, kann aber bei ungewöhnlichen Akzenten oder einzigartigen Stimmen Schwierigkeiten haben.
  • Professionelle Stimmklonung: Höhere Wiedergabetreue mit 30 Minuten bis etwa 3 Stunden Audiomaterial. Die Feinabstimmung dauert in der Regel 3–6 Stunden und kann länger dauern, wenn viele Stimmen in der Warteschlange sind.

Wenn die sofortige Stimmklonung Ihre Stimme oder Ihren Akzent nicht gut erfasst, versuchen Sie es mit der professionellen Stimmklonung.

Sie können den Akzent oder Ton einer geklonten Stimme nach ihrer Erstellung nicht ändern. Um das Ergebnis zu verbessern, ändern Sie die verwendeten Audiosamples. Kleine Änderungen an den Samples können einen großen Unterschied machen.

Dieser Fehler wird angezeigt, wenn Sie Ihren Professional Voice Clone (PVC) verwenden möchten, bevor das Finetuning abgeschlossen ist und er zur Verwendung bereitsteht.

Wenn Sie einen PVC erstellen, durchläuft er mehrere Prozesse, bevor er verwendet werden kann.  Nachdem Sie Ihre Stimme verifiziert haben, wird sie verarbeitet und für das Finetuning in die Warteschlange gestellt.   Je nachdem, wie viele andere Stimmen aktuell für das Finetuning in der Warteschlange stehen, dauert dieser Prozess in der Regel schätzungsweise 3–6 Stunden, kann aber bis zu 24 Stunden dauern.

Sie können den Fortschritt Ihres PVC unter My Voices prüfen: Suchen Sie die Stimme in Ihrer Stimmenliste und klicken Sie dann auf Anzeigen, um weitere Details zu sehen.  Wenn Sie mit dem Mauszeiger über ein Modell fahren, sehen Sie den aktuellen Status.  

Weitere Informationen zur Bedeutung der einzelnen Status finden Sie unter Was bedeutet der Status meines Professional Voice Clone?

Wenn das Finetuning Ihres PVC abgeschlossen ist und er verwendet werden kann, erhalten Sie eine Pop-up-Benachrichtigung sowie eine E-Mail.

No results