For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Erfahren Sie, wie Sie Ihre Stimme mit unseren leistungsstarken Modellen sofort klonen.
Instant Voice Clone erstellen
Beim Klonen einer Stimme ist es wichtig zu berücksichtigen, worauf die KI trainiert wurde: welche Sprachen und welche Art von Datensatz. Weitere Informationen zu den einzelnen Modellen und ihren Stärken finden Sie auf der Modellseite.
Benennen und kennzeichnen Sie Ihren Stimmklon, bestätigen Sie, dass Sie das Recht und die Zustimmung zum Klonen der Stimme haben, und klicken Sie dann auf Stimme speichern.
Klicken Sie im Bereich Stimmen des Dashboards auf Meine Stimmen und dann auf Stimme verwenden, um sie zu nutzen.
Best Practices
Mindestens 1 Minute Audio aufnehmen
Mindestens 1 Minute Audio aufnehmen
Vermeiden Sie Aufnahmen von mehr als 3 Minuten. Dies bringt nur geringe Verbesserungen und kann dem Klon in einigen Fällen sogar schaden.
Wie das Audio aufgenommen wurde, ist wichtiger als die Gesamtlänge (Gesamtlaufzeit) der Samples. Die Anzahl der verwendeten Samples spielt keine Rolle; entscheidend ist ihre kombinierte Gesamtlänge (Gesamtlaufzeit).
Empfohlen werden etwa 1–2 Minuten klares Audio ohne Hall, Artefakte oder Hintergrundgeräusche. Mit „Audio- oder Aufnahmequalität“ meinen wir nicht den Codec wie MP3 oder WAV, sondern wie das Audio aufgenommen wurde. Bei Audiocodecs empfehlen wir jedoch MP3 mit 128 kbit/s oder mehr. Höhere Bitraten haben keinen wesentlichen Einfluss auf die Qualität des Klons.
Audio konsistent halten
Audio konsistent halten
Die KI versucht, alles nachzuahmen, was sie im Audio hört. Dazu gehören Sprechgeschwindigkeit, Betonung, Akzent, Klangfarbe, Atemmuster und -stärke sowie Geräusche und Mundgeräusche. Auch Rauschen und Artefakte, die sie verwirren können, werden berücksichtigt.
Stellen Sie sicher, dass die Stimme durchgehend einen einheitlichen Ton und eine konsistente Darbietung hat. Achten Sie auch darauf, dass die Audioqualität der Stimme über alle Samples hinweg gleich bleibt. Selbst wenn Sie nur ein einzelnes Sample verwenden, sollte es über die gesamte Länge konsistent sein. Sehr dynamisches Audio mit starken Schwankungen in Tonhöhe und Lautstärke führt zu weniger vorhersehbaren Ergebnissen.
Ihre Darbietung nachbilden
Ihre Darbietung nachbilden
Beachten Sie auch, dass die KI versucht, die Darbietung der von Ihnen bereitgestellten Stimme nachzubilden. Wenn Sie langsam, monoton und mit wenig Emotion sprechen, wird die KI dies nachahmen. Wenn Sie hingegen schnell und emotional sprechen, wird die KI auch das zu reproduzieren versuchen.
Die Stimme muss über alle Samples hinweg konsistent bleiben – nicht nur im Ton, sondern auch in der Darbietung. Zu starke Abweichungen können die KI verwirren und zu unterschiedlicheren Ergebnissen zwischen den Generierungen führen.
Eine gute Lautstärkebalance finden
Eine gute Lautstärkebalance finden
Finden Sie eine gute Lautstärkebalance, damit das Audio weder zu leise noch zu laut ist. Ideal sind -23 dB bis -18 dB RMS bei einem True Peak von -3 dB.
FAQ
Was ist der Unterschied zwischen Instant Voice Cloning und Professional Voice Cloning?
Mit Professional Voice Cloning können Sie im Gegensatz zu Instant Voice Cloning, mit dem Sie Stimmen mit weniger als 2 Minuten Audio schnell klonen können, ein realistischeres Modell Ihrer Stimme trainieren. Dazu wird ein eigenes Modell mit einem großen Satz an Sprachdaten trainiert, um ein Modell zu erzeugen, das von Ihrer Originalstimme praktisch nicht zu unterscheiden ist.
Da Professional Voice Clones Finetuning und Training erfordern, dauert es etwas, bevor Sie Ihren Stimmklon verwenden können. Eine genaue Schätzung ist schwierig, da sie von der Anzahl der Personen vor Ihnen in der Warteschlange und einigen weiteren Faktoren abhängt. In der Regel dauert das Finetuning jedoch 3–6 Stunden.
Sobald Ihr Professional Voice Clone bereit ist, erhalten Sie eine E-Mail-Benachrichtigung.
Wie viele Sprachsamples sollte ich für Instant Voice Cloning hochladen?
Das Klonen mit Instant Voice Cloning kann etwas komplex sein. Es gibt einige allgemeine Richtlinien, die jedoch genau das sind: Richtlinien. Für die Anzahl oder Länge der Proben gibt es keine festen Regeln. Einige Nutzer erzielen mit nur 30 Sekunden Audio hervorragende Ergebnisse, während andere mit 10 Minuten Audio schlechtere Ergebnisse erhalten. Es gibt jedoch einige Punkte, die Sie beachten sollten.
Die Audioqualität ist beim Einsatz von Instant Voice Cloning der wichtigste Faktor.
Die Anzahl der Proben ist nicht relevant. Entscheidend ist die Gesamtlaufzeit. Mehr als 2–3 Minuten Audio bringen kaum Verbesserungen und können in einigen Fällen sogar die Stabilität des Klons beeinträchtigen.
Welche Dateien akzeptieren Sie zum Klonen von Stimmen?
Für Instant Voice Cloning und Professional Voice Cloning akzeptieren wir verschiedene Dateitypen. Wir empfehlen dringend MP3 mit 192 kbps oder höher.
Empfohlenes Format
MP3, 192 kbps oder höher
Empfohlene Länge
Instant Voice Cloning: 1–2 Minuten gutes Audio
Professional Voice Cloning: 30–180 Minuten gutes Audio
Unkomprimierte Formate wie WAV verbessern die Qualität des Klons in der Regel nicht und können Probleme beim Upload verursachen. Konzentrieren Sie sich stattdessen auf die Aufnahmequalität: Verwenden Sie eine saubere Aufnahme ohne Hintergrundgeräusche, Raumhall oder mehrere Sprecher, mit gleichbleibender Lautstärke und Stimmfarbe sowie ohne lange Sprechpausen.
Gibt es Einschränkungen dafür, welche Stimmen ich zum Klonen hochladen kann?
Bei ElevenLabs setzen wir uns uneingeschränkt dafür ein, sowohl geistige Eigentumsrechte zu respektieren als auch Schutzmaßnahmen gegen den möglichen Missbrauch unserer Technologie umzusetzen:
Wir arbeiten nur mit Kunden zusammen, die unsere Nutzungsbedingungen und Richtlinie zur verbotenen Nutzung einhalten. Diese untersagen die böswillige Nutzung unserer Technologie für Zwecke, die als illegal oder schädlich gelten können;
Wir unterstützen Stimmeninhaber und ihre Lizenzgeber dabei, ihre Rechte geltend zu machen. Alle bekannten Verstöße werden geprüft und bearbeitet;
Alle von unseren Modellen generierten Audios können sofort bis zum für die Generierung verantwortlichen Nutzer zurückverfolgt werden.
Die von uns entwickelte Technologie ist neu, und klare Regulierungen müssen erst noch eingeführt werden. Als KI-Forschungslabor wollen wir auch das Bewusstsein für diese Technologie, ihr Potenzial und ihre Grenzen stärken.
Kurz gesagt: Gute, konsistente Eingaben = gute, konsistente Ausgaben.
Länge
Instant Voice Cloning: 1–2 Minuten gutes Audio
Professional Voice Cloning: 30–180 Minuten gutes Audio
Verwenden Sie die besten und klarsten Audio-Clips, die Sie finden können. Es sollte nur ein Sprecher ohne Hintergrundgeräusche oder Störungen zu hören sein. Die Stimme sollte laut und deutlich sein.
Statt viele Clips unterschiedlicher Qualität nur zur Verlängerung zu verwenden, sollten Sie Clips mit offensichtlich sehr hoher Mikrofonqualität priorisieren, deren Qualität und Klang durchgehend konsistent sind. Konzentrieren Sie sich nicht nur darauf, die Gesamtdauer zu erhöhen.
Stellen Sie sicher, dass die meisten Dialoge in Ihren Clips dem von Ihnen bevorzugten Sprechstil und der gewünschten Intonation des Sprechers entsprechen. Es sollten nicht zu viele Dialogabschnitte enthalten sein, in denen der Sprecher von den gewünschten Sprachmustern abweicht.
Verwenden Sie bei Bedarf eine Rauschunterdrückung, um Hintergrundgeräusche zu reduzieren.
Weitere Informationen finden Sie hier in unserer Dokumentation.
Kann ich meine Stimme in einer anderen Sprache als Englisch klonen?
Ja. Sie können Ihre Stimme in jeder von Flash v2.5 und Multilingual v2 unterstützten Sprache klonen. Die vollständige Liste der unterstützten Sprachen finden Sie hier.
Sie können auch eine Stimme klonen, die eine Sprache spricht, die die KI nicht unterstützt. Der Klon kann den Klang des Sprechers erfassen, wird diese Sprache jedoch nicht sprechen können. Die Ergebnisse können unvorhersehbar sein. Davon raten wir ab.
Kann ich meine Stimmklone exportieren?
Sie können Ihre Stimmklone nicht als eigenständige Dateien herunterladen oder exportieren. Stimmklone bleiben in Ihrem ElevenLabs-Konto.
Sie können Ihre ElevenLabs-Stimmen dennoch außerhalb der ElevenLabs-Website nutzen. Mit Ihrem API-Schlüssel können Drittanbieterdienste die ElevenLabs API aufrufen und mit den Stimmen in Ihrem Konto Sprache generieren.
Wenn Sie einen Klon später erneut erstellen möchten, bewahren Sie die ursprünglichen Audio-Beispiele auf, die Sie dafür verwendet haben. Jeder Klon klingt etwas anders, auch wenn Sie dasselbe Audio verwenden.
Warum klingen meine Stimme oder mein Akzent nach dem Klonen nicht richtig?
ElevenLabs bietet zwei Optionen zum Klonen:
Sofortige Stimmklonung: Schnelle Ergebnisse mit etwa 1–3 Minuten Audiomaterial. Funktioniert gut für die meisten Stimmen, kann aber bei ungewöhnlichen Akzenten oder einzigartigen Stimmen Schwierigkeiten haben.
Professionelle Stimmklonung: Höhere Wiedergabetreue mit 30 Minuten bis etwa 3 Stunden Audiomaterial. Die Feinabstimmung dauert in der Regel 3–6 Stunden und kann länger dauern, wenn viele Stimmen in der Warteschlange sind.
Wenn die sofortige Stimmklonung Ihre Stimme oder Ihren Akzent nicht gut erfasst, versuchen Sie es mit der professionellen Stimmklonung.
Sie können den Akzent oder Ton einer geklonten Stimme nach ihrer Erstellung nicht ändern. Um das Ergebnis zu verbessern, ändern Sie die verwendeten Audiosamples. Kleine Änderungen an den Samples können einen großen Unterschied machen.
Was bedeutet der Fehler „No model found for this voice. Please select another voice“?
Dieser Fehler wird angezeigt, wenn Sie Ihren Professional Voice Clone (PVC) verwenden möchten, bevor das Finetuning abgeschlossen ist und er zur Verwendung bereitsteht.
Wenn Sie einen PVC erstellen, durchläuft er mehrere Prozesse, bevor er verwendet werden kann. Nachdem Sie Ihre Stimme verifiziert haben, wird sie verarbeitet und für das Finetuning in die Warteschlange gestellt. Je nachdem, wie viele andere Stimmen aktuell für das Finetuning in der Warteschlange stehen, dauert dieser Prozess in der Regel schätzungsweise 3–6 Stunden, kann aber bis zu 24 Stunden dauern.
Sie können den Fortschritt Ihres PVC unter My Voices prüfen: Suchen Sie die Stimme in Ihrer Stimmenliste und klicken Sie dann auf Anzeigen, um weitere Details zu sehen. Wenn Sie mit dem Mauszeiger über ein Modell fahren, sehen Sie den aktuellen Status.