Sprachkonvertierung
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Was ist Stimmkonvertierung?
Mit Stimmkonvertierung können Sie die Stimme einer Person in die einer anderen verwandeln. Dabei kommt ein Verfahren namens KI-Stimme klonen zum Einsatz, um die Zielstimme – also die Stimme, in die konvertiert wird – zu kodieren und dieselbe Nachricht so zu erzeugen, dass sie der Identität der Zielperson entspricht, aber die ursprüngliche Intonation bewahrt.
Anwendungen
Hochwertige Stimmkonvertierung und KI-Stimme-klonen-Technologie können die Produktion, Bereitstellung und Nutzung von Inhalten in vielen Branchen grundlegend verändern. Sie können Produktionszeiten und -kosten senken und Menschen, die ihre Stimmen zum Trainieren von Konvertierungsalgorithmen bereitstellen, passive Einnahmen ermöglichen.
- In der Filmbranche könnten Schauspieler ihre Stimmdatenbanken mit Produzenten teilen, um Audiospuren zu erstellen, ohne zum Set oder ins Studio reisen zu müssen;
- versprochene Zeilen könnten in der Postproduktion deutlich effektiver neu aufgenommen werden;
- die Technologie kann auch genutzt werden, um Stimmen historischer Persönlichkeiten in fiktiven Szenarien originalgetreu wiederzugeben oder verstorbene Schauspieler wieder zum Leben zu erwecken;
- auch in der Videospielentwicklung ist die Technologie ähnlich nützlich: Äußerungen könnten direkt vor Ort korrigiert oder einfach ausprobiert werden, ohne dass der Schauspieler für die Aufnahme physisch anwesend sein muss;
- in der Medizin können Patienten, die beispielsweise infolge einer Kehlkopfkrebsbehandlung ihre Sprechfähigkeit verloren haben, wieder die Möglichkeit erhalten, mit ihrer eigenen Stimme zu kommunizieren;
- virtuelle Assistenten könnten personalisiert werden, da es für Nutzer zu Hause natürlicher sein könnte, etwa mit der Stimme eines geliebten Menschen statt mit der eines virtuellen Fremden zu interagieren;
- umgekehrt könnte die Werbebranche von synthetischen Voiceovers profitieren, die so real wie menschliche Stimmen klingen und zugleich Probleme rund um Rechteinhaberschaft und Lizenzgebühren vermeiden. Wenn jedoch gezielt eine wiedererkennbare Stimme benötigt wird, können Werbeproduzenten die Technologie ebenfalls nutzen, um die Stimme eines bestimmten Schauspielers mit dessen Einwilligung zu klonen, ohne dass dieser bei langen Aufnahmesitzungen persönlich anwesend sein muss;
- Hörbuch- und Podcast-Branche sind zwei weitere wachsende Bereiche, in denen KI-Stimme klonen und Stimmkonvertierung die Produktion und Bearbeitung immersiver Inhalte optimieren können.
ElevenLabs Stimmkonvertierung
Obwohl wir bei Eleven im Rahmen unseres Tool-Pakets Software zur Stimmkonvertierung entwickeln, fließt unsere Forschung zu KI-Stimme klonen und Sprachsynthese vor allem in die Entwicklung unseres Hauptprodukts ein, das wir Anfang nächsten Jahres veröffentlichen wollen: ein automatisches, identitätserhaltendes Synchronisations-Tool.
Unser Ziel ist es, alle gesprochenen Inhalte sprachübergreifend mit der Stimme des ursprünglichen Sprechers per Klick zugänglich zu machen. Stellen Sie sich ein lehrreiches YouTube-Video auf Englisch vor. Wenn jemand nur Spanisch spricht, das Thema aber interessant fände, wenn die Person die Sprache verstünde, ist das ein Problem. Untertitel bieten zwar eine Lösung, aber unser Ziel ist eine deutlich immersivere und unterhaltsamere Art, Inhalte zu erleben. Wir möchten dieselbe Person dieselbe Nachricht in natürlichem Spanisch auf muttersprachlichem Niveau sprechen lassen können, auch wenn sie selbst kein Spanisch spricht.
Dafür ermöglicht uns KI-Stimme klonen, ihre Identität zu bewahren – den Klang ihrer Stimme. Wir nutzen es, um neue Äußerungen in einer anderen Sprache zu erzeugen, sodass es klingt, als würde dieselbe Person sprechen.
Stimmkonvertierung ist wichtig, weil wir für maximale Immersion Emotionen, Absicht und Sprechweise bewahren möchten. Wir trainieren robuste mehrsprachige Modelle, die Äußerungen in der Ausgangssprache analysieren und mit der richtigen Intonation in die Zielsprache übertragen können.
Verfahren
Um die Stimme einer Person in die einer anderen zu konvertieren, also Ausgangssprache in Zielsprache, benötigen wir einen Algorithmus, der Inhalte der Ausgangssprache mit den Eigenschaften der Zielsprache ausdrückt. Eine gute Analogie sind Face-Swapping-Apps, mit denen Sie Ihr Gesicht mit dem einer anderen Person kombinieren und ein Bild erstellen können, das beides vereint.
Dazu wird das Bild eines Gesichts genommen und seine Eigenschaften werden abgebildet. Die Punkte im folgenden Beispiel tun genau das: Sie markieren die Grenzen, innerhalb derer die Merkmale des anderen Gesichts dargestellt würden.
Bei der Stimmkonvertierung benötigen wir eine Methode, mit der der Algorithmus Eigenschaften der Zielsprache kodiert. Der Algorithmus wird mit einem Datensatz trainiert, der viele Beispiele dieser Sprache umfasst. Er zerlegt diese Beispiele in eine grundlegende Ebene – gewissermaßen die „Atome“ der Sprache. Sprache besteht aus Sätzen. Sätze bestehen aus Wörtern. Wörter setzen sich aus Phonemen zusammen, die die Eigenschaften der Zielsprache markieren. Auf dieser grundlegenden Ebene arbeitet der Algorithmus.
Der Schlüssel zur Stimmkonvertierung besteht darin, Inhalte der Ausgangssprache mit Phonemen der Zielsprache darzustellen. Dabei gibt es jedoch einen Zielkonflikt, ähnlich wie beim Face-Swapping: Je mehr Marker Sie verwenden, um die Eigenschaften eines Gesichts abzubilden, desto mehr Einschränkungen legen Sie dem Gesicht auf, das Sie darin abbilden. Weniger Marker bedeuten weniger Einschränkungen. Dasselbe gilt für die Stimmkonvertierung. Je stärker wir die Zielsprache priorisieren, desto größer ist das Risiko, nicht mehr mit der Ausgangssprache übereinzustimmen. Priorisieren wir sie dagegen nicht ausreichend, riskieren wir, viel von dem zu verlieren, was diese Sprache auszeichnet. Würden wir etwa die Aufnahme einer wütend schreienden Person mit Morgan Freemans Stimme wiedergeben, wäre das schwierig. Gewichten wir die Emotionen der Ausgangssprache zu stark, geht der Eindruck verloren, dass wirklich Morgan Freeman spricht. Legen wir zu viel Gewicht auf sein Sprachmuster, verlieren wir die emotionale Wirkung der Ausgangssprache.
Ethik
Ethische Bedenken rund um KI-Stimme klonen müssen adressiert werden, da das Missbrauchspotenzial immer mehr Menschen beunruhigt. 2020 nutzten Betrüger Audio-Deepfakes, um sich am Telefon als CEO auszugeben und eine Banküberweisung von 35 Millionen US-Dollar zu autorisieren. Eine Technologie, die überzeugend den Eindruck erwecken kann, jemand habe etwas gesagt, was diese Person nicht gesagt hat, weckt verständlicherweise Befürchtungen, für Desinformation, Verleumdung oder Betrug eingesetzt zu werden. Ebenso wirft Stimmkonvertierung wichtige Fragen zum Urheberrechtsverstoß auf, wenn sie Nutzern erlaubt, Inhalte ohne Einwilligung der Stimmrechteinhaber wirtschaftlich zu verwerten.
Bei Eleven möchten wir alles tun, damit unsere Technologie nicht für böswillige Zwecke genutzt wird, und Schutzmaßnahmen gegen ihre Risiken umsetzen:
- Wir arbeiten nur mit Kunden zusammen, die unsere Bedingungen einhalten. Diese untersagen die böswillige Nutzung unserer Technologie zur Desinformation, Verleumdung, zum Betrug oder für andere Zwecke, die als illegal oder schädlich gelten können;
- von Eleven produzierte synthetische Videoinhalte enthalten ein klares Wasserzeichen, das sie als KI-generiert kennzeichnet. Audioinhalte enthalten eine eindeutige Dateibeschreibung. Wenn wir wiedererkennbare Stimmen verwenden, tun wir dies zu Demonstrationszwecken und in Kontexten, die keine Interessenkonflikte verursachen;
- gleichzeitig möchten wir Stimmrechteinhaber und ihre Lizenzgeber dabei unterstützen, ihre Rechte geltend zu machen.
- Wenn Sie Ideen haben, wie wir unsere Haltung verbessern können, teilen Sie uns diese bitte unter ethics@elevenlabs.io
Wir glauben, dass die Angst vor Missbrauch nicht der entscheidende Faktor für unsere Haltung gegenüber leistungsstarken neuen Technologien sein sollte. Stattdessen sollten wir darauf hinarbeiten, bereits während der Entwicklung angemessene Schutzmaßnahmen einzuführen, um das Schadensrisiko zu minimieren und zugleich das Potenzial der Technologie für die Gesellschaft bestmöglich zu nutzen.
Zukunft
Stimmkonvertierung und KI-Stimme-klonen-Technologie können Film, Fernsehen, Content-Erstellung, Spieleentwicklung, Podcasts und Hörbücher sowie die Werbebranche grundlegend verändern. Ihre Anwendungen reichen jedoch über den kommerziellen Bereich hinaus und bieten Potenzial für Medizin, Bildung und Kommunikation.
KI-Stimme klonen ebnet den Weg in eine Zukunft, in der sich jeder Inhalt in jeder Sprache und mit jeder Stimme erzeugen lässt, um Millionen Menschen weltweit zu erreichen und eine völlig neue Wirtschaft zu schaffen. Unser Ziel bei Eleven ist es, diese Zukunft mitzugestalten.

