Diese Stimme existiert nicht - Generative Voice KI
- Veröffentlicht
AnhörenArtikel anhören
In letzter Zeit scheint jeder über generative KI zu sprechen. Große Sprach- und Text-zu-Bild-Modelle auf Basis von Deep Learning wie ChatGPT, Stable Diffusion, DALL-E und Midjourney sorgen in der Tech-Welt und darüber hinaus für viel Aufsehen. Viele zählen sie zu den wichtigsten jüngsten Entwicklungen der KI. Unabhängig davon, ob Sie zustimmen, scheint die allgemeine Einschätzung zu sein, dass etwas sehr Leistungsstarkes entstanden ist. 2023 werden wir von Modellen hören, die beim Zeichnen oder Erstellen von Videos helfen. So wie wir nach dem neuesten und besten Smartphone fragen, werden wir bald nach dem neuesten und besten Foundation Model fragen. Bei aller Begeisterung gibt es aus unserer Sicht einen Bereich generativer Medien, der noch immer stark unterschätzt wird: Voice AI. In diesem Bereich wollen wir führend werden. Bei Eleven nutzen wir täglich das Potenzial von Deep-Learning-Techniken für unsere lebensechten Text to Speech- und KI-Stimme klonen-Tools. Jetzt setzen wir auch unser eigenes generatives Modell ein, mit dem Sie völlig neue synthetische Stimmen von Grund auf gestalten können.
Voice Generator – eine Stimme gestalten
Unsere Nutzer verwenden die Plattform täglich, um ihre Figuren zum Leben zu erwecken – für Hörbücher, Spiele oder Fanfiction. Wir haben erkannt, dass unsere aktuelle Stimmbibliothek zu klein ist, damit jeder Stimmen findet, die zu seinen Inhalten passen und zugleich exklusiv für ihn bleiben. Unsere Lösung: Sie können völlig neue synthetische Stimmen gestalten.
Die Idee dafür entstand, als wir die Methoden analysierten, die wir derzeit für Sprachsynthese und das Klonen von Stimmen nutzen. Beide Prozesse benötigen eine Möglichkeit, die Eigenschaften einer bestimmten Stimme zu kodieren. Speaker Embeddings tragen diese Identität – sie sind eine Vektorrepräsentation der Stimme eines Sprechers. Wir erkannten, dass wir aus der Verteilung von Speaker Embeddings samplen können, indem wir ein spezielles Modell trainieren, das unendlich viele neue Stimmen erzeugt.
Da unsere Nutzer meist nach bestimmten Spracheigenschaften suchen, mussten wir dem Prozess mehr Steuerungsmöglichkeiten hinzufügen. Wir haben unser Modell um Conditioning erweitert, damit es Stimmen anhand ihrer Eigenschaften generiert. Das Modell ermöglicht Ihnen jetzt, grundlegende Parameter festzulegen, die die Kernidentität der neuen Stimme bestimmen: Geschlecht, Alter, Akzent, Tonhöhe und Sprechstil. Mit anderen Worten: Jedes Mal, wenn Sie auf „Generieren“ klicken, erhalten Sie selbst bei gleichen Basisparametern eine völlig neue Stimme, die zuvor nicht existierte.
Hier sind einige Beispiele für Stimmen, die sich auf diese Weise gestalten lassen:
„Design Voice“ wird ab Februar als Teil von Voice Lab auf unserer Plattform verfügbar sein.
Wofür ist das gut?
Unsere Tools können bereits Sprache erzeugen, die so lebensecht wie die eines Menschen klingt. Wir erwarten, dass die möglichen Einsatzbereiche künstlicher Stimmen weiter wachsen werden. Viele dieser neuen Anwendungen, etwa Audioaufnahmen für Nachrichtenpublikationen oder Werbespots, erfordern, dass eine Stimme einer bestimmten Marke oder einem bestimmten Anwendungsfall vorbehalten ist und damit identifiziert wird. Andere Anwendungsfälle wie Storytelling und Videospiele setzen von Beginn der Entwicklung an auf Flexibilität und Experimentierfreiheit. Statt eine riesige Auswahl virtueller Sprecher zu erstellen, geben wir Nutzern deshalb das letzte Wort darüber, welche Stimmen ihren Zwecken am besten entsprechen.
Buchautorinnen und -autoren können ihre Werke nun nicht nur einfach in Audio umwandeln, sondern behalten auch die kreative Kontrolle über die Gestaltung individueller Erzählstimmen. Das eröffnet ihrem Publikum neue Möglichkeiten, mit Publikationen zu interagieren, und steigert zugleich die Zahl der Bücher, die wir als Hörbücher genießen können.
Nachrichtenverlage setzen zunehmend auf Audio. Unverwechselbare Stimmen zur Repräsentation ihrer Publikationen auszuwählen, ist eine wichtige Aufgabe – viele Zuhörer schätzen Form ebenso wie Inhalt. Ebenso wichtig ist, dass Verlage jetzt sicher sein können, dass eine bestimmte Stimme sie und nur sie repräsentiert.
Videospielentwickler können jetzt eine Vielzahl bislang stummer NPCs vertonen – mit allen nötigen Tools direkt zur Hand. Sie können nicht nur kosteneffizienter arbeiten, ohne Kompromisse bei der Qualität einzugehen, sondern auch Stimmen gestalten, die in den virtuellen Welten, die sie erschaffen, völlig einzigartig sind.
Werbekreative benötigen Voiceovers für bestimmte Kampagnen. Daher ist es ein großer Vorteil, schon zu Beginn der Entwicklung passende und gezielt konzipierte Erzählstimmen gestalten zu können. Sie können sofort mit mehreren Stimmen und Sprechstilen experimentieren, ohne zusätzliche Ressourcen einzubinden.
Von Kreativen, die Audio- und Videoinhalte aller Art produzieren, bis zu Unternehmensvertretern, die Unternehmenskommunikation vertonen möchten: Die Möglichkeiten, überzeugendes Audio zu gestalten, das einzigartig und auf einen bestimmten Anwendungsfall zugeschnitten ist, sind jetzt grenzenlos.
Ethische KI
Ähnlich wie das Klonen von Stimmen Sorgen über möglichen Missbrauch auslöst, befürchten immer mehr Menschen, dass die Verbreitung von KI-Technologie die Existenzgrundlage von Fachkräften gefährdet. Bei Eleven sehen wir eine Zukunft, in der Sprecherinnen und Sprecher ihre Stimmen gegen Vergütung für das Training von Sprachmodellen für bestimmte Einsatzzwecke lizenzieren können. Kunden und Studios werden professionelle Sprecher weiterhin gern in ihre Projekte einbinden. KI sorgt einfach für schnellere Abläufe sowie mehr Freiheit, früh in der Entwicklung zu experimentieren und eine Richtung festzulegen. Die Technologie wird verändern, wie gesprochene Audioinhalte gestaltet und aufgenommen werden. Dass Sprecher nicht mehr bei jeder Session physisch anwesend sein müssen, gibt ihnen jedoch die Freiheit, gleichzeitig an mehr Projekten mitzuwirken und ihre Stimmen wirklich zu verewigen.
Darüber hinaus begeistert uns, dass zahlreiche Bücher, Nachrichten, unabhängige Spiele und andere Inhalte über ein weiteres Medium zugänglich werden, deren Autoren und Entwickler sich Aufnahmeproduktionen sonst nicht leisten könnten. Dieser erweiterte Zugang bietet jeweils die Chance, ein größeres Publikum zu erreichen.
Bei Eleven verpflichten wir uns uneingeschränkt dazu, geistige Eigentumsrechte zu respektieren und Schutzmaßnahmen gegen möglichen Missbrauch unserer Technologie umzusetzen:
- Wir arbeiten nur mit Kunden zusammen, die unsere Nutzungsbedingungen einhalten. Diese untersagen die missbräuchliche Nutzung unserer Technologie für Zwecke, die als illegal oder schädlich gelten können;
- Wir arbeiten außerdem daran, alle von unserem Modell generierten Audioinhalte mit Wasserzeichen zu versehen, damit sie sofort zu uns zurückverfolgt werden können;
- Wenn wir erkennbare Stimmen verwenden, geschieht dies zu Demonstrationszwecken und in Kontexten, die keine Interessenkonflikte verursachen;
- Gleichzeitig unterstützen wir Stimmeninhaber und ihre Lizenzgeber dabei, ihre Rechte geltend zu machen. Alle bekannten Verstöße werden geprüft und verfolgt.
Ausblick – Ihre eigene Stimme verbessern
Künftig planen wir, die Fähigkeiten unserer Modelle zur Stimmgenerierung und zum Klonen von Stimmen zu kombinieren, damit Nutzer ihre eigenen Stimmen verbessern können. Sie werden Ihre Stimme klonen und anschließend beliebig verändern können. Wenn Sie befürchten, dass Ihr natürlicher Sprechstil etwas monoton ist, können Sie ihn abwechslungsreicher gestalten. Wenn Sie wirklich ungern aufgenommen werden, können Sie die Ausgabe so anpassen, dass sie natürlicher klingt. Jeder, der Audio mit seiner eigenen Stimme erstellen muss – ob für eine aufgezeichnete Präsentation oder eine Audionachricht –, kann dies mit unserer Tool-Suite per Klick tun.
Frohes neues Jahr
Zum Ende des Jahres 2022 möchten wir unseren Beta-Nutzern für ihre fortlaufende Teilnahme und ihr Feedback danken. Viele der Funktionen, die wir entwickeln, gehen auf Ihre Beiträge und Vorschläge zurück. Wir freuen uns sehr, Sie an Bord zu haben, und wünschen Ihnen allen ein frohes neues Jahr.
Eleven Labs Beta
Gehen Sie hier hin, um sich für unsere Beta-Plattform anzumelden und sie selbst auszuprobieren. Wir verbessern sie fortlaufend, und Erkenntnisse unserer Nutzer sind für uns in dieser frühen Phase sehr wertvoll.


.jpg&w=3840&q=80)

