Voice Design - Die erste generative KI für Audio
- Veröffentlicht
AnhörenArtikel anhören
Letzten Monat kündigten wir an, dass unser generatives Modell zur Stimmenerstellung kommt. Jetzt ist es da – das erste seiner Art. Wir nennen es Voice Design. Mit dieser Funktion erstellen Sie neue Stimmen von Grund auf, indem Sie zentrale Merkmale wie Geschlecht, Alter und Akzent wählen. Selbst bei denselben Parametern fügt unser Modell bei jedem Klick auf „Generieren“ Zufälligkeit hinzu. So ist jede Stimme, die Sie hören, wirklich einzigartig. Voice Design ist Teil unseres umfassenderen Bestrebens, Publisher und Kreative mit vielseitigen KI-Tools für Storytelling auszustatten.
Voice Design
Das Modell hinter Voice Design basiert größtenteils auf unserer Forschung zu Sprachsynthese und KI-Stimme klonen. Unabhängig davon gefiel uns schon immer die Idee eines generativen Tools für Sprache. Für generative Text-zu-Bild- und Chatbot-Modelle gibt es bereits praktische Anwendungen, doch ein vergleichbares Tool für Audio fehlte. Seit unserem Start erreichen uns Anfragen, mehr Sprecher zu unserer Auswahl hinzuzufügen. Statt die Bibliothek mit zahllosen Stimmen zu überladen und Sie jede Vorschau anhören zu lassen, um herauszufinden, wer wer ist, haben wir den Ansatz umgedreht: Sie bestimmen die Sprecheridentität und erhalten innerhalb dieser Vorgaben unendliche Vielfalt.
Mehr Kontrolle bei der Stimmenauswahl war wichtig, da unsere Nutzer für ihre Skripte oft konkrete Spracheigenschaften suchen. Ebenso entscheidend war, dass jede generierte Stimme einzigartig ist, denn viele Anwendungsfälle erfordern oder profitieren zumindest davon, exklusiven Zugriff auf eine Stimme zu haben. Stimmen, die mit Voice Design erstellt werden, eröffnen nicht nur neue kreative Möglichkeiten, sondern sind vollständig künstlich und gehören keiner realen Person.
Anwendungen
Neben der mühelosen Umwandlung von Text in hochwertiges Audio mit unserem bewährten Speech Synthesis-Tool können Buchautorinnen und -autoren jetzt Voice Design nutzen, um die Erzählung künstlerisch zu gestalten und jeder Figur mit individuellen Stimmen Persönlichkeit zu verleihen.
Nachrichtenpublisher benötigen Stimmen für ihre Beiträge, wenn sie Audio einsetzen. Da Erzähler mit den Publikationen verbunden werden, die sie repräsentieren, ist die Wahl des richtigen Voiceovers eine wichtige Entscheidung, die sich selten wiederholt. Mit Voice Design können Publisher praktisch unzählige Sprecher direkt auswählen und vergleichen. Außerdem können sie sicher sein, dass eine bestimmte Stimme nur sie repräsentiert.
Spieleentwickler müssen nicht mehr entscheiden, ob eine bestimmte Figur die Aufnahmekosten rechtfertigt. Zehntausende zuvor stumme NPCs können jetzt einzigartige Persönlichkeiten erhalten und die Grenzen virtueller Immersion erweitern.
Ob Sie ein Content Creator sind und an Ihrer nächsten Veröffentlichung arbeiten oder als Unternehmensverantwortlicher Unternehmenskommunikation vertonen möchten: Die Möglichkeiten, lebensechtes, überzeugendes Audio für bestimmte Anwendungsfälle und Zielgruppen zu gestalten, sind jetzt grenzenlos.
Ökosystem
Voice Design ist eine von mehreren Funktionen zur Bearbeitung von Erzählungen, die wir dieses Jahr einführen wollen. Als Nächstes folgt Studio – unsere neue Arbeitsumgebung zum Strukturieren großer Texte, Einfügen von Pausen, erneuten Generieren von Audioabschnitten und Zuweisen von Textteilen an verschiedene Sprecher. Studio kommt Ende März und wird später im zweiten Quartal dieses Jahres um Funktionen zur Bearbeitung der Intonation ergänzt.



.jpg&w=3840&q=80)
