Die erste KI, die lachen kann
- Veröffentlicht
AnhörenArtikel anhören
In unserem letzten Beitrag haben wir einige längere Beispiele vorgestellt, die mit unserem Tool zur Sprachsynthese erstellt wurden. Außerdem haben wir kurz erklärt, wie das einzigartige Design unseres Modells natürlich klingende, gut getaktete Sprache ermöglicht. Heute zeigen wir Ihnen, dass es zudem emotionaler und kontextsensibler ist als jedes andere Modell. Dadurch ist es nicht nur besonders angenehm anzuhören, sondern eignet sich auch für Anwendungen von der Vertonung von Büchern und Videospielen bis hin zu Werbung.
Emotionen
Die beiden Stärken unseres Modells – Flüssigkeit und korrekte Intonation – beruhen auf umfangreichen Trainingsdaten (über 500.000 Stunden). Entscheidend ist jedoch, wie es aus diesen Daten lernt, was von seiner Architektur abhängt. Im Kern ist es darauf ausgelegt, die in Texten enthaltenen Emotionen zu verstehen und zu entscheiden, ob ein Sprecher glücklich, wütend, traurig oder neutral klingen sollte. Sehen Sie sich einige Beispiele an:
Alle Unterschiede bei Intonation und Stimmung entstehen allein aus dem Text – nichts anderes hat die Ausgabe beeinflusst. Satzzeichen und die Bedeutung der Wörter bestimmen maßgeblich, wie ein bestimmter Satz gesprochen wird. Beachten Sie aber auch, wie das Modell überzeugend Laute erzeugt, die nicht zur gewöhnlichen Sprache gehören, etwa Lachen, wenn der Sprecher über einen Sieg glücklich ist (eine Zusammenstellung der verschiedenen Lacher, zu denen unsere KI fähig ist, veröffentlichen wir in Kürze). Ebenso verstärkt es die Reaktion passend, wenn der Sprecher etwas urkomisch findet – es ist „sooooo lustig“.
Kontext
Doch die Bedeutung einzelner Wörter zu kennen, reicht nicht aus. Unser Modell berücksichtigt ebenso die weitere Situation rund um jede Äußerung. Es bewertet, ob etwas sinnvoll ist, anhand der Verbindung zum vorhergehenden und folgenden Text. Diese umfassendere Perspektive ermöglicht es ihm, längere Passagen korrekt zu intonieren, indem es einen Gedankengang über mehrere Sätze hinweg mit einem einheitlichen emotionalen Muster versieht, wie unser vorheriger Beitrag mit längeren Inhalten zeigt. Sie hilft ihm aber auch, logische Fehler zu vermeiden. Manche Wörter werden beispielsweise gleich geschrieben, haben aber unterschiedliche Bedeutungen, etwa „Band“ als Musikgruppe oder als Gegenstand. Welche Bedeutung jeweils zutrifft, hängt vom Kontext ab:
Geschriebenes und gesprochenes Wort
Da wir unsere Plattform für längere Inhalte entwickeln, muss unser Modell auch verstehen, dass Symbole, Abkürzungen und bestimmte in der Schriftsprache übliche Konventionen auf eine bestimmte Weise oder nicht wörtlich ausgesprochen werden sollten. Das Modell muss beispielsweise wissen, dass FBI, TNT und ATM anders ausgesprochen werden als UNESCO oder NASA. Ebenso ist $3tr in Texten völlig in Ordnung, beim Vorlesen muss daraus jedoch „drei Billionen Dollar“ werden.
Menschliches Eingreifen
Diese feinen Unterschiede zu erkennen, ist entscheidend, denn unser Ziel ist es, den Bedarf an menschlichem Eingreifen im Erstellungsprozess zu minimieren. Schließlich bewerben wir nicht die Fähigkeit unseres Tools, in wenigen Minuten ein Hörbuch zu erstellen, damit anschließend jemand das gesamte Audio anhören und den ganzen Text neu schreiben muss. Obwohl wir die Ausspracheregeln unseres Modells kontinuierlich aktualisieren, kann es dennoch vorkommen, dass etwas das Modell verwirrt. Deshalb entwickeln wir ein System, das Unsicherheiten markiert. Nutzer können damit sofort sehen, welche Textstellen das Modell als problematisch eingestuft hat, und ihm beibringen, wie sie ausgesprochen werden sollen.
Unzählige Anwendungen
Alle gezeigten Fähigkeiten sind Schritte auf dem Weg, unsere Software zum vielseitigsten KI-Tool für Vertonung zu machen.
Nachrichtenverlage haben bereits erkannt, dass eine stärkere Audio-Präsenz Abonnenten bindet. Der große Vorteil, jeden Artikel mit einer Audioversion zu ergänzen, ist, dass Menschen ihn hören können, während sie etwas anderes tun. Verlage, die das tun, setzen oft Sprecher ein. Das ist teuer, und nicht alle Artikel werden vertont. Oder sie lassen ihre eigenen Reporter Beiträge einlesen, was zeitaufwendig und damit ebenfalls teuer ist. Wer synthetische Sprache zur Vertonung von Inhalten nutzt, spart Geld, zahlt aber einen anderen Preis: bei der Qualität. Mit ElevenLabs müssen Sie keine Kompromisse mehr eingehen und erhalten beides.
Stellen Sie sich vor, Sie erstellen Hörbücher mit unverwechselbaren, emotional überzeugenden Voiceovers für alle Figuren – in wenigen Minuten. Das eröffnet nicht nur neue Wege, Bücher zu erleben, sondern erleichtert auch Menschen mit Lernschwierigkeiten den Zugang erheblich.
Denken Sie an die Möglichkeiten, die sich jetzt für Videospiel-Entwickler eröffnen. Sie müssen nicht mehr abwägen, ob eine bestimmte Figur wichtig genug ist, um die sonst erheblichen Kosten einer Vertonung durch echte Schauspieler zu rechtfertigen. Alle NPCs können nun eigene Stimmen und Persönlichkeiten haben.
Werbeagenturen und Produzenten können nun frei experimentieren und Voiceovers an den Ton jeder Kampagne anpassen – ob für einen Sportsender oder eine Luxusuhrenmarke. Die Stimme jedes Schauspielers kann für das Klonen lizenziert werden, sodass Änderungen sofort und ohne physische Anwesenheit des Schauspielers umgesetzt werden können. Entscheiden sie sich stattdessen für eine vollständig synthetische Stimme, müssen Werbetreibende auch keine Ablösesummen für Stimmrechte zahlen.
Virtuelle Assistenten können lebensechter werden, weil KI-Stimme klonen ihnen ermöglicht, mit einer Stimme zu sprechen, die einem bestimmten Nutzer vertraut ist. Die neue Tiefe im Ausdruck macht die Interaktion zudem natürlicher.
ElevenLabs Beta
Gehen Sie hierher , um sich für unsere Beta-Plattform anzumelden und sie selbst auszuprobieren. Wir verbessern sie kontinuierlich, und jedes Nutzerfeedback ist für uns in dieser frühen Phase sehr wertvoll. Viel Spaß!



