Zum Inhalt springen

ElevenLabs verlässt die Beta-Phase und veröffentlicht Eleven Multilingual v2 - ein grundlegendes KI-Sprachmodell für fast 30 Sprachen

Veröffentlicht

AnhörenArtikel anhören

  • Voice-KI-Plattform ElevenLabs macht mit der Veröffentlichung eines neuen grundlegenden Deep-Learning-Modells, das mehrsprachige Funktionen für 28 Sprachen unterstützt – dem Eleven Multilingual v2
  • einen großen Schritt vorwärts, um sprachliche Barrieren bei Inhalten abzubauen
  • Dieser Fortschritt ermöglicht Medienunternehmen, Spieleentwicklern, Verlagen und unabhängigen Kreativen weltweit, die Zugänglichkeit ihrer Inhalte deutlich zu verbessern
  • Diese neuen Funktionen folgen auf zahlreiche neue Features und Verbesserungen seit dem Start der Plattform im Januar und markieren zugleich das offizielle Ende der Beta-Phase des Unternehmens

Die Mission von ElevenLabs ist es, alle Inhalte in jeder Sprache und mit jeder Stimme universell zugänglich zu machen, der weltweit führende Anbieter von Voice-KI-Software, hat heute ein neues mehrsprachiges Modell zur Stimmgenerierung vorgestellt, das emotional ausdrucksstarkes KI-Audio in fast 30 Sprachen präzise erzeugen kann.

Der vollständig auf eigener Forschung basierende Fortschritt ermöglicht Kreativen, lokalisierte Audioinhalte für internationale Märkte in Europa, Asien und dem Nahen Osten zu erstellen. ElevenLabs hat in den vergangenen 18 Monaten Merkmale menschlicher Sprache analysiert, neue Mechanismen zum Verstehen von Kontext und zum Vermitteln von Emotionen bei der Sprachgenerierung entwickelt sowie neue, einzigartige Stimmen synthetisiert.

Wenn Text in die ElevenLabs-Text to Speech-Plattform eingegeben wird, kann das neue Modell mit Eleven Multilingual v2 fast 30 geschriebene Sprachen automatisch erkennen und Sprache darin mit beispielloser Authentizität erzeugen.

Gleichzeitig bleiben die einzigartigen Stimmmerkmale der sprechenden Person in allen Sprachen erhalten – einschließlich des ursprünglichen Akzents –, unabhängig davon, ob eine synthetische oder geklonte Stimme verwendet wird. Dadurch kann dieselbe Stimme Inhalte in 28 verschiedenen Sprachen zum Leben erwecken.

Dieser Rollout folgt auf die öffentliche Einführung von Professional KI-Stimme klonen für alle Kreativen auf der Plattform. Dieses Produkt-Update, das zusammen mit zusätzlichen Sicherheitsfunktionen verfügbar gemacht wurde, ermöglicht Nutzern, eine perfekte digitale Kopie ihrer eigenen Stimme zu erstellen – praktisch nicht vom Original zu unterscheiden. Mit der heutigen Veröffentlichung kann Ihre Stimme die fast 30 Sprachen des mehrsprachigen Modells sprechen.

Zu den nun unterstützten Sprachen gehören: Chinesisch, Koreanisch, Niederländisch, Türkisch, Schwedisch, Indonesisch, Filipino, Japanisch, Ukrainisch, Griechisch, Tschechisch, Finnisch, Rumänisch, Dänisch, Bulgarisch, Malaiisch, Slowakisch, Kroatisch, klassisches Arabisch und Tamil.

Sie ergänzen die bereits verfügbaren Sprachen einschließlich Englisch, Polnisch, Deutsch, Spanisch, Französisch, Italienisch, Hindi und Portugiesisch.

Nach den jüngsten Feature-Releases und fortlaufenden Verbesserungen der Plattform bestätigte ElevenLabs heute außerdem, dass die Plattform die Beta-Phase offiziell verlässt. Dieser Übergang unterstreicht das Engagement des Unternehmens, seinen mehr als 1 Million Nutzern weltweit zuverlässige und fortschrittliche Tools bereitzustellen.

ElevenLabs plant außerdem einen Mechanismus, mit dem Nutzer Stimmen auf der Plattform teilen und von der Entwicklung neuer Audios profitieren können. Das schafft Möglichkeiten für die Zusammenarbeit von Mensch und KI.

Mati Staniszewski, CEO und Mitgründer von ElevenLabs, kommentiert:

ElevenLabs wurde mit dem Ziel gegründet, alle Inhalte in jeder Sprache und mit jeder Stimme universell zugänglich zu machen. Mit der Veröffentlichung von Eleven Multilingual v2 sind wir diesem Ziel einen Schritt näher und machen Stimmen in menschlicher Qualität KI-Stimmen in jedem Dialekt verfügbar.

„Unsere Text-to-Speech-Tools schaffen fairere Voraussetzungen und bieten allen Kreativen hochwertige Funktionen für gesprochenes Audio. Diese Vorteile gelten nun für mehrsprachige Anwendungen in fast 30 Sprachen. Mit Hilfe von KI wollen wir künftig noch mehr Sprachen und Stimmen abdecken und die sprachlichen Barrieren von Inhalten abbauen. Wir bei ElevenLabs sind überzeugt, dass diese Fortschritte bei der Zugänglichkeit letztlich mehr Kreativität, Innovation und Vielfalt fördern.

Indem ElevenLabs Kosten und Ressourcen für die Erstellung hochwertiger Audioinhalte in mehreren Sprachen senkt, ermöglicht das Unternehmen Firmen und Kreativen, fantasievollere und besser zugängliche Inhalte zu produzieren, die über Kulturen und Sprachen hinweg ankommen.

Für unabhängige Spieleentwickler und Verlage eröffnet das Tool zur mehrsprachigen Sprachgenerierung neue Möglichkeiten, Spielerlebnisse und Audioinhalte für ein internationales Publikum zu übersetzen. So erreichen sie Spieler und Zuhörer in deren eigenen Sprachen, ohne Abstriche bei Qualität oder Genauigkeit des gesprochenen Audios.

Ebenso können Bildungseinrichtungen Lernenden sofort präzise Audioinhalte in Zielsprachen bereitstellen. Das stärkt Sprachverständnis und Aussprachefähigkeiten und berücksichtigt verschiedene Unterrichtsstile sowie Lernbedürfnisse internationaler Studierender.

Kreative aller Art können das Tool von ElevenLabs nutzen, um die Zugänglichkeit von Inhalten für Menschen mit Sehbeeinträchtigungen oder zusätzlichem Lernbedarf zu verbessern, indem sie visuelle Inhalte durch Sprache in mehreren Sprachen ergänzen.

Das im Januar 2023 vorgestellte erste Set an KI-Stimmtools umfasste die Möglichkeit, beliebigen Text mit einer Auswahl vorgefertigter, synthetischer Stimmen in Sprache umzuwandeln, sowie die Möglichkeit, die eigene Stimme zu klonen. Das Tool zur mehrsprachigen Sprachsynthese ist ein weiterer Schritt in der Mission von ElevenLabs, alle Inhalte in jeder Sprache und mit jeder Stimme universell zugänglich zu machen.

Die Technologie wird bereits in verschiedenen kreativen Bereichen und Branchen eingesetzt: Indie-Autoren erstellen Hörbücher, Nebenfiguren in Videospielen erhalten Stimmen, sehbeeinträchtigte Menschen erhalten Zugang zu geschriebenen Online-Inhalten, und der weltweit erste KI-Radiosender wird betrieben. ElevenLabs arbeitet zudem mit führenden Content-Creators und Studios zusammen, darunter KI-Video-Generatoren D-ID, einem der weltweit größten Hörbuchverlage Storytel, der frei zugänglichen Wissenschaftsvideoplattform ScienceCast deren Videogenerierungstool auf arXiv veröffentlichte wissenschaftliche Arbeiten zusammenfasst, der führenden globalen Plattform für Content-Creators TheSoul Publishing, herausragenden Spieleentwicklern wie Embark Studios und Paradox Interactive sowie der Medienplattform MNTN.

Kontakt
press@elevenlabs.io

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio