Wir stellen vor: Eleven Multilingual v1: Unser neues Sprachsynthesemodell
- Veröffentlicht
AnhörenArtikel anhören
Heute stellen wir Eleven Multilingual v1 vor – unser fortschrittliches Sprachsynthesemodell mit Unterstützung für sieben neue Sprachen: Französisch, Deutsch, Hindi, Italienisch, Polnisch, Portugiesisch und Spanisch. Auf Grundlage der Forschung hinter Eleven Monolingual v1 nutzt unser aktueller Deep-Learning-Ansatz mehr Daten, mehr Rechenleistung und neue Techniken in einem immer ausgefeilteren Modell. Es versteht sprachliche Nuancen und liefert emotional ausdrucksstarke Ergebnisse. Dieser Fortschritt erweitert die kreativen Möglichkeiten für Kreative, Spieleentwickler und Verlage. Er ebnet den Weg für generative Medien, mit denen sich stärker lokalisierte, zugängliche und einfallsreiche Inhalte erstellen lassen.
Das neue Modell ist in allen Abonnements verfügbar und kann jetzt auf unserer Beta-Plattform getestet werden.
Wählen Sie es einfach im neu hinzugefügten Dropdown-Menü des Bereichs „Speech Synthesis“ aus.
Forschungsüberblick
Wie sein Vorgänger basiert das neue Modell vollständig auf unserer eigenen Forschung. Es behält alle Stärken bei, die Eleven Monolingual v1 zu einem hervorragenden Tool für Storytelling gemacht haben, etwa die Fähigkeit, die Sprechweise an den Kontext anzupassen sowie Absicht und Emotionen hyperrealistisch zu vermitteln. Durch Training mit mehrsprachigen Daten wurden diese Funktionen nun auf die neu unterstützten Sprachen ausgeweitet.
Eine bemerkenswerte Funktion des Modells ist seine Fähigkeit, mehrsprachigen Text zu erkennen und passend wiederzugeben. Sie können jetzt Sprache in mehreren Sprachen mit einem einzigen Prompt generieren und dabei die einzigartigen Stimmeigenschaften jedes Sprechers erhalten. Für optimale Ergebnisse empfehlen wir einen Prompt in nur einer Sprache. Das Modell arbeitet zwar bereits recht gut mit mehreren Sprachen gleichzeitig, benötigt aber weitere Verbesserungen.
Das neue Modell ist mit weiteren VoiceLab-Funktionen kompatibel, etwa Instant KI-Stimme klonen und Voice Design. Alle erstellten Stimmen behalten voraussichtlich die meisten ihrer ursprünglichen Spracheigenschaften in allen Sprachen bei, einschließlich ihres ursprünglichen Akzents.
Das Modell hat jedoch bekannte Einschränkungen: Zahlen, Akronyme und Fremdwörter werden bei einem Prompt in einer anderen Sprache manchmal auf Englisch ausgesprochen. So können etwa die Zahl „11“ oder das Wort „radio“ in einem spanischen Prompt englisch ausgesprochen werden. Während wir an Verbesserungen arbeiten, empfehlen wir, Akronyme und Zahlen in der Zielsprache auszuschreiben.
Demokratisierung von Stimmen
ElevenLabs entstand aus dem Wunsch, alle Inhalte in jeder Sprache und mit jeder Stimme weltweit zugänglich zu machen. Unser Team kommt aus ganz Europa, Asien und den USA. Da unser Team und die Welt immer mehrsprachiger werden, stehen wir noch geschlossener hinter der Vision, menschenähnliche KI-Stimmen in jeder Sprache verfügbar zu machen.
Die neueste Version unseres Text-to-Speech (TTS)-Modells ist nur der erste Schritt, um diese Vision zu verwirklichen. Mit menschenähnlichen KI-Stimmen können Nutzer und Unternehmen Audiocontent nach ihren Bedürfnissen, Prioritäten und Vorlieben erstellen und anpassen. Das kann gleiche Chancen für Kreative, kleine Unternehmen und unabhängige Künstler schaffen. Mit KI-Audio können Nutzer hochwertige Klangerlebnisse entwickeln, die mit denen größerer, besser ausgestatteter Organisationen mithalten.
Diese Vorteile erstrecken sich nun auch auf mehrsprachige, multikulturelle und pädagogische Anwendungen. Nutzer, Unternehmen und Institutionen können authentisches Audio produzieren, das ein breiteres Publikum erreicht. Mit einer großen Auswahl an Stimmen, Akzenten und Sprachen hilft KI, kulturelle Unterschiede zu überbrücken und globales Verständnis zu fördern. Bei Eleven glauben wir, dass diese neue Zugänglichkeit letztlich mehr Kreativität, Innovation und Vielfalt fördert.
Content-Ersteller, die unterschiedliche Zielgruppen erreichen möchten, verfügen jetzt über die Tools, kulturelle Unterschiede zu überbrücken und Inklusion zu fördern.
Spieleentwickler und Verlage können immersive, lokalisierte Erlebnisse für internationale Zielgruppen schaffen. Sie überwinden Sprachbarrieren und verbinden sich mit Spielern und Zuhörern, um Engagement und Effizienz zu maximieren – ohne Einbußen bei Qualität oder Genauigkeit.
Bildungseinrichtungen können jetzt Audiocontent für verschiedene Nutzer in deren Zielsprachen erstellen. Das stärkt Sprachverständnis und Aussprachefähigkeiten und berücksichtigt unterschiedliche Lehrstile und Lernbedürfnisse.
Einrichtungen für Barrierefreiheit können Menschen mit Sehbeeinträchtigungen oder Lernschwierigkeiten weiter unterstützen. Sie ermöglichen es ihnen, weniger zugängliche Ressourcen einfach in ein Medium umzuwandeln, das ihren Bedürfnissen in Inhalt und Form entspricht.
Wir freuen uns darauf zu sehen, wie unsere heutigen und künftigen Kreativen und Entwickler die Grenzen des Möglichen erweitern.




