Zum Inhalt springen

Eleven v3 ist jetzt allgemein verfügbar

Verfasst von
Joe Reeve
Veröffentlicht

AnhörenArtikel anhören

Eleven v3, unser fortschrittlichstes Text to Speech-Modell, ist jetzt nicht mehr in der Alpha-Phase und allgemein verfügbar.

Seit der Alpha-Veröffentlichung haben wir das Modell weiter optimiert. Zwei wesentliche Verbesserungen:

Stabiler. In Tests bevorzugten Nutzer die neue Version in 72 % der Fälle gegenüber der vorherigen Alpha-Version.

Präziser. Wir haben deutlich verbessert, wie das Modell Zahlen, Symbole und spezielle Schreibweisen in verschiedenen Sprachen verarbeitet.

Verbesserte Genauigkeit

Text to Speech-Modelle müssen interpretieren, was Sie schreiben, und entscheiden, wie sie es aussprechen. Dieselben Symbole können je nach Kontext unterschiedliche Bedeutungen haben.

Betrachten Sie eine Telefonnummer: "+49 170 9876543"

In einigen Fällen lasen unsere Modelle dies als „plus neunundvierzig, einhundertsiebzig, neun Millionen achthundertsechsundsiebzigtausendfünfhundertdreiundvierzig“ – und interpretierten die Ziffern als große Zahlen statt als Ziffernfolge. Die korrekte Aussprache lautet „plus vier neun, eins sieben null, neun acht sieben sechs fünf vier drei“.

Solche Fehler traten in verschiedenen Kategorien auf – bei Sportergebnissen, chemischen Formeln, Währungen und Koordinaten –, überall dort, wo die Modelle Symbole interpretieren und entscheiden mussten, wie sie sie aussprechen.

Wir haben anhand eines internen Benchmarks mit 27 Kategorien in 8 Sprachen getestet.

Insgesamt: 68 % weniger Fehler. Die Fehlerquote sank von 15,3 % auf 4,9 %.

Fehlerquote nach Kategorie:

Vorher
Chemische Formeln
45,6 %
Telefonnummern
16,9 %
URLs / E-Mails
45,6 %
ISBNs
17,9 %
Kfz-Kennzeichen
14,4 %
Mathematische Ausdrücke
23,8 %
Geografische Koordinaten
46,2 %
Nachher
Chemische Formeln
0,6 %
Telefonnummern
0,6 %
URLs / E-Mails
3,9 %
ISBNs
0,0 %
Kfz-Kennzeichen
1,2 %
Mathematische Ausdrücke
6,9 %
Geografische Koordinaten
17,5 %
Fehlerreduzierung
Chemische Formeln
99 %
Telefonnummern
99 %
URLs / E-Mails
91 %
ISBNs
100 %
Kfz-Kennzeichen
91 %
Mathematische Ausdrücke
71 %
Geografische Koordinaten
62 %

Die Verbesserungen sind besonders deutlich in Kategorien, in denen der Kontext die Interpretation bestimmt – wenn ein Doppelpunkt je nach umgebendem Text etwa ein Sportergebnis, eine Uhrzeit oder ein Seitenverhältnis anzeigen kann.

Beispiele

Währungen — korrekte Größenordnung:

Eingabe:  ¥250,000

Vorher: 25.000 Yen

Nachher:  250.000 Yen

Chemische Formeln — Symbole korrekt beibehalten:

Eingabe:  SO₂

Vorher: „Schwefel doppelt“ (fehlerhaft)

Nachher:  „S O zwei“

Sportergebnisse — kontextabhängige Interpretation:

Eingabe:  Endstand: 102-98

Vorher: „einhundertzwei minus achtundneunzig“

Nachher:  „einhundertzwei zu achtundneunzig“

Verfügbarkeit

Eleven v3 ist jetzt auf allen Plattformen allgemein verfügbar.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio