Eleven v3 är nu allmänt tillgänglig
- Skriven av
- Joe Reeve
- Publicerad
LyssnaLyssna på den här artikeln
Eleven v3, vår mest avancerade Text to Speech-modell, har nu lämnat Alpha och är allmänt tillgänglig.
Sedan Alpha-versionen släpptes har vi fortsatt att förfina modellen. Två viktiga förbättringar:
Stabilare. I tester föredrog användarna den nya versionen framför den tidigare Alpha-versionen i 72 % av fallen.
Mer träffsäker. Vi har avsevärt förbättrat hur modellen hanterar siffror, symboler och specialnotation på olika språk.
Förbättrad träffsäkerhet
Text to Speech-modeller måste tolka det du skriver och avgöra hur det ska uttalas. Samma symboler kan betyda olika saker i olika sammanhang.
Tänk dig ett telefonnummer: "+49 170 9876543"
I vissa fall läste våra modeller detta som "plus fyrtionio, etthundrasjuttio, nio miljoner åttahundrasjuttiosextusen femhundrafyrtiotre" – och tolkade siffrorna som stora tal i stället för en sifferföljd. Rätt uppläsning är "plus fyra nio, ett sju noll, nio åtta sju sex fem fyra tre."
Den här typen av fel förekom inom flera kategorier – sportresultat, kemiska formler, valutor och koordinater – överallt där modellerna behövde tolka symboler och avgöra hur de skulle uttalas.
Vi testade mot ett internt riktmärke som omfattar 27 kategorier på 8 språk.
Totalt: 68 % färre fel. Felfrekvensen sjönk från 15,3 % till 4,9 %.
Felfrekvens per kategori:
Förbättringarna är störst i kategorier där sammanhanget avgör tolkningen – där ett kolon kan ange ett sportresultat, en tid eller ett bildförhållande beroende på texten runtomkring.
Exempel
Valutor — rätt storleksordning:
Indata: ¥250,000
Före: 25 000 yen
Efter: 250 000 yen
Kemiska formler — symbolerna bevaras korrekt:
Indata: SO₂
Före: "svavel dubbel" (förvrängt)
Efter: "S O två"
Sportresultat — tolkning utifrån sammanhanget:
Indata: Slutresultat: 102-98
Före: "etthundratvå minus nittioåtta"
Efter: "etthundratvå mot nittioåtta"
Tillgänglighet
Eleven v3 är nu allmänt tillgänglig på alla plattformar.




