Przejdź do treści

Eleven v3 jest już ogólnie dostępny

Opublikowano

PosłuchajPosłuchaj tego artykułu

Eleven v3, nasz najbardziej zaawansowany model Text to Speech, wyszedł z fazy Alpha i jest już ogólnie dostępny.

Od premiery Alpha nadal udoskonalamy model. Dwie kluczowe zmiany:

Większa stabilność. W testach użytkownicy wybierali nową wersję w 72% przypadków zamiast poprzedniej wersji Alpha.

Większa dokładność. Znacznie poprawiliśmy obsługę liczb, symboli i specjalistycznej notacji w różnych językach.

Poprawa dokładności

Modele Text to Speech muszą interpretować to, co piszesz, i zdecydować, jak to powiedzieć. Te same symbole mogą znaczyć różne rzeczy w zależności od kontekstu.

Weźmy numer telefonu: "+49 170 9876543"

W niektórych przypadkach nasze modele odczytywały go jako „plus czterdzieści dziewięć, sto siedemdziesiąt, dziewięć milionów osiemset siedemdziesiąt sześć tysięcy pięćset czterdzieści trzy” — traktując cyfry jak duże liczby, a nie ciąg cyfr. Poprawny odczyt to „plus cztery dziewięć, jeden siedem zero, dziewięć osiem siedem sześć pięć cztery trzy”.

Takie błędy pojawiały się w różnych kategoriach — wynikach sportowych, wzorach chemicznych, walutach, współrzędnych — wszędzie tam, gdzie modele musiały interpretować symbole i zdecydować, jak je odczytać.

Testowaliśmy model na wewnętrznym benchmarku obejmującym 27 kategorii w 8 językach.

Łącznie: liczba błędów spadła o 68%. Wskaźnik błędów zmalał z 15,3% do 4,9%.

Wskaźnik błędów według kategorii:

Przed
Wzory chemiczne
45.6%
Numery telefonów
16.9%
Adresy URL / e-maile
45.6%
Numery ISBN
17.9%
Tablice rejestracyjne
14.4%
Wyrażenia matematyczne
23.8%
Współrzędne geograficzne
46.2%
Po
Wzory chemiczne
0.6%
Numery telefonów
0.6%
Adresy URL / e-maile
3.9%
Numery ISBN
0.0%
Tablice rejestracyjne
1.2%
Wyrażenia matematyczne
6.9%
Współrzędne geograficzne
17.5%
Spadek liczby błędów
Wzory chemiczne
99%
Numery telefonów
99%
Adresy URL / e-maile
91%
Numery ISBN
100%
Tablice rejestracyjne
91%
Wyrażenia matematyczne
71%
Współrzędne geograficzne
62%

Poprawa jest największa w kategoriach, w których o interpretacji decyduje kontekst — dwukropek może oznaczać wynik sportowy, godzinę lub proporcje obrazu, zależnie od otaczającego tekstu.

Przykłady

Waluty — poprawna wartość:

Dane wejściowe:  ¥250,000

Przed: 25,000 jenów

Po:  250,000 jenów

Wzory chemiczne — symbole zachowane poprawnie:

Dane wejściowe:  SO₂

Przed: „podwójna siarka” (błędnie)

Po:  „S O dwa”

Wyniki sportowe — interpretacja uwzględniająca kontekst:

Dane wejściowe:  Wynik końcowy: 102-98

Przed: „sto dwa minus dziewięćdziesiąt osiem”

Po:  „sto dwa do dziewięćdziesięciu ośmiu”

Dostępność

Eleven v3 jest już ogólnie dostępny na wszystkich platformach.

Podobne artykuły

Twórz z najwyższej jakości audio AI