Przejdź do treści

Przedstawiamy Eleven Multilingual v1: Nasz nowy model syntezy mowy

Opublikowano

PosłuchajPosłuchaj tego artykułu

Dziś z radością prezentujemy Eleven Multilingual v1 — nasz zaawansowany model syntezy mowy obsługujący siedem nowych języków: francuski, niemiecki, hindi, włoski, polski, portugalski, i hiszpański. Bazując na badaniach, które napędzały Eleven Monolingual v1, nasze obecne podejście do deep learningu wykorzystuje więcej danych, większą moc obliczeniową i nowe techniki w coraz bardziej zaawansowanym modelu. Rozumie on niuanse tekstu i zapewnia bogatą emocjonalnie wypowiedź. To poszerza twórcze możliwości twórców, deweloperów gier i wydawców oraz otwiera drogę do generowania bardziej lokalnych, dostępnych i kreatywnych treści za pomocą mediów generatywnych.

Nowy model jest dostępny we wszystkich planach subskrypcji. Możesz wypróbować go już teraz na naszej platformie Beta.

Aby z niego skorzystać, wybierz go z nowo dodanej listy rozwijanej w panelu Speech Synthesis.

O badaniach

Podobnie jak poprzednik, nowy model opiera się wyłącznie na naszych własnych badaniach. Zachowuje wszystkie zalety, które sprawiły, że Eleven Monolingual v1 jest świetnym narzędziem do opowiadania historii — na przykład dostosowuje sposób wypowiedzi do kontekstu i hiperrealistycznie oddaje intencje oraz emocje. Dzięki trenowaniu na danych wielojęzycznych funkcje te rozszerzyliśmy na nowo obsługiwane języki.

Ważną cechą modelu jest zdolność do rozpoznawania tekstu wielojęzycznego i odpowiedniego jego wypowiadania. Możesz teraz generować mowę w wielu językach za pomocą jednego promptu i zachować przy tym unikalne cechy głosu każdego mówcy. Aby uzyskać najlepsze wyniki, zalecamy prompt w jednym języku. Model już całkiem dobrze radzi sobie z kilkoma językami naraz, ale wymaga jeszcze ulepszeń.

Nowy model jest zgodny z innymi funkcjami VoiceLab, np. Instant Voice Cloning i Voice Design. Wszystkie utworzone głosy powinny zachować większość pierwotnych cech mowy we wszystkich językach, w tym swój oryginalny akcent.

Model ma jednak znane ograniczenia: liczby, akronimy i obce słowa są czasem wymawiane po angielsku, gdy prompt jest w innym języku. Na przykład liczba „11” lub słowo „radio” wpisane w hiszpańskim prompcie mogą zostać wymówione po angielsku. Pracujemy nad poprawkami, a na razie zalecamy zapisywać akronimy i liczby słownie w języku docelowym.

Demokratyzacja głosu

ElevenLabs powstało z marzenia, by wszystkie treści były dostępne dla każdego — w każdym języku i każdym głosem. Członkowie naszego zespołu pochodzą z Europy, Azji i USA. Wraz z tym, jak nasz zespół i świat stają się coraz bardziej wielojęzyczne, jeszcze mocniej łączy nas wizja udostępnienia wysokiej jakości głosów AI w każdym języku.

Najnowsza wersja naszego modelu Text-to-Speech (TTS) to dopiero pierwszy krok ku realizacji tej wizji. Dzięki wysokiej jakości głosom AI użytkownicy i firmy mogą tworzyć i dostosowywać treści audio do swoich potrzeb, priorytetów i preferencji. Już teraz pomaga to wyrównywać szanse twórców, małych firm i niezależnych artystów. Korzystając z mocy audio AI, mogą oni tworzyć wysokiej jakości doświadczenia dźwiękowe porównywalne z tymi, które oferują większe organizacje z większymi zasobami.

Te korzyści obejmują teraz także zastosowania wielojęzyczne, wielokulturowe i edukacyjne. Użytkownicy, firmy i instytucje mogą tworzyć autentyczne audio, które trafia do szerszego grona odbiorców. Szeroki wybór głosów, akcentów i języków pomaga AI łączyć kultury i promować globalne zrozumienie. W Eleven wierzymy, że ta nowa dostępność sprzyja większej kreatywności, innowacyjności i różnorodności.

Twórcy treści chcący dotrzeć do różnorodnych odbiorców mają teraz narzędzia, by łączyć kultury i wspierać inkluzywność.

Deweloperzy gier i wydawcy mogą tworzyć immersyjne, zlokalizowane doświadczenia dla odbiorców z całego świata — przekraczać bariery językowe, łączyć się z graczami i słuchaczami oraz zwiększać zaangażowanie i efektywność bez utraty jakości czy dokładności.

Instytucje edukacyjne mogą teraz tworzyć treści audio dla różnych użytkowników w ich docelowych językach, wspierając rozumienie języka i umiejętności wymowy, a także odpowiadając na różne style nauczania i potrzeby edukacyjne.

Instytucje działające na rzecz dostępności mogą jeszcze lepiej wspierać osoby z wadami wzroku lub trudnościami w nauce, ułatwiając im przekształcanie mniej dostępnych materiałów w formę dopasowaną do ich potrzeb — zarówno pod względem treści, jak i formy.

Nie możemy się doczekać, aż obecni i przyszli twórcy oraz deweloperzy przesuną granice możliwości!

Podobne artykuły

Twórz z najwyższej jakości audio AI