Przejdź do treści

ElevenLabs wychodzi z wersji beta i wydaje Eleven Multilingual v2 — podstawowy model mowy AI dla prawie 30 języków

Opublikowano

PosłuchajPosłuchaj tego artykułu

  • Platforma głosowej AI ElevenLabs robi radykalny krok naprzód w eliminowaniu barier językowych w treściach, wprowadzając nowy bazowy model głębokiego uczenia obsługujący 28 języków — Eleven Multilingual v2
  • To rozwiązanie pozwoli firmom medialnym, twórcom gier, wydawcom i niezależnym twórcom na całym świecie znacząco zwiększyć dostępność swoich treści
  • Nowe możliwości, wprowadzone po serii funkcji i ulepszeń od startu platformy w styczniu, oznaczają też oficjalny koniec fazy beta firmy
  • Misją ElevenLabs jest zapewnienie powszechnego dostępu do wszystkich treści w każdym języku i każdym głosem

ElevenLabs, światowy lider oprogramowania głosowej AI, wprowadza dziś nowy wielojęzyczny model generowania głosu, który potrafi dokładnie tworzyć „bogate emocjonalnie” audio AI w niemal 30 językach.

Rozwiązanie, oparte wyłącznie na naszych badaniach, pozwoli twórcom przygotowywać zlokalizowane treści audio na rynki międzynarodowe w Europie, Azji i na Bliskim Wschodzie. Przez ostatnie 18 miesięcy ElevenLabs analizowało cechy ludzkiej mowy, tworzyło nowe mechanizmy rozumienia kontekstu i przekazywania emocji w generowanej mowie, a także syntezowało nowe, unikalne głosy.

W Eleven Multilingual v2, gdy wpiszesz tekst na platformie ElevenLabs do zamiany tekstu na mowę, nowy model automatycznie rozpozna niemal 30 języków pisanych i wygeneruje w nich mowę z niespotykaną dotąd autentycznością.

Jednocześnie, niezależnie od tego, czy używasz głosu syntetycznego, czy sklonowanego, unikalne cechy głosu mówcy pozostają zachowane we wszystkich językach, w tym jego oryginalny akcent. Dzięki temu jednym głosem możesz ożywiać treści w 28 różnych językach.

To wdrożenie następuje po udostępnieniu publicznie Professional Voice Cloning wszystkim twórcom na platformie. Ta aktualizacja produktu, udostępniona wraz z dodatkowymi funkcjami bezpieczeństwa i zabezpieczeń, pozwala użytkownikom stworzyć idealną cyfrową kopię własnego głosu — niemal nie do odróżnienia od oryginału. Dzisiejsza premiera oznacza, że twój głos będzie mógł mówić w niemal 30 językach obsługiwanych przez model wielojęzyczny.

Obsługiwane języki to teraz: chiński, koreański, niderlandzki, turecki, szwedzki, indonezyjski, filipiński, japoński, ukraiński, grecki, czeski, fiński, rumuński, duński, bułgarski, malajski, słowacki, chorwacki, klasyczny arabski i tamilski.

Dołączają one do dostępnych wcześniej języków, w tym angielskiego, polskiego, niemieckiego, hiszpańskiego, francuskiego, włoskiego, hindi i portugalskiego.

Po ostatnich premierach funkcji i ciągłych ulepszeniach platformy ElevenLabs potwierdza dziś również oficjalne wyjście z fazy beta. To ważny moment w dążeniu firmy do zapewniania niezawodnych, nowoczesnych narzędzi ponad milionowi użytkowników na całym świecie.

W przyszłości ElevenLabs planuje wprowadzić mechanizm, który pozwoli użytkownikom udostępniać głosy na platformie i korzystać z rozwoju nowego audio, otwierając możliwości współpracy ludzi z AI.

Mati Staniszewski, CEO i współzałożyciel ElevenLabs, komentuje:

ElevenLabs powstało z marzenia, by wszystkie treści były powszechnie dostępne w każdym języku i każdym głosem. Premiera Eleven Multilingual v2 przybliża nas o krok do spełnienia tego marzenia i udostępnienia wysokiej jakości głosów AI w każdym dialekcie.

„Nasze narzędzia do zamiany tekstu na mowę wyrównują szanse i dają wszystkim twórcom dostęp do wysokiej jakości mowy. Te korzyści obejmują teraz wielojęzyczne zastosowania w niemal 30 językach. Z czasem mamy nadzieję objąć pomocą AI jeszcze więcej języków i głosów oraz usunąć bariery językowe w treściach. W ElevenLabs wierzymy, że ten wzrost dostępności ostatecznie pobudzi kreatywność, innowacyjność i różnorodność.

Obniżając koszty i nakłady potrzebne do tworzenia wysokiej jakości treści audio w wielu językach, ElevenLabs umożliwia firmom i twórcom przygotowywanie bardziej pomysłowych, dostępnych treści, które trafiają do odbiorców z różnych kultur i języków.

Dla niezależnych twórców gier i wydawców narzędzie do wielojęzycznego generowania mowy otwiera nowe możliwości tłumaczenia gier i treści audio dla międzynarodowych odbiorców. Pozwala dotrzeć do graczy i słuchaczy w ich własnych językach bez kompromisów w jakości i dokładności mowy.

Podobnie instytucje edukacyjne mogą teraz natychmiast udostępniać uczącym się dokładne treści audio w językach docelowych, wspierając rozumienie języka i wymowę, a także różne style nauczania i potrzeby uczniów z zagranicy.

Twórcy każdego rodzaju mogą używać narzędzia ElevenLabs, by zwiększać dostępność treści dla osób z wadami wzroku lub dodatkowymi potrzebami edukacyjnymi, uzupełniając materiały wizualne mową w wielu językach.

Pierwszy zestaw narzędzi głosowych AI, pokazany w styczniu 2023 roku, umożliwiał zamianę dowolnego tekstu na mowę za pomocą gotowych głosów syntetycznych oraz tworzenie klonu własnego głosu. Narzędzie do wielojęzycznej syntezy mowy to kolejny krok w realizacji misji ElevenLabs: zapewnić powszechny dostęp do wszystkich treści w każdym języku i każdym głosem.

Technologia już zyskała uznanie w wielu branżach kreatywnych i sektorach. Pozwala niezależnym autorom tworzyć audiobooki, użyczać głosu postaciom drugoplanowym w grach wideo, wspiera osoby z wadami wzroku w dostępie do pisanych treści online oraz zasila pierwszą na świecie stację radiową AI. ElevenLabs współpracuje też z czołowymi twórcami treści i studiami, w tym z generatorami wideo AI D-ID, jednym z największych wydawców audiobooków na świecie Storytel, platformą otwartych filmów naukowych ScienceCast , której narzędzie do generowania wideo streszcza publikacje naukowe opublikowane w arXiv, wiodącą globalną platformą dla twórców treści TheSoul Publishing, świetnymi twórcami gier, takimi jak Embark Studios i Paradox Interactive, oraz platformą medialną MNTN.

Kontakt
press@elevenlabs.io

Podobne artykuły

Twórz z najwyższej jakości audio AI