Przejdź do treści

Ten Głos Nie Istnieje - Generatywne Voice AI

Opublikowano

PosłuchajPosłuchaj tego artykułu

Ostatnio wydaje się, że wszyscy mówią o generatywnej AI. Duże modele językowe i modele zamieniające tekst na obraz, oparte na deep learningu, takie jak ChatGPT, Stable Diffusion, DALL-E i Midjourney, wywołały spore poruszenie w świecie technologii i poza nim. Wielu zalicza je do najważniejszych ostatnich osiągnięć AI. Niezależnie od tego, czy się z tym zgadzasz, panuje przekonanie, że pojawiło się coś niezwykle potężnego. W 2023 roku usłyszymy o modelach, które pomogą rysować lub tworzyć filmy. Tak jak pytamy o najlepszy najnowszy smartfon, wkrótce będziemy pytać o najlepszy najnowszy model bazowy. Jednak mimo całego tego entuzjazmu uważamy, że jeden obszar generatywnych mediów wciąż jest mocno niedoceniany: głos AI. To także obszar, w którym chcemy zostać liderem. W Eleven każdego dnia wykorzystujemy możliwości deep learningu, by zasilać nasze realistyczne narzędzia zamiany tekstu na mowę i Voice Cloning. Teraz wdrażamy też własny model generatywny, który pozwala projektować od podstaw całkiem nowe syntetyczne głosy.

Generator głosu — zaprojektuj głos

Nasi użytkownicy codziennie korzystają z platformy, by ożywiać swoje postacie — na potrzeby audiobooków, gier czy fan fiction. Zrozumieliśmy, że nasza obecna baza głosów jest zbyt mała, by każdy znalazł głos dopasowany do swoich treści, a zarazem dostępny wyłącznie dla niego. Rozwiązaniem było umożliwienie ci projektowania całkiem nowych syntetycznych głosów.

Pomysł na to pojawił się, gdy analizowaliśmy metody, których obecnie używamy do syntezy mowy i Voice Cloning. Oba procesy wymagają sposobu kodowania cech danego głosu. To osadzenia mówcy przenoszą tę tożsamość — są wektorową reprezentacją głosu mówcy. Odkryliśmy, że możemy próbkować rozkład osadzeń mówcy, trenując specjalny model, który pozwala tworzyć nieskończenie wiele nowych głosów.

Ponieważ nasi użytkownicy szukają głównie konkretnych cech mowy, musieliśmy dać im pewną kontrolę nad tym procesem. Rozszerzyliśmy model o warunkowanie, aby generował głosy na podstawie ich cech. Model pozwala teraz ustawić podstawowe parametry określające tożsamość nowego głosu: płeć, wiek, akcent, wysokość i styl mówienia. Innymi słowy, za każdym razem, gdy klikniesz „generuj”, nawet przy tych samych parametrach bazowych, otrzymasz całkiem nowy głos, który wcześniej nie istniał.

Poniżej znajdziesz przykłady głosów, które można zaprojektować w ten sposób:

00:00
00:00
00:00
00:00
00:00
00:00

„Design Voice” będzie dostępne na naszej platformie w lutym, jako część Voice Lab.

Do czego to służy?

Nasze narzędzia już potrafią tworzyć mowę równie realistyczną jak ludzka, a możliwości zastosowania sztucznych głosów będą tylko rosnąć. Wiele z tych nowych zastosowań, w tym nagrania dla serwisów informacyjnych lub reklam, będzie wymagać, by jeden głos był przypisany do konkretnej marki lub zastosowania i nie pojawiał się nigdzie indziej. Inne zastosowania, takie jak storytelling i gry wideo, stawiają na elastyczność i swobodę eksperymentowania od początku prac. Zamiast więc tworzyć ogromny zestaw wirtualnych mówców, chcemy oddać użytkownikom ostatnie słowo w wyborze głosów najlepiej pasujących do ich potrzeb.

Autorzy książek zyskują teraz nie tylko możliwość łatwego przekształcania swojej twórczości w audio, lecz także zachowują artystyczną kontrolę nad projektowaniem własnej narracji. Daje to odbiorcom nowe, ciekawe sposoby interakcji z publikacjami, a jednocześnie znacznie zwiększa liczbę książek, których będziemy mogli słuchać.

Wydawcy wiadomości coraz częściej wchodzą w audio, a wybór charakterystycznych głosów reprezentujących ich publikacje to ważne zadanie — wielu słuchaczy ceni formę równie mocno jak treść. Co równie ważne, wydawcy mogą mieć teraz pewność, że dany głos reprezentuje wyłącznie ich.

Twórcy gier mogą teraz użyczyć głosu wielu niemym dotąd postaciom NPC, mając pod ręką wszystkie potrzebne narzędzia. Mogą obniżyć koszty bez kompromisów w jakości, a także projektować głosy całkowicie unikalne dla tworzonych przez siebie wirtualnych światów.

Twórcy reklam potrzebują nałożonych głosów dopasowanych do konkretnych kampanii, więc możliwość projektowania trafnej, stworzonej w konkretnym celu narracji już na początku prac jest dużą zaletą. Mogą od razu eksperymentować z wieloma głosami i stylami wypowiedzi, bez angażowania dodatkowych zasobów.

Od twórców wszelkiego rodzaju treści audio i wideo po pracowników firm chcących nadać głos firmowej komunikacji — możliwości tworzenia angażującego audio, które jest zarówno unikalne, jak i dopasowane do konkretnego zastosowania, są teraz nieograniczone.

Etyczna AI

Podobnie jak Voice Cloning budzi obawy przed skutkami możliwego niewłaściwego użycia, coraz więcej osób martwi się, że upowszechnienie technologii AI zagrozi źródłom utrzymania profesjonalistów. W Eleven widzimy przyszłość, w której aktorzy głosowi mogą licencjonować swoje głosy do trenowania modeli mowy dla konkretnych zastosowań — w zamian za wynagrodzenie. Klienci i studia nadal będą chętnie korzystać z profesjonalnych talentów głosowych w swoich projektach, a AI po prostu skróci czas realizacji i da większą swobodę eksperymentowania oraz wyznaczania kierunku na wczesnym etapie prac. Technologia zmieni sposób projektowania i nagrywania mowy, ale to, że aktorzy głosowi nie muszą być fizycznie obecni na każdej sesji, daje im swobodę udziału w większej liczbie projektów jednocześnie, a także pozwala naprawdę uwiecznić ich głosy.

Cieszy nas też to, że wiele książek, wiadomości, niezależnych gier i innych treści, których autorów i twórców nie byłoby stać na koszty nagrań, stanie się dostępnych w innym medium. Ten szerszy dostęp daje w każdym przypadku szansę na dotarcie do większej publiczności.

W Eleven w pełni angażujemy się zarówno w poszanowanie praw własności intelektualnej, jak i wdrażanie zabezpieczeń przed możliwym niewłaściwym użyciem naszej technologii:

  • Współpracujemy tylko z klientami, którzy przestrzegają naszego Regulaminu zakazującego złośliwego użycia naszej technologii w celach, które można uznać za nielegalne lub szkodliwe;
  • Pracujemy też nad oznaczaniem znakiem wodnym każdego audio wygenerowanego przez nasz model, aby można było natychmiast ustalić jego pochodzenie;
  • Gdy używamy rozpoznawalnych głosów, robimy to w celach demonstracyjnych i w kontekstach, które nie powodują konfliktu interesów;
  • Jednocześnie chcemy wspierać właścicieli głosów i ich licencjodawców w dochodzeniu ich praw, a wszystkie znane naruszenia będą analizowane i odpowiednio rozpatrywane.

Co dalej — ulepsz własny głos

W przyszłości planujemy połączyć możliwości naszych modeli generowania głosu i Voice Cloning, aby użytkownicy mogli ulepszać własne głosy. Będzie można sklonować swój głos, a potem zmienić go tak, by uzyskać dowolny efekt. Jeśli obawiasz się, że twój naturalny styl mówienia jest trochę monotonny, dodasz mu więcej różnorodności. Jeśli naprawdę nie lubisz być nagrywany, zmienisz wynik tak, by brzmiał bardziej naturalnie. Każdy, kto musi stworzyć audio z własnym głosem — czy to nagraną wcześniej prezentację, czy wiadomość głosową — zrobi to jednym kliknięciem, korzystając z naszego zestawu narzędzi.

Szczęśliwego Nowego Roku

Wraz z końcem 2022 roku chcemy podziękować naszym użytkownikom beta za ciągłe zaangażowanie i opinie. Wiele funkcji, które rozwijamy, powstaje dzięki waszym uwagom i sugestiom. Cieszymy się, że jesteście z nami, i życzymy wam wszystkim szczęśliwego Nowego Roku.

Eleven Labs Beta
Przejdź tutaj, aby zarejestrować się na naszej platformie beta i wypróbować ją samodzielnie. Stale ją ulepszamy, a opinie użytkowników są dla nas bardzo cenne na tym wczesnym etapie.

Podobne artykuły

Twórz z najwyższej jakości audio AI