Przejdź do treści

Konwersja głosu

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Czym jest konwersja głosu?

Konwersja głosu pozwala przekształcić głos jednej osoby w głos innej. Wykorzystuje proces zwany klonowaniem głosu do zakodowania głosu docelowego — czyli głosu, na który konwertujemy — i wygenerowania tej samej wypowiedzi w sposób zgodny z tożsamością docelowego mówcy, ale z zachowaniem oryginalnej intonacji.

Zastosowania

Wysokiej jakości konwersja głosu i klonowanie głosu mogą zrewolucjonizować sposób tworzenia, udostępniania i odbioru treści w wielu branżach. Mogą skrócić czas produkcji, obniżyć jej koszty oraz pozwolić osobom udostępniającym głosy do trenowania algorytmów konwersji zarabiać pasywnie.

  • W filmie aktorzy mogliby udostępniać producentom bazy swoich głosów, by tworzyć ścieżki audio bez podróży na plan lub do studia;
  • źle wypowiedziane kwestie można byłoby znacznie skuteczniej nagrywać ponownie w postprodukcji;
  • technologia może też wiernie odtwarzać głosy postaci historycznych w fikcyjnych scenariuszach lub przywracać do życia zmarłych aktorów;
  • twórcy gier wideo skorzystają z niej podobnie: poprawianie kwestii czy eksperymentowanie będzie możliwe na miejscu, bez fizycznej obecności aktora podczas nagrania;
  • w medycynie pacjenci, którzy stracili zdolność mówienia, na przykład w wyniku leczenia raka gardła, mogą znów komunikować się własnym głosem;
  • wirtualni asystenci mogą stać się bardziej osobisti, ponieważ użytkownikom domowym może przychodzić naturalniej rozmawiać na przykład głosem bliskiej osoby niż głosem wirtualnego nieznajomego;
  • z kolei branża reklamowa może skorzystać na syntetycznych nałożonych głosach, które brzmią równie naturalnie jak ludzki głos, a jednocześnie pozwalają uniknąć kwestii praw do głosu i tantiem. Jeśli jednak potrzebny jest rozpoznawalny głos, producenci reklam również mogą wykorzystać tę technologię do klonowania głosu konkretnego aktora za jego zgodą, bez konieczności jego obecności na długich sesjach nagraniowych;
  • branże audiobooków i podcastów to kolejne rozwijające się obszary, w których klonowanie i konwersja głosu mogą usprawnić tworzenie i edycję angażujących treści.

Konwersja głosu ElevenLabs

Choć w ElevenLabs tworzymy oprogramowanie do konwersji głosu jako część naszego pakietu narzędzi, badania nad klonowaniem głosu i syntezą mowy służą przede wszystkim rozwojowi naszego głównego produktu, który planujemy udostępnić na początku przyszłego roku: automatycznego narzędzia do dubbingu z zachowaniem tożsamości mówcy.

Naszym celem jest udostępnienie wszystkich treści mówionych w różnych językach, głosem oryginalnego mówcy — jednym kliknięciem. Wyobraź sobie edukacyjny film na YouTube po angielsku. Jeśli ktoś mówi tylko po hiszpańsku, to problem — nawet jeśli temat by go zainteresował, gdyby znał język. Jasne, napisy są rozwiązaniem, ale chcemy zaoferować znacznie bardziej angażujący i przyjemny sposób odbioru treści. Chcemy móc wygenerować tę samą osobę, która naturalnie przekazuje ten sam komunikat po hiszpańsku jak native speaker, nawet jeśli w rzeczywistości nie mówi w tym języku.

W tym pomaga nam klonowanie głosu: pozwala zachować tożsamość mówcy — brzmienie jego głosu. Używamy go, by generować nowe wypowiedzi w innym języku, tak aby brzmiały, jakby mówiła je ta sama osoba.

Konwersja głosu jest potrzebna, bo chcemy zachować emocje, intencję i sposób mówienia, by w pełni angażować odbiorcę. Trenujemy solidne modele wielojęzyczne, które pozwalają analizować wypowiedzi w języku źródłowym i przenosić je do języka docelowego z właściwą intonacją.

Proces

Aby przekształcić głos jednej osoby w głos innej, czyli mowę źródłową w mowę docelową, potrzebujemy algorytmu, który wyrazi treść mowy źródłowej za pomocą cech mowy docelowej. Dobrą analogią są aplikacje do zamiany twarzy, które pozwalają połączyć swoją twarz z twarzą innej osoby i stworzyć obraz obu w jednym.

W tym celu bierze się obraz twarzy i odwzorowuje jej cechy. Punkty w poniższym przykładzie właśnie to pokazują: wyznaczają granice, w których renderowane byłyby rysy drugiej twarzy.

W konwersji głosu potrzebujemy sposobu, by algorytm zakodował właściwości mowy docelowej. Algorytm trenuje się na zbiorze danych zawierającym wiele przykładów tej mowy. Rozkłada próbki do podstawowego poziomu — można powiedzieć, do „atomów” mowy. Mowa składa się ze zdań. Zdania składają się ze słów. Słowa składają się z fonemów, które określają cechy mowy docelowej. To podstawowy poziom, na którym działa algorytm.

Sedno konwersji głosu polega na odtworzeniu treści mowy źródłowej za pomocą fonemów mowy docelowej. Wiąże się to jednak z kompromisem, podobnie jak w przykładzie z zamianą twarzy: im więcej znaczników wykorzystasz do odwzorowania cech twarzy, tym więcej ograniczeń nakładasz na twarz umieszczaną w ich obrębie. Mniej znaczników oznacza mniej ograniczeń. Tak samo jest z konwersją głosu. Im większy priorytet nadajemy mowie docelowej, tym bardziej ryzykujemy utratę zgodności z mową źródłową. Jeśli zaś nadamy jej zbyt mały priorytet, możemy utracić wiele z tego, co nadaje tej mowie charakter. Na przykład gdybyśmy chcieli odtworzyć nagranie osoby krzyczącej ze złością głosem Morgana Freemana, pojawiłby się problem. Jeśli zbyt mocno skupimy się na emocjach mowy źródłowej, stracimy wrażenie, że naprawdę mówi Morgan Freeman. Jeśli za bardzo podkreślimy jego sposób mówienia, utracimy emocjonalny ładunek mowy źródłowej.

Etyka

Kwestie etyczne związane z klonowaniem głosu wymagają uwagi, ponieważ coraz więcej osób obawia się możliwości nadużycia tej technologii. W 2020 roku oszuści wykorzystali audio deepfake, podszywając się w rozmowie telefonicznej pod CEO, aby zatwierdzić przelew bankowy na 35 milionów dolarów. Technologia, która potrafi przekonująco sprawić wrażenie, że ktoś powiedział coś, czego nie powiedział, naturalnie budzi obawy przed jej użyciem do dezinformacji, zniesławienia lub oszustwa. Podobnie konwersja głosu rodzi ważne pytania o naruszenie praw autorskich, jeśli pozwala użytkownikom czerpać zyski z treści wygenerowanych bez zgody właścicieli głosów.

W ElevenLabs chcemy zrobić wszystko, co możemy, aby nasza technologia nie była wykorzystywana w złych celach, i wdrażamy zabezpieczenia chroniące przed zagrożeniami:

  • współpracujemy tylko z klientami przestrzegającymi naszych Warunków, które zabraniają złośliwego użycia naszej technologii w celu dezinformacji, zniesławienia, oszustwa lub w jakimkolwiek innym celu uznanym za nielegalny albo szkodliwy;
  • syntetyczne treści wideo tworzone przez Eleven zawierają wyraźny znak wodny informujący, że zostały wygenerowane przez AI. Treści audio zawierają jasny opis pliku. Gdy używamy rozpoznawalnych głosów, robimy to w celach demonstracyjnych i w kontekstach, które nie powodują konfliktu interesów;
  • jednocześnie staramy się wspierać właścicieli głosów i ich licencjodawców w dochodzeniu ich praw.
  • Jeśli masz pomysły, jak możemy poprawić nasze podejście, napisz do nas na adres ethics@elevenlabs.io

Wierzymy, że obawa przed nadużyciami nie powinna być głównym czynnikiem kształtującym nasze podejście do potężnych nowych technologii. Zamiast tego powinniśmy zadbać o wdrożenie odpowiednich zabezpieczeń już na etapie rozwoju, aby ograniczyć ryzyko szkód i jak najlepiej wykorzystać potencjał, jaki technologia daje całej społeczności.

Przyszłość

Konwersja i klonowanie głosu mogą zrewolucjonizować film, telewizję, tworzenie treści, rozwój gier, podcasty i audiobooki, a także branżę reklamową. Ich zastosowania wykraczają jednak poza biznes — mogą przydać się w medycynie, edukacji i komunikacji.

Klonowanie głosu toruje drogę do przyszłości, w której każdą treść będzie można wygenerować w dowolnym języku i głosem, by dotrzeć do milionów ludzi na całym świecie i stworzyć zupełnie nową gospodarkę. Naszym celem w Eleven jest pomóc urzeczywistnić tę przyszłość.

Podobne artykuły

Twórz z najwyższej jakości audio AI