For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Dowiedz się, jak klonować głos za pomocą naszych najlepszych modeli.
Przegląd
Przy klonowaniu głosu masz dwie główne opcje: Instant Voice Cloning i Professional Voice Cloning. Instant Voice Cloning to szybki i łatwy sposób na sklonowanie głosu, a Professional Voice Cloning zapewnia większą dokładność i możliwość dostosowania.
Instant Voice Cloning
Instant Voice Cloning pozwala niemal natychmiast tworzyć klony głosu z krótszych próbek. Utworzenie Instant Voice Clone (IVC) nie trenuje ani nie tworzy własnego modelu AI. Zamiast tego wykorzystuje wcześniejszą wiedzę z danych treningowych, aby dokonać trafnego przybliżenia, zamiast trenować na dokładnym głosie.
Działa to bardzo dobrze dla wielu głosów. Największym ograniczeniem IVC jest próba sklonowania bardzo unikalnego głosu lub głosu z akcentem, z którym AI mogło nie mieć szerokiego kontaktu podczas treningu. W takich przypadkach najlepszym rozwiązaniem może być Professional Voice Cloning, które tworzy własny model przez bezpośredni trening.
Professional Voice Cloning
Professional Voice Cloning to funkcja dostępna w planie Creator i wyższych. Pozwala wytrenować bardziej realistyczny model głosu na większym zbiorze danych głosowych, tworząc model praktycznie nieodróżnialny od oryginalnego głosu.
Ponieważ własne modele wymagają dostrojenia i treningu, trenowanie PVC trwa dłużej niż IVC. Zwykle dostrajanie zajmuje 3–6 godzin, ale czasem może potrwać dłużej, zależnie od liczby innych PVC oczekujących w kolejce do dostrojenia.
Poradnik dla początkujących: nagrywanie audio
Jeśli dopiero zaczynasz nagrywać audio, te wskazówki pomogą ci zacząć.
Miejsce nagrywania
Wybierz odpowiednie miejsce i przygotuj je tak, by zminimalizować echo i pogłos w pomieszczeniu.
Chcemy maksymalnie „wytłumić” pomieszczenie. Właśnie do tego służy odpowiednio przygotowana akustycznie kabina wokalna. Jeśli nie masz do niej dostępu, możesz wypróbować rozwiązania DIY, takie jak kabina z koców lub szafa.
Oto kilka przykładów pomysłów na akustykę DIY z YouTube:
Dobry mikrofon jest kluczowy. Mikrofony mogą kosztować od $100 do $10,000, ale profesjonalny mikrofon XLR za $150–$300 wystarczy do większości prac z nałożonym głosem.
Jeśli szukasz niedrogiego, a zarazem wysokiej jakości zestawu do pracy z nałożonym głosem, rozważ interfejs Focusrite z mikrofonem Audio-Technica AT2020 lub Rode NT1 microphone. Taki zestaw, kosztujący $300–$500, oferuje wysoką jakość nagrania do profesjonalnego użytku i niski poziom szumów własnych.
Podczas nagrywania używaj odpowiedniego pop-filtra przed mikrofonem. Pozwoli to uniknąć głosek wybuchowych, oddechów i bezpośredniego uderzania powietrza w membranę mikrofonu, które brzmi źle i utrudnia klonowanie.
Digital Audio Workstation (DAW)
Istnieje wiele rozwiązań do nagrywania, które robią to samo: nagrywają audio. Nie wszystkie są jednak równie dobre. Jeśli potrafią nagrywać pliki WAV w 44.1 kHz lub 48 kHz z głębią bitową co najmniej 24 bitów, powinny wystarczyć. Nie potrzebujesz zaawansowanej obróbki, wtyczek, odszumiaczy ani niczego podobnego — chcemy, by nagrywanie audio było proste.
Jeśli chcesz rekomendację, polecamy REAPER — świetny DAW o ogromnej elastyczności. To standard branżowy w wielu pracach audio. Inną dobrą, darmową opcją jest Audacity.
Utrzymuj optymalne poziomy nagrania — ani za wysokie, ani za niskie — by uniknąć cyfrowych zniekształceń i nadmiernego szumu. W przypadku nałożonego głosu celuj w szczyty od -6 dB do -3 dB i średnią głośność -18 dB. Zapewni to klarowność przy minimalnym poziomie szumu. Uważnie monitoruj nagranie i w razie potrzeby dostosuj poziomy do projektu oraz warunków nagrywania.
Ustawienie
Pomocna zasada to zachowanie odległości od mikrofonu wynoszącej około dwóch zaciśniętych pięści, czyli mniej więcej 20 cm (7–8 cali), z pop-filtrem między tobą a mikrofonem. Niektórzy wolą odsunąć pop-filtr maksymalnie do tyłu, aby móc oprzeć się o niego. Dzięki temu łatwiej utrzymać stałą odległość od mikrofonu.
Inną popularną techniką, która pomaga uniknąć bezpośredniego oddychania w mikrofon i głosek wybuchowych, jest mówienie pod kątem. Dzięki temu wydychane powietrze rzadziej uderza bezpośrednio w mikrofon, lecz przepływa obok niego.
Sposób mówienia
Sposób mówienia jest jednym z najważniejszych elementów całej sesji nagraniowej. AI postara się jak najdokładniej sklonować wszystko, co charakteryzuje twój głos. Oznacza to, że spróbuje odtworzyć rytm, barwę, styl mówienia, długość pauz, jąkanie, głębokie oddechy, oddechowy głos czy częste „yyy” i „eee” — może odtworzyć nawet to. Dlatego plik audio powinien zawierać dokładnie taki głos i sposób mówienia, jaki chcesz sklonować — nic więcej i nic mniej. Dlatego ważne jest też znalezienie tekstu do przeczytania, który pasuje do docelowej barwy głosu.
Podczas nagrywania dla AI bardzo ważna jest spójność. Jeśli nagrywasz głos, mów przez całe nagranie bardzo ekspresyjnie albo przez całe nagranie bardzo spokojnie. Nie mieszaj tych stylów, bo AI może stać się niestabilne, gdy nie wie, którą część głosu ma klonować. To samo dotyczy akcentu — zachowaj ten sam akcent przez całe nagranie. Spójność jest kluczowa dla dobrego klonu!
FAQ
Czym różnią się Instant Voice Cloning i Professional Voice Cloning?
Professional Voice Cloning, w przeciwieństwie do Instant Voice Cloning, które pozwala szybko klonować głosy z mniej niż 2 minut audio, umożliwia wytrenowanie bardziej realistycznego modelu twojego głosu. Osiągamy to, trenując dedykowany model na dużym zbiorze danych głosowych, aby stworzyć model praktycznie nieodróżnialny od twojego oryginalnego głosu.
Ponieważ Professional Voice Clones wymagają Finetune i trenowania, trochę potrwa, zanim będziesz mógł użyć klonu głosu. Dokładne oszacowanie jest trudne, ponieważ zależy to od liczby osób przed tobą w kolejce i kilku innych czynników, ale Finetune zwykle trwa 3–6 godzin.
Gdy twój Professional Voice Clone będzie gotowy, otrzymasz powiadomienie e-mail.
Jakie pliki akceptujecie do klonowania głosu?
W przypadku Instant Voice Cloning i Professional Voice Cloning akceptujemy różne typy plików. Zdecydowanie zalecamy MP3 o jakości 192 kbps lub wyższej.
Zalecany format
MP3, 192 kbps lub wyższa jakość
Zalecana długość
Instant Voice Cloning: 1–2 minuty dobrej jakości audio
Professional Voice Cloning: 30–180 minut dobrej jakości audio
Nieskompresowane formaty, takie jak WAV, zwykle nie poprawiają jakości klonu i mogą powodować problemy podczas przesyłania. Zamiast tego skup się na jakości nagrania: użyj czystego nagrania bez szumu tła, pogłosu pomieszczenia ani wielu mówców, o stałej głośności i barwie, bez długich przerw ciszy.
Dlaczego mój głos lub akcent po klonowaniu nie brzmi poprawnie?
ElevenLabs oferuje dwie opcje klonowania:
Instant Voice Cloning: Szybkie rezultaty na podstawie około 1–3 minut audio. Działa dobrze w przypadku większości głosów, ale może mieć trudności z rzadkimi akcentami lub nietypowymi głosami.
Professional Voice Cloning: Wyższa jakość przy użyciu od 30 minut do około 3 godzin audio. Finetune zwykle trwa 3–6 godzin, ale może potrwać dłużej, jeśli w kolejce jest wiele głosów.
Jeśli Instant Voice Cloning nie oddaje dobrze twojego głosu lub akcentu, wypróbuj Professional Voice Cloning.
Po utworzeniu klonu nie możesz zmienić jego akcentu ani barwy. Aby poprawić efekt, zmień używane próbki audio. Niewielkie zmiany w próbkach mogą zrobić dużą różnicę.
Czy są ograniczenia dotyczące głosów, które mogę przesłać do klonowania?
W ElevenLabs w pełni angażujemy się zarówno w poszanowanie praw własności intelektualnej, jak i we wdrażanie zabezpieczeń przed potencjalnym niewłaściwym użyciem naszej technologii:
Współpracujemy tylko z klientami, którzy przestrzegają naszych Warunków świadczenia usług i Polityki zakazanego użycia, zakazujących złośliwego wykorzystywania naszej technologii do celów, które można uznać za nielegalne lub szkodliwe;
Wspieramy właścicieli głosów i ich licencjodawców w dochodzeniu praw, a wszystkie znane naruszenia są sprawdzane i odpowiednio obsługiwane;
Każde audio wygenerowane przez nasze modele można natychmiast przypisać użytkownikowi odpowiedzialnemu za generowanie.
Technologia, którą rozwijamy, jest nowa, a jasne przepisy nie zostały jeszcze wprowadzone. Jako laboratorium badawcze AI chcemy między innymi zwiększać świadomość istnienia tej technologii, jej możliwości i ograniczeń.
Czy mogę eksportować klony głosu?
Nie możesz pobrać ani wyeksportować klonów głosu jako osobnych plików. Klony głosu pozostają na twoim koncie ElevenLabs.
Nadal możesz używać swoich głosów ElevenLabs poza stroną ElevenLabs. Dzięki kluczowi API usługi zewnętrzne mogą wywoływać API ElevenLabs i generować mowę głosami z twojego konta.
Jeśli zechcesz później odtworzyć klon, zachowaj oryginalne próbki audio użyte do jego utworzenia. Każdy klon będzie brzmiał nieco inaczej, nawet gdy użyjesz tego samego audio.
Czy są wskazówki, jak uzyskać dobrej jakości sklonowane głosy?
W skrócie: dobre, spójne dane wejściowe = dobry, spójny wynik.
Długość
Instant Voice Cloning: 1–2 minuty dobrego audio
Professional Voice Cloning: 30–180 minut dobrego audio
Użyj najlepszych i najczystszych nagrań, jakie możesz znaleźć. Powinien mówić tylko jeden rozmówca, bez szumu ani zakłóceń w tle, a jego głos powinien być głośny i wyraźny.
Zamiast używać wielu nagrań o różnej jakości tylko po to, by zwiększyć długość, wybieraj nagrania z wyraźnie wysoką jakością mikrofonu oraz spójną jakością i tonem w całym materiale. Nie skupiaj się na wydłużaniu łącznego czasu nagrań.
Dopilnuj, by większość wypowiedzi w nagraniach pasowała do preferowanego stylu mówienia i intonacji rozmówcy. Unikaj zbyt wielu fragmentów, w których rozmówca odbiega od pożądanego sposobu mówienia.
W razie potrzeby użyj narzędzia do usuwania szumów, by ograniczyć hałas w tle.
Więcej informacji znajdziesz w naszej dokumentacji tutaj.
Czy mogę sklonować głos w języku innym niż angielski?
Tak. Możesz sklonować swój głos w dowolnym języku obsługiwanym przez Flash v2.5 i Multilingual v2. Pełną listę obsługiwanych języków znajdziesz tutaj.
Możesz też sklonować głos mówiący w języku, którego AI nie obsługuje. Klon może uchwycić ton rozmówcy, ale nie będzie w stanie mówić w tym języku, a wyniki mogą być nieprzewidywalne. Nie zalecamy tego.
Czy mogę utworzyć Professional Voice Clone głosu innej osoby?
Nie. Możesz utworzyć Professional Voice Clone tylko własnego głosu. Nawet za zgodą tej osoby nie możesz sklonować głosu kogoś innego. Każdy Professional Voice Clone wymaga weryfikacji, która potwierdza, że głos należy do ciebie.
Jeśli ktoś chce udostępnić ci swój głos, może utworzyć i zweryfikować Professional Voice Clone na własnym koncie, a potem prywatnie udostępnić go przez link. Dowiedz się więcej z artykułu: Jak udostępnić głos?
Jak usunąć niezweryfikowany Professional Voice Clone (PVC)?
Niestety nie jest to możliwe. Jak wspomniano podczas konfiguracji Professional Voice Clone (PVC), gdy przejdziesz do etapu weryfikacji, nie możesz się wycofać, dopóki nie zweryfikujesz głosu.
Jeśli potrzebujesz pomocy z Professional Voice Clone, skontaktuj się z pomocą techniczną pod adresem support@elevenlabs.io.
Jak dodać lub zaktualizować modele używane do trenowania mojego Professional Voice Clone?
Wszystkie Professional Voice Clones (PVC) będą automatycznie trenowane na modelach Flash v2.5, Turbo v2.5 i Multilingual v2. PVC trenowane na angielskim audio będą też automatycznie trenowane na modelach Flash v2 i Turbo v2.
Jeśli masz już PVC, możesz teraz dostroić je na dodatkowych modelach. Jeśli w przyszłości pojawią się nowe modele obsługujące dostrajanie, otrzymasz powiadomienie. Zobaczysz je jako ikonę wykrzyknika po prawej stronie głosu na liście głosów w My Voices. Po najechaniu na ikonę wyświetli się powiadomienie.
Aby rozpocząć dostrajanie, najedź na nazwę głosu na liście w My Voices, a zobaczysz wszystkie dostępne modele. Modele, na których głos został już dostrojony, będą oznaczone ikoną ptaszka, a modele dostępne do dostrojenia — ikoną plusa. Aby rozpocząć dostrajanie, po prostu kliknij model.
Podczas dostrajania głosu możesz najechać na nazwę modelu, aby sprawdzić postęp. Pamiętaj, że ze względu na cache głosu może być konieczne odświeżenie strony, aby zobaczyć aktualny postęp. Po zakończeniu dostrajania otrzymasz powiadomienie w aplikacji i e-mailowo.
Ile Professional Voice Clones (PVC) mogę mieć?
Liczba miejsc na Professional Voice Clone (PVC) zależy od planu subskrypcji:
Podstawowe miejsca na PVC
Plan Free i Starter: brak miejsc na PVC
Plan Creator, Pro i starszy plan Scale: 1 miejsce na PVC
Plan Scale i starszy plan Business: 3 miejsca na PVC
Plan Business: 10 miejsc na PVC
Plan Enterprise: własna liczba miejsc na PVC
Dodatkowe miejsca na PVC
Możesz zdobyć dodatkowe miejsca na PVC, gdy Professional Voice Clone udostępniony przez ciebie w Voice Library otrzyma oznaczenie Studio Quality.
Ocena Studio Quality dotyczy tylko głosów udostępnionych przez ciebie w Voice Library
Po zaakceptowaniu głosu w Voice Library ocena Studio Quality odbywa się automatycznie. Nie następuje od razu
Jeśli udostępniony przez ciebie PVC otrzyma oznaczenie Studio Quality, automatycznie dostaniesz dodatkowe miejsce na PVC
Może się to zdarzyć wielokrotnie, jeśli kilka udostępnionych głosów otrzyma oznaczenie Studio Quality
Nie możesz utworzyć więcej PVC, chyba że:
Zdobędziesz dodatkowe miejsca dzięki ocenie Studio Quality głosów udostępnionych w Voice Library
Przejdziesz na plan Scale lub wyższy
Ważne informacje
Professional Voice Clones można używać tylko do klonowania własnego głosu
Jeśli przejdziesz na plan niższy niż Creator, PVC pozostanie na twoim koncie, ale nie będzie można go używać do czasu przejścia na plan Creator lub wyższy
Łączna liczba głosów niestandardowych, które możesz mieć, w tym PVC, zależy od planu subskrypcji
Ile próbek głosu należy przesłać do Instant Voice Cloning?
Klonowanie za pomocą Instant Voice Cloning może być nieco skomplikowane i mamy kilka ogólnych wskazówek. To jednak tylko wskazówki. Nie mamy sztywnych zasad dotyczących liczby próbek ani ich długości. Widzieliśmy użytkowników, którzy uzyskali świetne wyniki z próbek trwających zaledwie 30 sekund, ale też takich, którzy użyli 10 minut audio i osiągnęli gorsze wyniki. Jest jednak kilka rzeczy, które warto wziąć pod uwagę.
Jakość audio to najważniejszy aspekt przy korzystaniu z Instant Voice Cloning.
Liczba próbek nie ma znaczenia; ważny jest łączny czas trwania. Ponad 2–3 minuty audio przyniosą niewielką poprawę, a w niektórych przypadkach mogą nawet negatywnie wpłynąć na stabilność klonu.
Mój profesjonalny klon głosu nie został utworzony lub jest opóźniony — co mogę zrobić?
Po zweryfikowaniu głosu musi on zostać dostrojony na naszych modelach, zanim będzie można go używać. W tym czasie możesz sprawdzić status głosu w My Voices, najeżdżając na jego nazwę. Zobaczysz wtedy wszystkie dostępne modele dla tego głosu. Aby sprawdzić status każdego modelu, najedź na jego nazwę.
Jeśli coś poszło nie tak, możesz zobaczyć następujący status:
Przepraszamy, podczas trenowania wystąpiły problemy i proces został ponowiony. Nie musisz nic robić. Oznacza to, że coś poszło nie tak, ale twój głos został automatycznie umieszczony w kolejce do
ponownego dostrajania. Twój głos powinien pomyślnie zakończyć proces dostrajania przy
następnej próbie, ale jeśli wystąpi wiele błędów, problem może dotyczyć zbioru danych, którego
AI nie potrafi rozwiązać.
Możesz spróbować rozwiązać ten problem, usuwając głos i ponownie przesyłając dane od początku. To pomogło niektórym użytkownikom.
Jeśli to nie rozwiąże problemu, może być konieczne sprawdzenie audio treningowego i użycie innych nagrań treningowych.
Jeśli podczas dostrajania występują błędy, zawsze możesz skontaktować się z pomocą techniczną pod adresem support@elevenlabs.io.
Co mogę zrobić, jeśli nie udało mi się zweryfikować Professional Voice Clone (PVC)?
Jeśli podczas tworzenia Professional Voice Clone wykorzystasz wszystkie próby weryfikacji, odczekaj 24 godziny — wtedy możesz spróbować ponownie.
Możesz też skontaktować się z pomocą techniczną pod adresem support@elevenlabs.io, aby sprawdzili sprawę. Jeśli wszystko będzie w porządku, zresetują twoje próby weryfikacji, żebyś mógł spróbować ponownie.
Oto kilka wskazówek, które pomogą ci pomyślnie zweryfikować Professional Voice Clone:
Upewnij się, że przeglądarka ma dostęp do mikrofonu i że mikrofon nie jest wyciszony.
Upewnij się, że nagranie z mikrofonu komputera brzmi podobnie do audio przesłanego do klonowania, bez szumu tła ani innych zewnętrznych zakłóceń dźwiękowych.
Staraj się mówić w stylu podobnym do audio użytego do trenowania głosu.
Przeczytaj każdą linijkę weryfikacyjną tylko raz, a następnie naciśnij Stop, aby zakończyć nagrywanie. Przeczytanie linijki więcej niż raz może spowodować niepowodzenie weryfikacji.
Co oznacza błąd „No model found for this voice. Please select another voice”?
Ten błąd pojawi się, jeśli spróbujesz użyć Professional Voice Clone (PVC), zanim zakończy się proces Finetune i głos będzie gotowy do użycia.
Po utworzeniu PVC musi on przejść kilka etapów, zanim będzie gotowy do użycia. Po zweryfikowaniu głosu zostanie on przetworzony i dodany do kolejki Finetune. W zależności od liczby innych głosów oczekujących obecnie na Finetune proces ten zwykle trwa od 3 do 6 godzin, ale może potrwać do 24 godzin.
Postęp PVC możesz sprawdzić w My Voices: znajdź głos na liście, a następnie kliknij View, aby zobaczyć więcej szczegółów. Najedź kursorem na każdy model, aby sprawdzić jego obecny status.
Gdy PVC zakończy Finetune i będzie gotowy do użycia, zobaczysz powiadomienie w wyskakującym oknie, a także otrzymasz e-mail.
Co oznacza status mojego Professional Voice Clone?
Twój Professional Voice Clone przejdzie kilka etapów przetwarzania. Widać je w statusie Professional Voice Clone w My Voices.
Aby sprawdzić obecny status, znajdź swój głos na liście i spójrz na ikony wyświetlane po prawej stronie.
Wersja robocza: ten status oznacza, że twój głos jest niekompletny. Zwykle dlatego,
że nie ukończyłeś tworzenia głosu lub nie zweryfikowałeś go jeszcze.
Aby przejść przez proces weryfikacji, kliknij ikonę znacznika wyboru.
Aby wrócić do tworzenia głosu, kliknij More actions (trzy kropki) i wybierz Edit voice.
Po zweryfikowaniu głosu musi on przejść Finetune na naszych modelach, zanim będzie można go użyć. Ten proces możesz śledzić, najeżdżając kursorem na nazwę głosu w My Voices. Zobaczysz tam wszystkie dostępne modele oraz ikonę wskazującą status każdego z nich.
Najedź kursorem na nazwę modelu, aby zobaczyć więcej informacji. Pojawi się jeden z poniższych statusów:
Zaplanowano proces trenowania: oznacza to, że twój głos czeka na
wolne miejsce, aby rozpocząć trenowanie. Czas oczekiwania zależy od liczby innych głosów w kolejce.
Tworzenie zbioru danych i Finetune w toku: gdy zwolni się miejsce,
rozpocznie się proces Finetune. Może to potrwać od 6 do 24 godzin. Postęp każdego etapu trenowania
jest wskazywany procentowo.
Wystąpiły problemy podczas trenowania, więc proces został ponowiony. Nie musisz nic robić
Oznacza to, że coś poszło nie tak, ale twój głos został automatycznie dodany do kolejki, aby ponowić
proces Finetune. Głos powinien pomyślnie zakończyć Finetune przy następnej próbie, ale jeśli problem
wystąpi wielokrotnie, skontaktuj się z pomocą techniczną pod adresem
support@elevenlabs.io.
Głos jest gotowy do użycia z tym modelem: oznacza to, że proces Finetune
dla tego modelu został zakończony i możesz teraz używać głosu z tym modelem.
Kliknij, aby rozpocząć Finetune: niektóre modele nie trenują automatycznie i musisz
kliknąć nazwę modelu, aby rozpocząć Finetune. Jeśli dla twojego głosu dostępne będą dodatkowe modele
do Finetune, obok głosu zobaczysz ikonę wykrzyknika.
Aby rozpocząć Finetune, najedź kursorem na nazwę głosu i kliknij nazwę modelu.
Jakie języki obsługuje Professional Voice Cloning?
Professional Voice Cloning obsługuje wszystkie języki dostępne w rodzinie modeli Eleven v4 — łącznie ponad 90 języków.
Rodzina modeli Eleven v4 obsługuje ponad 90 języków, w tym:
Kiedy mój Professional Voice Clone (PVC) będzie gotowy?
Professional Voice Cloning polega na trenowaniu (Finetune) modelu na dużych zbiorach nagrań głosu konkretnej osoby, aby stworzyć własny model.
Po przesłaniu próbek i zweryfikowaniu głosu twój Professional Voice Clone zostanie dodany do kolejki. Szacowany czas trenowania to około 3–6 godzin. Zależy on od kilku czynników, dlatego trudno podać dokładny czas. Niestety czasem może to potrwać dłużej.