For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Dowiedz się, jak błyskawicznie sklonować swój głos za pomocą naszych najlepszych modeli.
Tworzenie klonu Instant Voice Clone
Przy klonowaniu głosu warto wziąć pod uwagę, na czym trenowano AI: w jakich językach i na jakim typie zbioru danych. Więcej o każdym modelu i jego mocnych stronach znajdziesz na stronie modeli.
W sekcji Voices w panelu kliknij My Voices, a potem Use voice, aby zacząć go używać.
Dobre praktyki
Nagraj co najmniej 1 minutę audio
Nagraj co najmniej 1 minutę audio
Unikaj nagrań dłuższych niż 3 minuty — niewiele poprawią, a w niektórych przypadkach mogą nawet pogorszyć klon.
Sposób nagrania audio jest ważniejszy niż łączna długość próbek. Liczba próbek nie ma znaczenia; liczy się ich łączna długość.
Zalecamy około 1–2 minut czystego audio bez pogłosu, artefaktów i szumów tła. Przez „jakość audio lub nagrania” nie rozumiemy kodeka, takiego jak MP3 czy WAV, lecz sposób nagrania dźwięku. Jeśli chodzi o kodeki, zalecamy MP3 o przepływności 128 kb/s lub wyższej. Wyższe przepływności nie wpływają znacząco na jakość klonu.
Zachowaj spójność nagrania
Zachowaj spójność nagrania
AI spróbuje naśladować wszystko, co usłyszy w audio. Dotyczy to tempa mowy, intonacji, akcentu, barwy, sposobu i siły oddychania, a także szumów i mlaskania. Uwzględnia nawet szumy i artefakty, które mogą je zdezorientować.
Dbaj o spójny ton i sposób mówienia przez całe nagranie. Zadbaj też o stałą jakość audio we wszystkich próbkach. Nawet jeśli używasz tylko jednej próbki, powinna być spójna na całej długości. Podanie AI bardzo dynamicznego audio, z dużymi wahaniami wysokości i głośności, da mniej przewidywalne rezultaty.
Odtwórz swój sposób mówienia
Odtwórz swój sposób mówienia
Pamiętaj też, że AI spróbuje odtworzyć sposób mówienia z dostarczonego głosu. Jeśli mówisz powoli, monotonnie i bez emocji, AI będzie to naśladować. Z kolei jeśli mówisz szybko i emocjonalnie, AI postara się to odtworzyć.
Głos musi być spójny we wszystkich próbkach — nie tylko pod względem tonu, ale też sposobu mówienia. Zbyt duże różnice mogą zdezorientować AI i prowadzić do bardziej zróżnicowanych wyników między generacjami.
Ustaw odpowiednią głośność
Ustaw odpowiednią głośność
Ustaw odpowiednią głośność, aby audio nie było ani za ciche, ani za głośne. Idealnie: od -23 dB do -18 dB RMS, ze szczytem rzeczywistym -3 dB.
FAQ
Czym różnią się Instant Voice Cloning i Professional Voice Cloning?
Professional Voice Cloning, w przeciwieństwie do Instant Voice Cloning, które pozwala szybko klonować głosy z mniej niż 2 minut audio, umożliwia wytrenowanie bardziej realistycznego modelu twojego głosu. Osiągamy to, trenując dedykowany model na dużym zbiorze danych głosowych, aby stworzyć model praktycznie nieodróżnialny od twojego oryginalnego głosu.
Ponieważ Professional Voice Clones wymagają Finetune i trenowania, trochę potrwa, zanim będziesz mógł użyć klonu głosu. Dokładne oszacowanie jest trudne, ponieważ zależy to od liczby osób przed tobą w kolejce i kilku innych czynników, ale Finetune zwykle trwa 3–6 godzin.
Gdy twój Professional Voice Clone będzie gotowy, otrzymasz powiadomienie e-mail.
Ile próbek głosu należy przesłać do Instant Voice Cloning?
Klonowanie za pomocą Instant Voice Cloning może być nieco skomplikowane i mamy kilka ogólnych wskazówek. To jednak tylko wskazówki. Nie mamy sztywnych zasad dotyczących liczby próbek ani ich długości. Widzieliśmy użytkowników, którzy uzyskali świetne wyniki z próbek trwających zaledwie 30 sekund, ale też takich, którzy użyli 10 minut audio i osiągnęli gorsze wyniki. Jest jednak kilka rzeczy, które warto wziąć pod uwagę.
Jakość audio to najważniejszy aspekt przy korzystaniu z Instant Voice Cloning.
Liczba próbek nie ma znaczenia; ważny jest łączny czas trwania. Ponad 2–3 minuty audio przyniosą niewielką poprawę, a w niektórych przypadkach mogą nawet negatywnie wpłynąć na stabilność klonu.
Jakie pliki akceptujecie do klonowania głosu?
W przypadku Instant Voice Cloning i Professional Voice Cloning akceptujemy różne typy plików. Zdecydowanie zalecamy MP3 o jakości 192 kbps lub wyższej.
Zalecany format
MP3, 192 kbps lub wyższa jakość
Zalecana długość
Instant Voice Cloning: 1–2 minuty dobrej jakości audio
Professional Voice Cloning: 30–180 minut dobrej jakości audio
Nieskompresowane formaty, takie jak WAV, zwykle nie poprawiają jakości klonu i mogą powodować problemy podczas przesyłania. Zamiast tego skup się na jakości nagrania: użyj czystego nagrania bez szumu tła, pogłosu pomieszczenia ani wielu mówców, o stałej głośności i barwie, bez długich przerw ciszy.
Czy są ograniczenia dotyczące głosów, które mogę przesłać do klonowania?
W ElevenLabs w pełni angażujemy się zarówno w poszanowanie praw własności intelektualnej, jak i we wdrażanie zabezpieczeń przed potencjalnym niewłaściwym użyciem naszej technologii:
Współpracujemy tylko z klientami, którzy przestrzegają naszych Warunków świadczenia usług i Polityki zakazanego użycia, zakazujących złośliwego wykorzystywania naszej technologii do celów, które można uznać za nielegalne lub szkodliwe;
Wspieramy właścicieli głosów i ich licencjodawców w dochodzeniu praw, a wszystkie znane naruszenia są sprawdzane i odpowiednio obsługiwane;
Każde audio wygenerowane przez nasze modele można natychmiast przypisać użytkownikowi odpowiedzialnemu za generowanie.
Technologia, którą rozwijamy, jest nowa, a jasne przepisy nie zostały jeszcze wprowadzone. Jako laboratorium badawcze AI chcemy między innymi zwiększać świadomość istnienia tej technologii, jej możliwości i ograniczeń.
Czy są wskazówki, jak uzyskać dobrej jakości sklonowane głosy?
W skrócie: dobre, spójne dane wejściowe = dobry, spójny wynik.
Długość
Instant Voice Cloning: 1–2 minuty dobrego audio
Professional Voice Cloning: 30–180 minut dobrego audio
Użyj najlepszych i najczystszych nagrań, jakie możesz znaleźć. Powinien mówić tylko jeden rozmówca, bez szumu ani zakłóceń w tle, a jego głos powinien być głośny i wyraźny.
Zamiast używać wielu nagrań o różnej jakości tylko po to, by zwiększyć długość, wybieraj nagrania z wyraźnie wysoką jakością mikrofonu oraz spójną jakością i tonem w całym materiale. Nie skupiaj się na wydłużaniu łącznego czasu nagrań.
Dopilnuj, by większość wypowiedzi w nagraniach pasowała do preferowanego stylu mówienia i intonacji rozmówcy. Unikaj zbyt wielu fragmentów, w których rozmówca odbiega od pożądanego sposobu mówienia.
W razie potrzeby użyj narzędzia do usuwania szumów, by ograniczyć hałas w tle.
Więcej informacji znajdziesz w naszej dokumentacji tutaj.
Czy mogę sklonować głos w języku innym niż angielski?
Tak. Możesz sklonować swój głos w dowolnym języku obsługiwanym przez Flash v2.5 i Multilingual v2. Pełną listę obsługiwanych języków znajdziesz tutaj.
Możesz też sklonować głos mówiący w języku, którego AI nie obsługuje. Klon może uchwycić ton rozmówcy, ale nie będzie w stanie mówić w tym języku, a wyniki mogą być nieprzewidywalne. Nie zalecamy tego.
Czy mogę eksportować klony głosu?
Nie możesz pobrać ani wyeksportować klonów głosu jako osobnych plików. Klony głosu pozostają na twoim koncie ElevenLabs.
Nadal możesz używać swoich głosów ElevenLabs poza stroną ElevenLabs. Dzięki kluczowi API usługi zewnętrzne mogą wywoływać API ElevenLabs i generować mowę głosami z twojego konta.
Jeśli zechcesz później odtworzyć klon, zachowaj oryginalne próbki audio użyte do jego utworzenia. Każdy klon będzie brzmiał nieco inaczej, nawet gdy użyjesz tego samego audio.
Dlaczego mój głos lub akcent po klonowaniu nie brzmi poprawnie?
ElevenLabs oferuje dwie opcje klonowania:
Instant Voice Cloning: Szybkie rezultaty na podstawie około 1–3 minut audio. Działa dobrze w przypadku większości głosów, ale może mieć trudności z rzadkimi akcentami lub nietypowymi głosami.
Professional Voice Cloning: Wyższa jakość przy użyciu od 30 minut do około 3 godzin audio. Finetune zwykle trwa 3–6 godzin, ale może potrwać dłużej, jeśli w kolejce jest wiele głosów.
Jeśli Instant Voice Cloning nie oddaje dobrze twojego głosu lub akcentu, wypróbuj Professional Voice Cloning.
Po utworzeniu klonu nie możesz zmienić jego akcentu ani barwy. Aby poprawić efekt, zmień używane próbki audio. Niewielkie zmiany w próbkach mogą zrobić dużą różnicę.
Co oznacza błąd „No model found for this voice. Please select another voice”?
Ten błąd pojawi się, jeśli spróbujesz użyć Professional Voice Clone (PVC), zanim zakończy się proces Finetune i głos będzie gotowy do użycia.
Po utworzeniu PVC musi on przejść kilka etapów, zanim będzie gotowy do użycia. Po zweryfikowaniu głosu zostanie on przetworzony i dodany do kolejki Finetune. W zależności od liczby innych głosów oczekujących obecnie na Finetune proces ten zwykle trwa od 3 do 6 godzin, ale może potrwać do 24 godzin.
Postęp PVC możesz sprawdzić w My Voices: znajdź głos na liście, a następnie kliknij View, aby zobaczyć więcej szczegółów. Najedź kursorem na każdy model, aby sprawdzić jego obecny status.