Professional Voice Cloning

Dowiedz się, jak profesjonalnie klonować głos za pomocą naszych najlepszych modeli.

Funkcja Professional Voice Cloning

Tworzenie Professional Voice Clone

Przy klonowaniu głosu ważne jest, na czym AI zostało wytrenowane: w jakich językach i na jakim zbiorze danych. Więcej o każdym modelu i jego mocnych stronach przeczytasz na stronie modeli.

Przewodnik

Jeśli nie masz pewności, co jest dozwolone prawnie, zapoznaj się z Warunkami korzystania i informacjami o zabezpieczeniach AI.

1

Przejdź do strony Professional Voice Cloning

W panelu ElevenLabs wybierz po lewej sekcję Voices, a potem kliknij Create Voice.

W wyskakującym oknie wybierz Professional Voice Clone.

2

Prześlij audio

Professional Voice Clones obecnie nie obsługuje śpiewu. Nagrania audio mogą zawierać wyłącznie mowę.

Utwórz nowy Professional Voice Clone

Prześlij próbki audio, klikając Upload samples.

Jeśli nie masz gotowego nagrania treningowego, możesz nagrać je bezpośrednio w interfejsie, wybierając Record yourself. Dodaliśmy przykładowe skrypty narracyjne, konwersacyjne i reklamowe. Możesz też przesłać własny skrypt.

3

Sprawdź informację o długości próbek

Po przesłaniu audio zobaczysz informację o długości próbek. Aby uzyskać najlepsze wyniki, zalecamy przesłanie co najmniej godziny audio treningowego, a najlepiej materiału zbliżonego do trzech godzin.

Utwórz nowy Professional Voice Clone

4

Przetwórz audio

Po przesłaniu próbek audio możesz je przetworzyć, aby poprawić jakość. Możesz usunąć szum tła, a także rozdzielić różnych mówców, jeśli nagranie zawiera więcej niż jedną osobę. Aby zobaczyć te opcje, kliknij przycisk Audio settings obok klipu, który chcesz przetworzyć.

Utwórz nowy Professional Voice Clone

5

Zweryfikuj swój głos

Gdy wszystko będzie nagrane i przesłane, poprosimy cię o weryfikację głosu. Aby proces przebiegł sprawnie, spróbuj zweryfikować głos na tym samym lub podobnym sprzęcie, którego użyto do nagrania próbek, oraz tonem i sposobem mówienia podobnym do tych z próbek. Jeśli nie masz dostępu do tego samego sprzętu, zweryfikuj głos najlepiej, jak możesz. Jeśli weryfikacja się nie powiedzie, możesz odczekać 24 godziny i spróbować ponownie albo skontaktować się z pomocą techniczną.

6

Poczekaj na zakończenie fine-tuningu głosu

Zanim użyjesz głosu, musi on przejść proces fine-tuningu. Podczas przetwarzania możesz sprawdzić jego status w My Voices. Powiadomimy cię, gdy będzie gotowy.

7

Użyj klonu głosu

W sekcji Voices w panelu wybierz kartę Personal, a następnie kliknij Use obok klonu głosu, aby zacząć go używać.

Przed przesłaniem próbek pamiętaj o kilku rzeczach i wykonaj kilka kroków, aby uzyskać jak najlepsze wyniki.

1

Nagraj audio wysokiej jakości

Professional Voice Cloning bardzo dokładnie klonuje próbki użyte do treningu. Tworzy niemal idealny klon tego, co słyszy, uwzględniając wszystkie niuanse i cechy głosu, ale też artefakty i niepożądane dźwięki obecne w próbkach. Oznacza to, że jeśli prześlesz próbki niskiej jakości z szumem tła, pogłosem lub echem pomieszczenia albo innymi niepożądanymi dźwiękami, takimi jak muzyka czy rozmowy wielu osób, AI spróbuje odtworzyć te elementy w klonie.

2

Upewnij się, że mówi tylko jedna osoba

Upewnij się, że w całym nagraniu mówi tylko jedna osoba, ponieważ więcej mówców, nadmierny hałas lub dowolny z powyższych czynników mogą zmylić AI. Może to sprawić, że AI nie rozpozna, który głos ma sklonować, albo błędnie zinterpretuje jego brzmienie, bo jest zagłuszone przez inne dźwięki. W efekcie klon może być mniej niż optymalny.

3

Prześlij wystarczająco dużo materiału

Upewnij się, że masz dość materiału, aby dobrze sklonować głos. Zalecane minimum to 30 minut audio, ale dla najlepszego efektu i najdokładniejszego klonu polecamy 2–3 godziny. Im więcej audio prześlesz, tym lepsza będzie jakość klonu.

4

Zachowaj spójny styl

Styl mówienia z przesłanych próbek zostanie odtworzony w wyniku, dlatego dane treningowe powinny odpowiadać oczekiwanemu sposobowi mówienia. Na przykład jeśli chcesz stworzyć audiobook klonem swojego głosu, audio treningowe powinno zawierać nagranie, na którym czytasz książkę tonem, którego chcesz użyć. Dla spójności najlepiej uwzględnić w przesłanych próbkach tylko jeden styl.

5

Użyj próbek w języku, w którym PVC ma być używany

Najlepiej użyć próbek, w których mówisz w języku, do którego PVC będzie używany najczęściej. Oczywiście AI może mówić w każdym obecnie obsługiwanym przez nas języku. Warto jednak pamiętać, że jeśli głos nie jest rodzimy dla języka, w którym ma mówić AI — czyli sklonowano głos mówiący w innym języku — może zachować akcent z oryginalnego języka i błędnie wymawiać słowa lub intonację. Na przykład jeśli sklonujesz głos mówiący po angielsku, a potem zechcesz, by mówił po hiszpańsku, najpewniej będzie mówił po hiszpańsku z angielskim akcentem. Obsługujemy klonowanie próbek nagranych tylko w jednym z obsługiwanych języków. Aplikacja odrzuci próbkę nagraną w nieobsługiwanym języku.

Poniższe przykłady pokazują, czego oczekiwać od dobrego i złego nagrania.

Na razie możesz klonować tylko własny głos. Przed wysłaniem prośby o fine-tuning przejdziesz proces weryfikacji.

Wskazówki

Profesjonalny sprzęt do nagrywania

Używaj wysokiej jakości sprzętu nagraniowego, aby uzyskać najlepsze wyniki, ponieważ AI sklonuje wszystko z audio. Wysokiej jakości wejście = wysokiej jakości wyjście. Każdy mikrofon się sprawdzi, ale polecamy mikrofon XLR podłączony do dedykowanego interfejsu audio. Niedrogie opcje to na przykład Audio Technica AT2020 lub Rode NT1 podłączone do interfejsu Focusrite albo podobnego.

Użyj pop-filtra

Podczas nagrywania używaj pop-filtra. Zmniejszy to liczbę głosek wybuchowych w nagraniu.

Odległość od mikrofonu

Ustaw się w odpowiedniej odległości od mikrofonu — zalecamy około dwóch zaciśniętych pięści, ale zależy to też od rodzaju nagrania, które chcesz uzyskać.

Nagranie bez szumów

Upewnij się, że sygnał audio nie zawiera zakłóceń, takich jak muzyka lub szum w tle. Klonowanie AI działa najlepiej z czystym, pozbawionym zbędnych dźwięków audio.

Akustyka pomieszczenia

Najlepiej nagrywaj w pomieszczeniu z adaptacją akustyczną. Ograniczy to niechciane echo i hałas w tle, zapewniając AI wyraźniejszy sygnał audio. Możesz tymczasowo wytłumić przestrzeń nagraniową grubą kołdrą lub narzutą.

Wstępna obróbka audio

Jeśli zależy ci na konkretnym brzmieniu generowanym przez AI, rozważ wcześniejszą edycję audio. Na przykład jeśli chcesz uzyskać dopracowane brzmienie podcastu, przetwórz wcześniej audio tak, by odpowiadało tej jakości. Zrób to też, jeśli między słowami występują długie przerwy lub dużo „yyy” i „eee”, ponieważ AI również je naśladuje.

Kontrola głośności

Utrzymuj stałą głośność — wystarczająco wysoką, by głos był wyraźny, ale nie tak wysoką, by powodowała zniekształcenia. Celem jest zrównoważony i stabilny poziom audio. Idealnie będzie to od -23 dB do -18 dB RMS, z true peak na poziomie -3 dB.

Wystarczająca długość audio

Dla najlepszych wyników prześlij co najmniej 30 minut audio wysokiej jakości, zgodnego z powyższymi wskazówkami — najlepiej ponad 2 godziny. Im więcej dobrych danych przekażesz AI, tym lepszy będzie klon głosu. Liczba próbek nie ma znaczenia, liczy się ich łączny czas trwania. Jeśli jednak planujesz przesłać kilka godzin audio, lepiej podziel je na wiele około 30-minutowych próbek. Ułatwi to przesyłanie.

FAQ

Professional Voice Cloning, w przeciwieństwie do Instant Voice Cloning, które pozwala szybko klonować głosy z mniej niż 2 minut audio, umożliwia wytrenowanie bardziej realistycznego modelu twojego głosu. Osiągamy to, trenując dedykowany model na dużym zbiorze danych głosowych, aby stworzyć model praktycznie nieodróżnialny od twojego oryginalnego głosu.

Ponieważ Professional Voice Clones wymagają Finetune i trenowania, trochę potrwa, zanim będziesz mógł użyć klonu głosu. Dokładne oszacowanie jest trudne, ponieważ zależy to od liczby osób przed tobą w kolejce i kilku innych czynników, ale Finetune zwykle trwa 3–6 godzin.

Gdy twój Professional Voice Clone będzie gotowy, otrzymasz powiadomienie e-mail.

Nie. Możesz utworzyć Professional Voice Clone tylko własnego głosu. Nawet za zgodą tej osoby nie możesz sklonować głosu kogoś innego. Każdy Professional Voice Clone wymaga weryfikacji, która potwierdza, że głos należy do ciebie.

Jeśli ktoś chce udostępnić ci swój głos, może utworzyć i zweryfikować Professional Voice Clone na własnym koncie, a potem prywatnie udostępnić go przez link. Dowiedz się więcej z artykułu: Jak udostępnić głos?

Liczba miejsc na Professional Voice Clone (PVC) zależy od planu subskrypcji:


Podstawowe miejsca na PVC
  • Plan Free i Starter: brak miejsc na PVC
  • Plan Creator, Pro i starszy plan Scale: 1 miejsce na PVC
  • Plan Scale i starszy plan Business: 3 miejsca na PVC
  • Plan Business: 10 miejsc na PVC
  • Plan Enterprise: własna liczba miejsc na PVC

Dodatkowe miejsca na PVC

Możesz zdobyć dodatkowe miejsca na PVC, gdy Professional Voice Clone udostępniony przez ciebie w Voice Library otrzyma oznaczenie Studio Quality.

  • Ocena Studio Quality dotyczy tylko głosów udostępnionych przez ciebie w Voice Library
  • Po zaakceptowaniu głosu w Voice Library ocena Studio Quality odbywa się automatycznie. Nie następuje od razu
  • Jeśli udostępniony przez ciebie PVC otrzyma oznaczenie Studio Quality, automatycznie dostaniesz dodatkowe miejsce na PVC
  • Może się to zdarzyć wielokrotnie, jeśli kilka udostępnionych głosów otrzyma oznaczenie Studio Quality
  • Nie możesz utworzyć więcej PVC, chyba że:
    • Zdobędziesz dodatkowe miejsca dzięki ocenie Studio Quality głosów udostępnionych w Voice Library
    • Przejdziesz na plan Scale lub wyższy
Ważne informacje
  • Professional Voice Clones można używać tylko do klonowania własnego głosu
  • Jeśli przejdziesz na plan niższy niż Creator, PVC pozostanie na twoim koncie, ale nie będzie można go używać do czasu przejścia na plan Creator lub wyższy
  • Łączna liczba głosów niestandardowych, które możesz mieć, w tym PVC, zależy od planu subskrypcji

Wszystkie Professional Voice Clones (PVC) będą automatycznie trenowane na modelach Flash v2.5, Turbo v2.5 i Multilingual v2. PVC trenowane na angielskim audio będą też automatycznie trenowane na modelach Flash v2 i Turbo v2.

Jeśli masz już PVC, możesz teraz dostroić je na dodatkowych modelach. Jeśli w przyszłości pojawią się nowe modele obsługujące dostrajanie, otrzymasz powiadomienie. Zobaczysz je jako ikonę wykrzyknika po prawej stronie głosu na liście głosów w My Voices. Po najechaniu na ikonę wyświetli się powiadomienie.

Aby rozpocząć dostrajanie, najedź na nazwę głosu na liście w My Voices, a zobaczysz wszystkie dostępne modele. Modele, na których głos został już dostrojony, będą oznaczone ikoną ptaszka, a modele dostępne do dostrojenia — ikoną plusa. Aby rozpocząć dostrajanie, po prostu kliknij model. 

Podczas dostrajania głosu możesz najechać na nazwę modelu, aby sprawdzić postęp. Pamiętaj, że ze względu na cache głosu może być konieczne odświeżenie strony, aby zobaczyć aktualny postęp. Po zakończeniu dostrajania otrzymasz powiadomienie w aplikacji i e-mailowo.

Twój Professional Voice Clone przejdzie kilka etapów przetwarzania. Widać je w statusie Professional Voice Clone w My Voices.

Aby sprawdzić obecny status, znajdź swój głos na liście i spójrz na ikony wyświetlane po prawej stronie.

Wersja robocza: ten status oznacza, że twój głos jest niekompletny. Zwykle dlatego, że nie ukończyłeś tworzenia głosu lub nie zweryfikowałeś go jeszcze.

Aby przejść przez proces weryfikacji, kliknij ikonę znacznika wyboru.

Aby wrócić do tworzenia głosu, kliknij More actions (trzy kropki) i wybierz Edit voice.

Po zweryfikowaniu głosu musi on przejść Finetune na naszych modelach, zanim będzie można go użyć. Ten proces możesz śledzić, najeżdżając kursorem na nazwę głosu w My Voices. Zobaczysz tam wszystkie dostępne modele oraz ikonę wskazującą status każdego z nich.

Najedź kursorem na nazwę modelu, aby zobaczyć więcej informacji. Pojawi się jeden z poniższych statusów:

Zaplanowano proces trenowania: oznacza to, że twój głos czeka na wolne miejsce, aby rozpocząć trenowanie. Czas oczekiwania zależy od liczby innych głosów w kolejce.

Tworzenie zbioru danych i Finetune w toku: gdy zwolni się miejsce, rozpocznie się proces Finetune. Może to potrwać od 6 do 24 godzin. Postęp każdego etapu trenowania jest wskazywany procentowo.

Wystąpiły problemy podczas trenowania, więc proces został ponowiony. Nie musisz nic robić

Oznacza to, że coś poszło nie tak, ale twój głos został automatycznie dodany do kolejki, aby ponowić proces Finetune. Głos powinien pomyślnie zakończyć Finetune przy następnej próbie, ale jeśli problem wystąpi wielokrotnie, skontaktuj się z pomocą techniczną pod adresem support@elevenlabs.io.

Głos jest gotowy do użycia z tym modelem: oznacza to, że proces Finetune dla tego modelu został zakończony i możesz teraz używać głosu z tym modelem.

Kliknij, aby rozpocząć Finetune: niektóre modele nie trenują automatycznie i musisz kliknąć nazwę modelu, aby rozpocząć Finetune. Jeśli dla twojego głosu dostępne będą dodatkowe modele do Finetune, obok głosu zobaczysz ikonę wykrzyknika.

Aby rozpocząć Finetune, najedź kursorem na nazwę głosu i kliknij nazwę modelu.

Professional Voice Cloning polega na trenowaniu (Finetune) modelu na dużych zbiorach nagrań głosu konkretnej osoby, aby stworzyć własny model.

Po przesłaniu próbek i zweryfikowaniu głosu twój Professional Voice Clone zostanie dodany do kolejki. Szacowany czas trenowania to około 3–6 godzin. Zależy on od kilku czynników, dlatego trudno podać dokładny czas. Niestety czasem może to potrwać dłużej.

Obecny status głosu możesz sprawdzić w My Voices. Więcej informacji znajdziesz w artykule Co oznacza status mojego Professional Voice Clone?

Gdy PVC zakończy Finetune, otrzymasz powiadomienia w aplikacji i e-mail z informacją, że twój głos jest gotowy do użycia.

Po zweryfikowaniu głosu musi on zostać dostrojony na naszych modelach, zanim będzie można go używać. W tym czasie możesz sprawdzić status głosu w My Voices, najeżdżając na jego nazwę. Zobaczysz wtedy wszystkie dostępne modele dla tego głosu. Aby sprawdzić status każdego modelu, najedź na jego nazwę. 

Jeśli coś poszło nie tak, możesz zobaczyć następujący status:

Przepraszamy, podczas trenowania wystąpiły problemy i proces został ponowiony. Nie musisz nic robić. Oznacza to, że coś poszło nie tak, ale twój głos został automatycznie umieszczony w kolejce do ponownego dostrajania. Twój głos powinien pomyślnie zakończyć proces dostrajania przy następnej próbie, ale jeśli wystąpi wiele błędów, problem może dotyczyć zbioru danych, którego AI nie potrafi rozwiązać.

Możesz spróbować rozwiązać ten problem, usuwając głos i ponownie przesyłając dane od początku. To pomogło niektórym użytkownikom.

Jeśli to nie rozwiąże problemu, może być konieczne sprawdzenie audio treningowego i użycie innych nagrań treningowych.

Jeśli podczas dostrajania występują błędy, zawsze możesz skontaktować się z pomocą techniczną pod adresem support@elevenlabs.io.

Jeśli podczas tworzenia Professional Voice Clone wykorzystasz wszystkie próby weryfikacji, odczekaj 24 godziny — wtedy możesz spróbować ponownie.

Możesz też skontaktować się z pomocą techniczną pod adresem support@elevenlabs.io, aby sprawdzili sprawę. Jeśli wszystko będzie w porządku, zresetują twoje próby weryfikacji, żebyś mógł spróbować ponownie.

Oto kilka wskazówek, które pomogą ci pomyślnie zweryfikować Professional Voice Clone:

  • Upewnij się, że przeglądarka ma dostęp do mikrofonu i że mikrofon nie jest wyciszony.
  • Upewnij się, że nagranie z mikrofonu komputera brzmi podobnie do audio przesłanego do klonowania, bez szumu tła ani innych zewnętrznych zakłóceń dźwiękowych.
  • Staraj się mówić w stylu podobnym do audio użytego do trenowania głosu.
  • Przeczytaj każdą linijkę weryfikacyjną tylko raz, a następnie naciśnij Stop, aby zakończyć nagrywanie. Przeczytanie linijki więcej niż raz może spowodować niepowodzenie weryfikacji.

Niestety nie jest to możliwe. Jak wspomniano podczas konfiguracji Professional Voice Clone (PVC), gdy przejdziesz do etapu weryfikacji, nie możesz się wycofać, dopóki nie zweryfikujesz głosu.

Jeśli potrzebujesz pomocy z Professional Voice Clone, skontaktuj się z pomocą techniczną pod adresem support@elevenlabs.io.

Professional Voice Cloning obsługuje wszystkie języki dostępne w rodzinie modeli Eleven v4 — łącznie ponad 90 języków.

Rodzina modeli Eleven v4 obsługuje ponad 90 języków, w tym:

Afrykanerski (afr), amharski (amh), arabski (ara), armeński (hye), asamski (asm), asturyjski (ast), azerski (aze), białoruski (bel), bengalski (ben), bośniacki (bos), bułgarski (bul), birmański (mya), kantoński (yue), kataloński (cat), cebuański (ceb), chorwacki (hrv), czeski (ces), duński (dan), niderlandzki (nld), angielski (eng), estoński (est), filipiński (fil), fiński (fin), francuski (fra), fula/pulaar (ful), galicyjski (glg), gruziński (kat), niemiecki (deu), grecki (ell), gudżaracki (guj), hausa (hau), hebrajski (heb), hindi (hin), węgierski (hun), islandzki (isl), indonezyjski (ind), włoski (ita), japoński (jpn), jawajski (jav), kamba (kam), kannada (kan), kazachski (kaz), koreański (kor), kirgiski (kir), laotański (lao), łotewski (lav), lingala (lin), litewski (lit), luganda (lug), luksemburski (ltz), macedoński (mkd), malajski (msa), malajalam (mal), maltański (mlt), mandaryński chiński (cmn), maoryski (mri), marathi (mar), mongolski (mon), nepalski (nep), norweski bokmål (nob), oksytański (oci), odia (ori), paszto (pus), perski (fas), polski (pol), portugalski, Brazylia (por), pendżabski (pan), rumuński (ron), rosyjski (rus), serbski (srp), shona (sna), sindhi (snd), słowacki (slk), słoweński (slv), somalijski (som), kurdyjski sorani (ckb), hiszpański, Ameryka Łacińska (spa), suahili (swa), szwedzki (swe), tadżycki (tgk), tamilski (tam), telugu (tel), tajski (tha), turecki (tur), ukraiński (ukr), urdu (urd), uzbecki (uzb), wietnamski (vie), walijski (cym), wolof (wol), zulu (zul).

W przypadku Instant Voice Cloning i Professional Voice Cloning akceptujemy różne typy plików. Zdecydowanie zalecamy MP3 o jakości 192 kbps lub wyższej.

Zalecany format

  • MP3, 192 kbps lub wyższa jakość

Zalecana długość

  • Instant Voice Cloning: 1–2 minuty dobrej jakości audio
  • Professional Voice Cloning: 30–180 minut dobrej jakości audio

Nieskompresowane formaty, takie jak WAV, zwykle nie poprawiają jakości klonu i mogą powodować problemy podczas przesyłania. Zamiast tego skup się na jakości nagrania: użyj czystego nagrania bez szumu tła, pogłosu pomieszczenia ani wielu mówców, o stałej głośności i barwie, bez długich przerw ciszy.

Więcej informacji znajdziesz w artykułach Instant Voice Cloning (IVC) i Professional Voice Cloning (PVC).

W ElevenLabs w pełni angażujemy się zarówno w poszanowanie praw własności intelektualnej, jak i we wdrażanie zabezpieczeń przed potencjalnym niewłaściwym użyciem naszej technologii:

  • Współpracujemy tylko z klientami, którzy przestrzegają naszych Warunków świadczenia usług i Polityki zakazanego użycia, zakazujących złośliwego wykorzystywania naszej technologii do celów, które można uznać za nielegalne lub szkodliwe;
  • Wspieramy właścicieli głosów i ich licencjodawców w dochodzeniu praw, a wszystkie znane naruszenia są sprawdzane i odpowiednio obsługiwane;
  • Każde audio wygenerowane przez nasze modele można natychmiast przypisać użytkownikowi odpowiedzialnemu za generowanie.

Technologia, którą rozwijamy, jest nowa, a jasne przepisy nie zostały jeszcze wprowadzone. Jako laboratorium badawcze AI chcemy między innymi zwiększać świadomość istnienia tej technologii, jej możliwości i ograniczeń.

Pełny przewodnik znajdziesz w naszej dokumentacji o Instant Voice Cloning i Professional Voice Cloning.

W skrócie: dobre, spójne dane wejściowe = dobry, spójny wynik.

Długość

  • Instant Voice Cloning: 1–2 minuty dobrego audio
  • Professional Voice Cloning: 30–180 minut dobrego audio

Użyj najlepszych i najczystszych nagrań, jakie możesz znaleźć. Powinien mówić tylko jeden rozmówca, bez szumu ani zakłóceń w tle, a jego głos powinien być głośny i wyraźny.

Zamiast używać wielu nagrań o różnej jakości tylko po to, by zwiększyć długość, wybieraj nagrania z wyraźnie wysoką jakością mikrofonu oraz spójną jakością i tonem w całym materiale. Nie skupiaj się na wydłużaniu łącznego czasu nagrań.

Dopilnuj, by większość wypowiedzi w nagraniach pasowała do preferowanego stylu mówienia i intonacji rozmówcy. Unikaj zbyt wielu fragmentów, w których rozmówca odbiega od pożądanego sposobu mówienia.

W razie potrzeby użyj narzędzia do usuwania szumów, by ograniczyć hałas w tle.

Więcej informacji znajdziesz w naszej dokumentacji tutaj.

Tak. Możesz sklonować swój głos w dowolnym języku obsługiwanym przez Flash v2.5 i Multilingual v2. Pełną listę obsługiwanych języków znajdziesz tutaj.

Możesz też sklonować głos mówiący w języku, którego AI nie obsługuje. Klon może uchwycić ton rozmówcy, ale nie będzie w stanie mówić w tym języku, a wyniki mogą być nieprzewidywalne. Nie zalecamy tego.

Nie możesz pobrać ani wyeksportować klonów głosu jako osobnych plików. Klony głosu pozostają na twoim koncie ElevenLabs.

Nadal możesz używać swoich głosów ElevenLabs poza stroną ElevenLabs. Dzięki kluczowi API usługi zewnętrzne mogą wywoływać API ElevenLabs i generować mowę głosami z twojego konta.

Jeśli zechcesz później odtworzyć klon, zachowaj oryginalne próbki audio użyte do jego utworzenia. Każdy klon będzie brzmiał nieco inaczej, nawet gdy użyjesz tego samego audio.

ElevenLabs oferuje dwie opcje klonowania:

  • Instant Voice Cloning: Szybkie rezultaty na podstawie około 1–3 minut audio. Działa dobrze w przypadku większości głosów, ale może mieć trudności z rzadkimi akcentami lub nietypowymi głosami.
  • Professional Voice Cloning: Wyższa jakość przy użyciu od 30 minut do około 3 godzin audio. Finetune zwykle trwa 3–6 godzin, ale może potrwać dłużej, jeśli w kolejce jest wiele głosów.

Jeśli Instant Voice Cloning nie oddaje dobrze twojego głosu lub akcentu, wypróbuj Professional Voice Cloning.

Po utworzeniu klonu nie możesz zmienić jego akcentu ani barwy. Aby poprawić efekt, zmień używane próbki audio. Niewielkie zmiany w próbkach mogą zrobić dużą różnicę.

Ten błąd pojawi się, jeśli spróbujesz użyć Professional Voice Clone (PVC), zanim zakończy się proces Finetune i głos będzie gotowy do użycia.

Po utworzeniu PVC musi on przejść kilka etapów, zanim będzie gotowy do użycia. Po zweryfikowaniu głosu zostanie on przetworzony i dodany do kolejki Finetune. W zależności od liczby innych głosów oczekujących obecnie na Finetune proces ten zwykle trwa od 3 do 6 godzin, ale może potrwać do 24 godzin.

Postęp PVC możesz sprawdzić w My Voices: znajdź głos na liście, a następnie kliknij View, aby zobaczyć więcej szczegółów. Najedź kursorem na każdy model, aby sprawdzić jego obecny status.

Więcej informacji o znaczeniu poszczególnych statusów znajdziesz w artykule Co oznacza status mojego Professional Voice Clone?

Gdy PVC zakończy Finetune i będzie gotowy do użycia, zobaczysz powiadomienie w wyskakującym oknie, a także otrzymasz e-mail.

No results