Voice Cloning

Dowiedz się, jak klonować głos za pomocą naszych najlepszych modeli.

Przegląd

Przy klonowaniu głosu masz dwie główne opcje: Instant Voice Cloning i Professional Voice Cloning. Instant Voice Cloning to szybki i łatwy sposób na sklonowanie głosu, a Professional Voice Cloning zapewnia większą dokładność i możliwość dostosowania.

Instant Voice Cloning

Instant voice
cloning

Instant Voice Cloning pozwala niemal natychmiast tworzyć klony głosu z krótszych próbek. Utworzenie Instant Voice Clone (IVC) nie trenuje ani nie tworzy własnego modelu AI. Zamiast tego wykorzystuje wcześniejszą wiedzę z danych treningowych, aby dokonać trafnego przybliżenia, zamiast trenować na dokładnym głosie.

Działa to bardzo dobrze dla wielu głosów. Największym ograniczeniem IVC jest próba sklonowania bardzo unikalnego głosu lub głosu z akcentem, z którym AI mogło nie mieć szerokiego kontaktu podczas treningu. W takich przypadkach najlepszym rozwiązaniem może być Professional Voice Cloning, które tworzy własny model przez bezpośredni trening.

Professional Voice Cloning

Professional voice
cloning

Professional Voice Cloning to funkcja dostępna w planie Creator i wyższych. Pozwala wytrenować bardziej realistyczny model głosu na większym zbiorze danych głosowych, tworząc model praktycznie nieodróżnialny od oryginalnego głosu.

Ponieważ własne modele wymagają dostrojenia i treningu, trenowanie PVC trwa dłużej niż IVC. Zwykle dostrajanie zajmuje 3–6 godzin, ale czasem może potrwać dłużej, zależnie od liczby innych PVC oczekujących w kolejce do dostrojenia.

Poradnik dla początkujących: nagrywanie audio

Jeśli dopiero zaczynasz nagrywać audio, te wskazówki pomogą ci zacząć.

Miejsce nagrywania

Wybierz odpowiednie miejsce i przygotuj je tak, by zminimalizować echo i pogłos w pomieszczeniu. Chcemy maksymalnie „wytłumić” pomieszczenie. Właśnie do tego służy odpowiednio przygotowana akustycznie kabina wokalna. Jeśli nie masz do niej dostępu, możesz wypróbować rozwiązania DIY, takie jak kabina z koców lub szafa.

Oto kilka przykładów pomysłów na akustykę DIY z YouTube:

Mikrofon, pop-filter i interfejs audio

Dobry mikrofon jest kluczowy. Mikrofony mogą kosztować od $100 do $10,000, ale profesjonalny mikrofon XLR za $150–$300 wystarczy do większości prac z nałożonym głosem.

Jeśli szukasz niedrogiego, a zarazem wysokiej jakości zestawu do pracy z nałożonym głosem, rozważ interfejs Focusrite z mikrofonem Audio-Technica AT2020 lub Rode NT1 microphone. Taki zestaw, kosztujący $300–$500, oferuje wysoką jakość nagrania do profesjonalnego użytku i niski poziom szumów własnych.

Podczas nagrywania używaj odpowiedniego pop-filtra przed mikrofonem. Pozwoli to uniknąć głosek wybuchowych, oddechów i bezpośredniego uderzania powietrza w membranę mikrofonu, które brzmi źle i utrudnia klonowanie.

Digital Audio Workstation (DAW)

Istnieje wiele rozwiązań do nagrywania, które robią to samo: nagrywają audio. Nie wszystkie są jednak równie dobre. Jeśli potrafią nagrywać pliki WAV w 44.1 kHz lub 48 kHz z głębią bitową co najmniej 24 bitów, powinny wystarczyć. Nie potrzebujesz zaawansowanej obróbki, wtyczek, odszumiaczy ani niczego podobnego — chcemy, by nagrywanie audio było proste.

Jeśli chcesz rekomendację, polecamy REAPER — świetny DAW o ogromnej elastyczności. To standard branżowy w wielu pracach audio. Inną dobrą, darmową opcją jest Audacity.

Utrzymuj optymalne poziomy nagrania — ani za wysokie, ani za niskie — by uniknąć cyfrowych zniekształceń i nadmiernego szumu. W przypadku nałożonego głosu celuj w szczyty od -6 dB do -3 dB i średnią głośność -18 dB. Zapewni to klarowność przy minimalnym poziomie szumu. Uważnie monitoruj nagranie i w razie potrzeby dostosuj poziomy do projektu oraz warunków nagrywania.

Ustawienie

Pomocna zasada to zachowanie odległości od mikrofonu wynoszącej około dwóch zaciśniętych pięści, czyli mniej więcej 20 cm (7–8 cali), z pop-filtrem między tobą a mikrofonem. Niektórzy wolą odsunąć pop-filtr maksymalnie do tyłu, aby móc oprzeć się o niego. Dzięki temu łatwiej utrzymać stałą odległość od mikrofonu.

Inną popularną techniką, która pomaga uniknąć bezpośredniego oddychania w mikrofon i głosek wybuchowych, jest mówienie pod kątem. Dzięki temu wydychane powietrze rzadziej uderza bezpośrednio w mikrofon, lecz przepływa obok niego.

Sposób mówienia

Sposób mówienia jest jednym z najważniejszych elementów całej sesji nagraniowej. AI postara się jak najdokładniej sklonować wszystko, co charakteryzuje twój głos. Oznacza to, że spróbuje odtworzyć rytm, barwę, styl mówienia, długość pauz, jąkanie, głębokie oddechy, oddechowy głos czy częste „yyy” i „eee” — może odtworzyć nawet to. Dlatego plik audio powinien zawierać dokładnie taki głos i sposób mówienia, jaki chcesz sklonować — nic więcej i nic mniej. Dlatego ważne jest też znalezienie tekstu do przeczytania, który pasuje do docelowej barwy głosu.

Podczas nagrywania dla AI bardzo ważna jest spójność. Jeśli nagrywasz głos, mów przez całe nagranie bardzo ekspresyjnie albo przez całe nagranie bardzo spokojnie. Nie mieszaj tych stylów, bo AI może stać się niestabilne, gdy nie wie, którą część głosu ma klonować. To samo dotyczy akcentu — zachowaj ten sam akcent przez całe nagranie. Spójność jest kluczowa dla dobrego klonu!

FAQ

Professional Voice Cloning, w przeciwieństwie do Instant Voice Cloning, które pozwala szybko klonować głosy z mniej niż 2 minut audio, umożliwia wytrenowanie bardziej realistycznego modelu twojego głosu. Osiągamy to, trenując dedykowany model na dużym zbiorze danych głosowych, aby stworzyć model praktycznie nieodróżnialny od twojego oryginalnego głosu.

Ponieważ Professional Voice Clones wymagają Finetune i trenowania, trochę potrwa, zanim będziesz mógł użyć klonu głosu. Dokładne oszacowanie jest trudne, ponieważ zależy to od liczby osób przed tobą w kolejce i kilku innych czynników, ale Finetune zwykle trwa 3–6 godzin.

Gdy twój Professional Voice Clone będzie gotowy, otrzymasz powiadomienie e-mail.

W przypadku Instant Voice Cloning i Professional Voice Cloning akceptujemy różne typy plików. Zdecydowanie zalecamy MP3 o jakości 192 kbps lub wyższej.

Zalecany format

  • MP3, 192 kbps lub wyższa jakość

Zalecana długość

  • Instant Voice Cloning: 1–2 minuty dobrej jakości audio
  • Professional Voice Cloning: 30–180 minut dobrej jakości audio

Nieskompresowane formaty, takie jak WAV, zwykle nie poprawiają jakości klonu i mogą powodować problemy podczas przesyłania. Zamiast tego skup się na jakości nagrania: użyj czystego nagrania bez szumu tła, pogłosu pomieszczenia ani wielu mówców, o stałej głośności i barwie, bez długich przerw ciszy.

Więcej informacji znajdziesz w artykułach Instant Voice Cloning (IVC) i Professional Voice Cloning (PVC).

ElevenLabs oferuje dwie opcje klonowania:

  • Instant Voice Cloning: Szybkie rezultaty na podstawie około 1–3 minut audio. Działa dobrze w przypadku większości głosów, ale może mieć trudności z rzadkimi akcentami lub nietypowymi głosami.
  • Professional Voice Cloning: Wyższa jakość przy użyciu od 30 minut do około 3 godzin audio. Finetune zwykle trwa 3–6 godzin, ale może potrwać dłużej, jeśli w kolejce jest wiele głosów.

Jeśli Instant Voice Cloning nie oddaje dobrze twojego głosu lub akcentu, wypróbuj Professional Voice Cloning.

Po utworzeniu klonu nie możesz zmienić jego akcentu ani barwy. Aby poprawić efekt, zmień używane próbki audio. Niewielkie zmiany w próbkach mogą zrobić dużą różnicę.

W ElevenLabs w pełni angażujemy się zarówno w poszanowanie praw własności intelektualnej, jak i we wdrażanie zabezpieczeń przed potencjalnym niewłaściwym użyciem naszej technologii:

  • Współpracujemy tylko z klientami, którzy przestrzegają naszych Warunków świadczenia usług i Polityki zakazanego użycia, zakazujących złośliwego wykorzystywania naszej technologii do celów, które można uznać za nielegalne lub szkodliwe;
  • Wspieramy właścicieli głosów i ich licencjodawców w dochodzeniu praw, a wszystkie znane naruszenia są sprawdzane i odpowiednio obsługiwane;
  • Każde audio wygenerowane przez nasze modele można natychmiast przypisać użytkownikowi odpowiedzialnemu za generowanie.

Technologia, którą rozwijamy, jest nowa, a jasne przepisy nie zostały jeszcze wprowadzone. Jako laboratorium badawcze AI chcemy między innymi zwiększać świadomość istnienia tej technologii, jej możliwości i ograniczeń.

Nie możesz pobrać ani wyeksportować klonów głosu jako osobnych plików. Klony głosu pozostają na twoim koncie ElevenLabs.

Nadal możesz używać swoich głosów ElevenLabs poza stroną ElevenLabs. Dzięki kluczowi API usługi zewnętrzne mogą wywoływać API ElevenLabs i generować mowę głosami z twojego konta.

Jeśli zechcesz później odtworzyć klon, zachowaj oryginalne próbki audio użyte do jego utworzenia. Każdy klon będzie brzmiał nieco inaczej, nawet gdy użyjesz tego samego audio.

Pełny przewodnik znajdziesz w naszej dokumentacji o Instant Voice Cloning i Professional Voice Cloning.

W skrócie: dobre, spójne dane wejściowe = dobry, spójny wynik.

Długość

  • Instant Voice Cloning: 1–2 minuty dobrego audio
  • Professional Voice Cloning: 30–180 minut dobrego audio

Użyj najlepszych i najczystszych nagrań, jakie możesz znaleźć. Powinien mówić tylko jeden rozmówca, bez szumu ani zakłóceń w tle, a jego głos powinien być głośny i wyraźny.

Zamiast używać wielu nagrań o różnej jakości tylko po to, by zwiększyć długość, wybieraj nagrania z wyraźnie wysoką jakością mikrofonu oraz spójną jakością i tonem w całym materiale. Nie skupiaj się na wydłużaniu łącznego czasu nagrań.

Dopilnuj, by większość wypowiedzi w nagraniach pasowała do preferowanego stylu mówienia i intonacji rozmówcy. Unikaj zbyt wielu fragmentów, w których rozmówca odbiega od pożądanego sposobu mówienia.

W razie potrzeby użyj narzędzia do usuwania szumów, by ograniczyć hałas w tle.

Więcej informacji znajdziesz w naszej dokumentacji tutaj.

Tak. Możesz sklonować swój głos w dowolnym języku obsługiwanym przez Flash v2.5 i Multilingual v2. Pełną listę obsługiwanych języków znajdziesz tutaj.

Możesz też sklonować głos mówiący w języku, którego AI nie obsługuje. Klon może uchwycić ton rozmówcy, ale nie będzie w stanie mówić w tym języku, a wyniki mogą być nieprzewidywalne. Nie zalecamy tego.

Nie. Możesz utworzyć Professional Voice Clone tylko własnego głosu. Nawet za zgodą tej osoby nie możesz sklonować głosu kogoś innego. Każdy Professional Voice Clone wymaga weryfikacji, która potwierdza, że głos należy do ciebie.

Jeśli ktoś chce udostępnić ci swój głos, może utworzyć i zweryfikować Professional Voice Clone na własnym koncie, a potem prywatnie udostępnić go przez link. Dowiedz się więcej z artykułu: Jak udostępnić głos?

Niestety nie jest to możliwe. Jak wspomniano podczas konfiguracji Professional Voice Clone (PVC), gdy przejdziesz do etapu weryfikacji, nie możesz się wycofać, dopóki nie zweryfikujesz głosu.

Jeśli potrzebujesz pomocy z Professional Voice Clone, skontaktuj się z pomocą techniczną pod adresem support@elevenlabs.io.

Wszystkie Professional Voice Clones (PVC) będą automatycznie trenowane na modelach Flash v2.5, Turbo v2.5 i Multilingual v2. PVC trenowane na angielskim audio będą też automatycznie trenowane na modelach Flash v2 i Turbo v2.

Jeśli masz już PVC, możesz teraz dostroić je na dodatkowych modelach. Jeśli w przyszłości pojawią się nowe modele obsługujące dostrajanie, otrzymasz powiadomienie. Zobaczysz je jako ikonę wykrzyknika po prawej stronie głosu na liście głosów w My Voices. Po najechaniu na ikonę wyświetli się powiadomienie.

Aby rozpocząć dostrajanie, najedź na nazwę głosu na liście w My Voices, a zobaczysz wszystkie dostępne modele. Modele, na których głos został już dostrojony, będą oznaczone ikoną ptaszka, a modele dostępne do dostrojenia — ikoną plusa. Aby rozpocząć dostrajanie, po prostu kliknij model. 

Podczas dostrajania głosu możesz najechać na nazwę modelu, aby sprawdzić postęp. Pamiętaj, że ze względu na cache głosu może być konieczne odświeżenie strony, aby zobaczyć aktualny postęp. Po zakończeniu dostrajania otrzymasz powiadomienie w aplikacji i e-mailowo.

Liczba miejsc na Professional Voice Clone (PVC) zależy od planu subskrypcji:


Podstawowe miejsca na PVC
  • Plan Free i Starter: brak miejsc na PVC
  • Plan Creator, Pro i starszy plan Scale: 1 miejsce na PVC
  • Plan Scale i starszy plan Business: 3 miejsca na PVC
  • Plan Business: 10 miejsc na PVC
  • Plan Enterprise: własna liczba miejsc na PVC

Dodatkowe miejsca na PVC

Możesz zdobyć dodatkowe miejsca na PVC, gdy Professional Voice Clone udostępniony przez ciebie w Voice Library otrzyma oznaczenie Studio Quality.

  • Ocena Studio Quality dotyczy tylko głosów udostępnionych przez ciebie w Voice Library
  • Po zaakceptowaniu głosu w Voice Library ocena Studio Quality odbywa się automatycznie. Nie następuje od razu
  • Jeśli udostępniony przez ciebie PVC otrzyma oznaczenie Studio Quality, automatycznie dostaniesz dodatkowe miejsce na PVC
  • Może się to zdarzyć wielokrotnie, jeśli kilka udostępnionych głosów otrzyma oznaczenie Studio Quality
  • Nie możesz utworzyć więcej PVC, chyba że:
    • Zdobędziesz dodatkowe miejsca dzięki ocenie Studio Quality głosów udostępnionych w Voice Library
    • Przejdziesz na plan Scale lub wyższy
Ważne informacje
  • Professional Voice Clones można używać tylko do klonowania własnego głosu
  • Jeśli przejdziesz na plan niższy niż Creator, PVC pozostanie na twoim koncie, ale nie będzie można go używać do czasu przejścia na plan Creator lub wyższy
  • Łączna liczba głosów niestandardowych, które możesz mieć, w tym PVC, zależy od planu subskrypcji

Klonowanie za pomocą Instant Voice Cloning może być nieco skomplikowane i mamy kilka ogólnych wskazówek. To jednak tylko wskazówki. Nie mamy sztywnych zasad dotyczących liczby próbek ani ich długości. Widzieliśmy użytkowników, którzy uzyskali świetne wyniki z próbek trwających zaledwie 30 sekund, ale też takich, którzy użyli 10 minut audio i osiągnęli gorsze wyniki. Jest jednak kilka rzeczy, które warto wziąć pod uwagę.

  • Jakość audio to najważniejszy aspekt przy korzystaniu z Instant Voice Cloning.
  • Liczba próbek nie ma znaczenia; ważny jest łączny czas trwania. Ponad 2–3 minuty audio przyniosą niewielką poprawę, a w niektórych przypadkach mogą nawet negatywnie wpłynąć na stabilność klonu.

Po zweryfikowaniu głosu musi on zostać dostrojony na naszych modelach, zanim będzie można go używać. W tym czasie możesz sprawdzić status głosu w My Voices, najeżdżając na jego nazwę. Zobaczysz wtedy wszystkie dostępne modele dla tego głosu. Aby sprawdzić status każdego modelu, najedź na jego nazwę. 

Jeśli coś poszło nie tak, możesz zobaczyć następujący status:

Przepraszamy, podczas trenowania wystąpiły problemy i proces został ponowiony. Nie musisz nic robić. Oznacza to, że coś poszło nie tak, ale twój głos został automatycznie umieszczony w kolejce do ponownego dostrajania. Twój głos powinien pomyślnie zakończyć proces dostrajania przy następnej próbie, ale jeśli wystąpi wiele błędów, problem może dotyczyć zbioru danych, którego AI nie potrafi rozwiązać.

Możesz spróbować rozwiązać ten problem, usuwając głos i ponownie przesyłając dane od początku. To pomogło niektórym użytkownikom.

Jeśli to nie rozwiąże problemu, może być konieczne sprawdzenie audio treningowego i użycie innych nagrań treningowych.

Jeśli podczas dostrajania występują błędy, zawsze możesz skontaktować się z pomocą techniczną pod adresem support@elevenlabs.io.

Jeśli podczas tworzenia Professional Voice Clone wykorzystasz wszystkie próby weryfikacji, odczekaj 24 godziny — wtedy możesz spróbować ponownie.

Możesz też skontaktować się z pomocą techniczną pod adresem support@elevenlabs.io, aby sprawdzili sprawę. Jeśli wszystko będzie w porządku, zresetują twoje próby weryfikacji, żebyś mógł spróbować ponownie.

Oto kilka wskazówek, które pomogą ci pomyślnie zweryfikować Professional Voice Clone:

  • Upewnij się, że przeglądarka ma dostęp do mikrofonu i że mikrofon nie jest wyciszony.
  • Upewnij się, że nagranie z mikrofonu komputera brzmi podobnie do audio przesłanego do klonowania, bez szumu tła ani innych zewnętrznych zakłóceń dźwiękowych.
  • Staraj się mówić w stylu podobnym do audio użytego do trenowania głosu.
  • Przeczytaj każdą linijkę weryfikacyjną tylko raz, a następnie naciśnij Stop, aby zakończyć nagrywanie. Przeczytanie linijki więcej niż raz może spowodować niepowodzenie weryfikacji.

Ten błąd pojawi się, jeśli spróbujesz użyć Professional Voice Clone (PVC), zanim zakończy się proces Finetune i głos będzie gotowy do użycia.

Po utworzeniu PVC musi on przejść kilka etapów, zanim będzie gotowy do użycia. Po zweryfikowaniu głosu zostanie on przetworzony i dodany do kolejki Finetune. W zależności od liczby innych głosów oczekujących obecnie na Finetune proces ten zwykle trwa od 3 do 6 godzin, ale może potrwać do 24 godzin.

Postęp PVC możesz sprawdzić w My Voices: znajdź głos na liście, a następnie kliknij View, aby zobaczyć więcej szczegółów. Najedź kursorem na każdy model, aby sprawdzić jego obecny status.

Więcej informacji o znaczeniu poszczególnych statusów znajdziesz w artykule Co oznacza status mojego Professional Voice Clone?

Gdy PVC zakończy Finetune i będzie gotowy do użycia, zobaczysz powiadomienie w wyskakującym oknie, a także otrzymasz e-mail.

Twój Professional Voice Clone przejdzie kilka etapów przetwarzania. Widać je w statusie Professional Voice Clone w My Voices.

Aby sprawdzić obecny status, znajdź swój głos na liście i spójrz na ikony wyświetlane po prawej stronie.

Wersja robocza: ten status oznacza, że twój głos jest niekompletny. Zwykle dlatego, że nie ukończyłeś tworzenia głosu lub nie zweryfikowałeś go jeszcze.

Aby przejść przez proces weryfikacji, kliknij ikonę znacznika wyboru.

Aby wrócić do tworzenia głosu, kliknij More actions (trzy kropki) i wybierz Edit voice.

Po zweryfikowaniu głosu musi on przejść Finetune na naszych modelach, zanim będzie można go użyć. Ten proces możesz śledzić, najeżdżając kursorem na nazwę głosu w My Voices. Zobaczysz tam wszystkie dostępne modele oraz ikonę wskazującą status każdego z nich.

Najedź kursorem na nazwę modelu, aby zobaczyć więcej informacji. Pojawi się jeden z poniższych statusów:

Zaplanowano proces trenowania: oznacza to, że twój głos czeka na wolne miejsce, aby rozpocząć trenowanie. Czas oczekiwania zależy od liczby innych głosów w kolejce.

Tworzenie zbioru danych i Finetune w toku: gdy zwolni się miejsce, rozpocznie się proces Finetune. Może to potrwać od 6 do 24 godzin. Postęp każdego etapu trenowania jest wskazywany procentowo.

Wystąpiły problemy podczas trenowania, więc proces został ponowiony. Nie musisz nic robić

Oznacza to, że coś poszło nie tak, ale twój głos został automatycznie dodany do kolejki, aby ponowić proces Finetune. Głos powinien pomyślnie zakończyć Finetune przy następnej próbie, ale jeśli problem wystąpi wielokrotnie, skontaktuj się z pomocą techniczną pod adresem support@elevenlabs.io.

Głos jest gotowy do użycia z tym modelem: oznacza to, że proces Finetune dla tego modelu został zakończony i możesz teraz używać głosu z tym modelem.

Kliknij, aby rozpocząć Finetune: niektóre modele nie trenują automatycznie i musisz kliknąć nazwę modelu, aby rozpocząć Finetune. Jeśli dla twojego głosu dostępne będą dodatkowe modele do Finetune, obok głosu zobaczysz ikonę wykrzyknika.

Aby rozpocząć Finetune, najedź kursorem na nazwę głosu i kliknij nazwę modelu.

Professional Voice Cloning obsługuje wszystkie języki dostępne w rodzinie modeli Eleven v4 — łącznie ponad 90 języków.

Rodzina modeli Eleven v4 obsługuje ponad 90 języków, w tym:

Afrykanerski (afr), amharski (amh), arabski (ara), armeński (hye), asamski (asm), asturyjski (ast), azerski (aze), białoruski (bel), bengalski (ben), bośniacki (bos), bułgarski (bul), birmański (mya), kantoński (yue), kataloński (cat), cebuański (ceb), chorwacki (hrv), czeski (ces), duński (dan), niderlandzki (nld), angielski (eng), estoński (est), filipiński (fil), fiński (fin), francuski (fra), fula/pulaar (ful), galicyjski (glg), gruziński (kat), niemiecki (deu), grecki (ell), gudżaracki (guj), hausa (hau), hebrajski (heb), hindi (hin), węgierski (hun), islandzki (isl), indonezyjski (ind), włoski (ita), japoński (jpn), jawajski (jav), kamba (kam), kannada (kan), kazachski (kaz), koreański (kor), kirgiski (kir), laotański (lao), łotewski (lav), lingala (lin), litewski (lit), luganda (lug), luksemburski (ltz), macedoński (mkd), malajski (msa), malajalam (mal), maltański (mlt), mandaryński chiński (cmn), maoryski (mri), marathi (mar), mongolski (mon), nepalski (nep), norweski bokmål (nob), oksytański (oci), odia (ori), paszto (pus), perski (fas), polski (pol), portugalski, Brazylia (por), pendżabski (pan), rumuński (ron), rosyjski (rus), serbski (srp), shona (sna), sindhi (snd), słowacki (slk), słoweński (slv), somalijski (som), kurdyjski sorani (ckb), hiszpański, Ameryka Łacińska (spa), suahili (swa), szwedzki (swe), tadżycki (tgk), tamilski (tam), telugu (tel), tajski (tha), turecki (tur), ukraiński (ukr), urdu (urd), uzbecki (uzb), wietnamski (vie), walijski (cym), wolof (wol), zulu (zul).

Professional Voice Cloning polega na trenowaniu (Finetune) modelu na dużych zbiorach nagrań głosu konkretnej osoby, aby stworzyć własny model.

Po przesłaniu próbek i zweryfikowaniu głosu twój Professional Voice Clone zostanie dodany do kolejki. Szacowany czas trenowania to około 3–6 godzin. Zależy on od kilku czynników, dlatego trudno podać dokładny czas. Niestety czasem może to potrwać dłużej.

Obecny status głosu możesz sprawdzić w My Voices. Więcej informacji znajdziesz w artykule Co oznacza status mojego Professional Voice Clone?

Gdy PVC zakończy Finetune, otrzymasz powiadomienia w aplikacji i e-mail z informacją, że twój głos jest gotowy do użycia.

No results