Przedstawiamy Voice Changer
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Voice Changer pierwotnie nosił nazwę speech-to-speech. W kontekście agentów głosowych AI, „speech-to-speech” oznacza też architekturę zespoloną, w której jeden model bezpośrednio obsługuje wejście i wyjście audio. ElevenAgents korzysta na swojej platformie z zaawansowanej architektury kaskadowej. Dowiedz się więcej: Modele kaskadowe a zespolone.
Voice Changer
Dodaliśmy Voice Changer do Speech Synthesis. Voice Changer to narzędzie do konwersji głosu, które sprawia, że nagranie jednego głosu brzmi tak, jakby mówił je ktoś inny — z zachowaniem oryginalnej interpretacji. Oznacza to, że emocje, timing, tempo i wymowa z nagrania przechodzą do głosu wynikowego.
Daje ci to poziom kontroli, którego same prompty zamiany tekstu na mowę nie zawsze zapewniają. Możesz używać go na dwa główne sposoby.
Wydobądź z głosu więcej emocji. Nie każdy głos równie dobrze reaguje na wskazówki emocjonalne w promptach zamiany tekstu na mowę. Voice Changer pozwala nagrać lub przesłać bardzo ekspresyjną wypowiedź i odtworzyć ten zakres emocji w innym głosie. Jeśli potrzebujesz, by profesjonalny narrator brzmiał cieplej albo postać z książki dla dzieci była bardziej figlarna, możesz samodzielnie zagrać tę kwestię, a Voice Changer przeniesie ją do wybranego głosu.
Dopracuj sposób mówienia. Nasze modele zamiany tekstu na mowę zwykle dobrze radzą sobie z intonacją od razu. Gdy jednak potrzebujesz precyzyjnej kontroli nad konkretną frazą — gdzie położyć akcent, jak zrobić pauzę, jaki nadać rytm — Voice Changer pozwala pokazać to własnym głosem, a potem zastosować tę interpretację w dowolnym wybranym głosie. Będzie to jeszcze przydatniejsze, gdy zintegrujemy Voice Changer bezpośrednio ze Studio, ale cel pozostaje ten sam: dać ci precyzyjną kontrolę nad rezultatem.
Oto prezentacja od jednego z członków naszej społeczności:
Badania
Aby przekształcić mowę źródłową w docelową, musimy wyrazić treść mowy źródłowej cechami mowy docelowej. Dobrym porównaniem jest zamiana twarzy: aplikacje, które biorą dwie twarze i łączą je, umieszczając cechy jednej osoby w odwzorowanej strukturze twarzy drugiej.
Polega to na wzięciu obrazu twarzy i odwzorowaniu jej cech. Znaczniki w przykładzie poniżej właśnie to robią — wyznaczają granice, w których zostałaby odwzorowana druga twarz.
Kluczem w konwersji głosu jest odtworzenie treści mowy źródłowej za pomocą fonemów mowy docelowej. Jest tu jednak kompromis, podobnie jak przy zamianie twarzy: im więcej znaczników użyjesz do odwzorowania cech jednej twarzy, tym więcej ograniczeń narzucisz twarzy odwzorowywanej w ich obrębie. Mniej znaczników oznacza mniej ograniczeń.
Tak samo jest z konwersją głosu. Im większy priorytet nadajemy mowie docelowej, tym większe ryzyko, że przestanie ona być zgodna z mową źródłową. Jeśli jednak nadamy jej zbyt mały priorytet, możemy utracić wiele z tego, co nadaje tej mowie charakter. Na przykład, gdybyśmy próbowali odtworzyć nagranie osoby krzyczącej ze złością szeptliwym głosem, pojawiłby się problem. Zbyt duży priorytet dla emocji mowy źródłowej sprawi, że stracimy wrażenie, że mówi szeptliwy głos. Zbyt duży nacisk na szeptliwy sposób mówienia sprawi natomiast, że utracimy ładunek emocjonalny mowy źródłowej.
Produkt i najnowsze aktualizacje
Zmiany w gotowych głosach
Wprowadzamy zmiany w domyślnych głosach dostępnych w Speech Synthesis. Wycofamy kilka głosów i zastąpimy je nowymi. W nadchodzących tygodniach planujemy dodać ponad 20 głosów.
Zaczniemy też wyświetlać w interfejsie informację, jak długo każdy głos ma być dostępny. W grudniu odświeżymy funkcje udostępniania głosów i wynagrodzeń za ich użycie, aby zwiększyć różnorodność głosów. Wkrótce więcej szczegółów.
Eleven Turbo v2 i format uLaw 8 kHz
Turbo v2 to efekt miesięcy badań naszego zespołu. Został stworzony do interakcji w czasie rzeczywistym, ale sprawdzi się w każdym zastosowaniu. Obsługuje też standardowy format (m)uLaw 8 kHz dla systemów IVR.
Normalizacja i metadane w Studio
Studio obsługuje teraz branżowe wytyczne przesyłania audiobooków, w tym regulację wzmocnienia i kompresję dynamiki. Możesz też osadzać metadane — ISBN, autora i tytuł — bezpośrednio w projekcie Studio.
Słownik wymowy
To jedna z najczęściej zgłaszanych przez was funkcji. W zeszłym miesiącu dodaliśmy w naszych angielskich modelach obsługę tagów SSML do określania wymowy przy użyciu słowników IPA i CMU. Teraz udostępniliśmy obsługę słowników wymowy w interfejsie Studio. Możesz przesłać plik określający wymowę za pomocą IPA, CMU lub zamienników słów (aliasów). Pliki słowników używają otwartego, branżowego formatu plików leksykonu .PLS format pliku leksykonu.
IPA i CMU są obecnie obsługiwane przez Turbo v2 English. Zamienniki słów obsługują wszystkie modele i języki. Pełna dokumentacja jest dostępna tutaj.
Jeśli masz uwagi, napisz do nas na Discordzie!
Wypróbuj Voice Changer
Powiedz to po swojemu i usłysz w zupełnie innym głosie, z pełną kontrolą nad interpretacją. Uchwyć szepty, śmiech, akcenty i subtelne emocje.
Powiedz to po swojemu i usłysz to w zupełnie innym głosie, mając pełną kontrolę nad efektem. Wychwytuj szepty, śmiech, akcenty i subtelne emocje.




