Przejdź do treści

Przedstawiamy Voice Changer

Opublikowano

PosłuchajPosłuchaj tego artykułu

Voice Changer początkowo nazywał się mowa-mowa. W kontekście agentów głosowych AI, „mowa-mowa” oznacza też architektury zespolone, w których jeden model bezpośrednio obsługuje wejście i wyjście audio. ElevenAgents używa na swojej platformie zaawansowanej architektury kaskadowej. Dowiedz się więcej: Modele kaskadowe a zespolone.

Voice Changer

Dodaliśmy Voice Changer do Speech Synthesis. Voice Changer to narzędzie do konwersji głosu, które przekształca nagranie jednego głosu tak, by brzmiało, jakby wypowiedział je ktoś inny — z zachowaniem oryginalnej interpretacji. Oznacza to, że emocje, timing, tempo i wymowa z nagrania przechodzą do głosu wynikowego.

Daje ci to poziom kontroli, którego same prompty zamiany tekstu na mowę nie zawsze zapewniają. Możesz używać go na dwa główne sposoby.

Wydobądź z głosu więcej emocji. Nie każdy głos równie dobrze reaguje na wskazówki emocjonalne w promptach zamiany tekstu na mowę. Voice Changer pozwala nagrać lub przesłać bardzo ekspresyjną wypowiedź i odtworzyć ten zakres emocji innym głosem. Jeśli profesjonalny narrator ma brzmieć cieplej, a postać z książki dla dzieci bardziej figlarnie, możesz sam nadać wypowiedzi odpowiednią interpretację, a Voice Changer przeniesie ją do wybranego głosu.

Doprecyzuj sposób wypowiedzi. Nasze modele zamiany tekstu na mowę zwykle dobrze radzą sobie z intonacją od razu. Gdy jednak potrzebujesz precyzyjnie określić, jak ma wybrzmieć konkretna fraza — gdzie położyć nacisk, jak zrobić pauzę, jaki nadać rytm — Voice Changer pozwala pokazać to własnym głosem, a potem zastosować tę interpretację w dowolnie wybranym głosie. Będzie to jeszcze przydatniejsze, gdy zintegrujemy Voice Changer bezpośrednio ze Studio, ale cel pozostaje ten sam: dać ci precyzyjną kontrolę nad efektem.

Oto prezentacja od jednego z członków naszej społeczności:

Badania

Aby przekształcić mowę źródłową w docelową, musimy wyrazić treść mowy źródłowej cechami mowy docelowej. Dobrym porównaniem jest zamiana twarzy: aplikacje, które łączą dwie twarze, umieszczając cechy jednej osoby w odwzorowanej strukturze twarzy drugiej.

W tym celu bierzemy obraz twarzy i odwzorowujemy jej cechy. Punkty orientacyjne na poniższym przykładzie właśnie to robią — wyznaczają granice, w których zostałaby wyrenderowana druga twarz.

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

W konwersji głosu chodzi o to, by odtworzyć treść mowy źródłowej za pomocą fonemów mowy docelowej. Wiąże się to jednak z kompromisem, podobnie jak przy zamianie twarzy: im więcej punktów użyjesz do odwzorowania cech jednej twarzy, tym więcej ograniczeń narzucisz twarzy odwzorowywanej w ich obrębie. Mniej punktów to mniej ograniczeń.

Tak samo jest z konwersją głosu. Im większe znaczenie nadajemy mowie docelowej, tym większe ryzyko, że przestanie ona być zgodna z mową źródłową. Jeśli zaś nadamy jej zbyt małe znaczenie, możemy stracić wiele z tego, co nadaje tej mowie charakter. Na przykład, gdybyśmy chcieli odtworzyć nagranie osoby krzyczącej ze złości szeptliwym głosem, pojawiłby się problem. Zbyt duży nacisk na emocje mowy źródłowej sprawi, że zniknie wrażenie, że mówi szeptliwy głos. Zbyt duży nacisk na szeptliwy sposób mówienia sprawi z kolei, że stracimy ładunek emocjonalny mowy źródłowej.

Produkt i ostatnie aktualizacje

Zmiany w gotowych głosach

Wprowadzamy zmiany w domyślnych głosach dostępnych w Speech Synthesis. Wycofamy kilka głosów i zastąpimy je nowymi, a w nadchodzących tygodniach planujemy dodać ponad 20 kolejnych.

Zaczniemy też pokazywać w UI, jak długo dany głos ma być dostępny. W grudniu odświeżymy funkcje udostępniania głosów i wynagrodzeń za ich użycie, by zwiększyć różnorodność głosów. Wkrótce podamy więcej szczegółów.

Eleven Turbo v2 i format uLaw 8 kHz

Turbo v2 to efekt miesięcy badań naszego zespołu. Zaprojektowaliśmy go do interakcji w czasie rzeczywistym, ale sprawdzi się w każdym zastosowaniu. Obsługuje też standardowy format (m)uLaw 8 kHz dla systemów IVR.

Normalizacja i metadane w Studio

Studio obsługuje teraz standardowe w branży wytyczne dotyczące publikacji audiobooków, w tym regulację wzmocnienia i kompresję dynamiki. Możesz też osadzić metadane (ISBN, autora i tytuł) bezpośrednio w projekcie Studio.

Słownik wymowy

To jedna z najczęściej zgłaszanych przez was funkcji. W zeszłym miesiącu dodaliśmy obsługę tagów SSML do określania wymowy za pomocą słowników IPA i CMU w naszych modelach angielskich. Teraz udostępniliśmy obsługę słowników wymowy w UI Studio, dzięki czemu możesz przesłać plik określający wymowę za pomocą IPA, CMU lub zamienników słów (aliasów). Pliki słowników używają otwartego, standardowego w branży formatu pliku leksykonu .PLS.

IPA i CMU są obecnie obsługiwane przez Turbo v2 English. Zamienniki słów obsługują wszystkie modele i języki. Pełna dokumentacja jest dostępna tutaj.

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

Jeśli masz uwagi, napisz do nas na Discordzie!

Wypróbuj Voice Changer

Powiedz to po swojemu i usłysz w zupełnie innym głosie, z pełną kontrolą nad interpretacją. Uchwyć szepty, śmiech, akcenty i subtelne emocje.

Powiedz to po swojemu i usłysz to w zupełnie innym głosie, mając pełną kontrolę nad efektem. Wychwytuj szepty, śmiech, akcenty i subtelne emocje.

Podobne artykuły

Twórz z najwyższej jakości audio AI