Najlepsze praktyki
Dowiedz się, jak kontrolować sposób wypowiedzenia, wymowę i emocje oraz optymalizować tekst pod kątem mowy.
Ten przewodnik przedstawia techniki poprawy wyników zamiany tekstu na mowę z użyciem modeli ElevenLabs. Eksperymentuj z nimi, aby znaleźć rozwiązanie najlepsze dla swoich potrzeb.
Kontrola
Aktywnie pracujemy nad Director’s Mode, by dać ci jeszcze większą kontrolę nad wynikami.
Te techniki pozwolą ci uzyskać niuansowane rezultaty, dopóki nie udostępnimy zaawansowanych funkcji takich jak Director’s Mode.
Pauzy
Eleven v4 i Eleven v3 nie obsługują tagów przerwy SSML. Aby kontrolować pauzy, użyj technik opisanych w sekcji Promptowanie Eleven v4.
Użyj <break time="x.xs" />, aby dodać naturalne pauzy trwające do 3 sekund.
Użycie zbyt wielu tagów przerwy w jednej generacji może powodować niestabilność. AI może przyspieszyć albo dodać szumy czy artefakty dźwiękowe. Pracujemy nad rozwiązaniem tego problemu.
- Spójność: Używaj tagów
<break>konsekwentnie, by zachować naturalny rytm mowy. Nadmierne użycie może powodować niestabilność. - Zachowanie zależne od głosu: Różne głosy mogą inaczej obsługiwać pauzy, zwłaszcza te wytrenowane na dźwiękach wypełniających, takich jak „uh” czy „ah”.
Alternatywą dla <break> są myślniki (- lub —) dla krótkich pauz oraz wielokropki (…) dla wahania. Są jednak mniej spójne.
Wymowa
IPA w Eleven v4
Eleven v4 (eleven_v4) zapewnia lepszą natywną obsługę Międzynarodowego Alfabetu Fonetycznego (IPA), dzięki czemu masz większą kontrolę nad wymową nazw, terminów technicznych i innych słów wymagających specjalnego traktowania. Wymowa IPA jest bardziej spójna niż w poprzednich modelach, ale wyniki nadal mogą się różnić zależnie od głosu i frazy. Zalecamy przetestowanie ważnej wymowy z wybranym głosem, zanim użyjesz jej w produkcji.
W przeciwieństwie do starszych modeli, które wymagają tagów fonemów w stylu XML, Eleven v4 rozumie symbole IPA, gdy umieścisz je między ukośnikami w tekście:
Transkrypcja IPA powinna:
- Być otoczona ukośnikami (
/) na początku i końcu - Być zapisana standardowymi symbolami IPA
- Być ujęta w podwójne cudzysłowy, gdy przekazujesz ją jako parametr tekstowy
Przykłady kodu
Możesz umieścić kilka transkrypcji IPA w jednym ciągu tekstowym:
Dobre praktyki
- Używaj standardowych symboli IPA z tabeli Międzynarodowego Alfabetu Fonetycznego
- Dodawaj znaczniki akcentu: głównego (ˈ) i pobocznego (ˌ) dla słów wielosylabowych
- Stosuj wybiórczo: otaczaj tylko konkretne słowa lub frazy wymagające kontroli wymowy
- Testuj z wybranym głosem: różne głosy mogą nieco inaczej interpretować IPA
Rozwiązywanie problemów
Wymowa nadal jest nieprawidłowa
Sprawdź w słowniku IPA, czy transkrypcja IPA jest poprawna. Dodaj znaczniki akcentu (ˈ dla akcentu głównego, ˌ dla pobocznego) w słowach wielosylabowych. Testuj z różnymi głosami, ponieważ niektóre mogą dokładniej interpretować IPA niż inne.
Niespójne wyniki dla tego samego IPA
Wymowa IPA jest bardziej spójna niż w poprzednich modelach, ale wyniki nadal mogą się różnić zależnie od głosu i frazy. Zalecamy przetestowanie ważnej wymowy z wybranym głosem przed użyciem jej w produkcji. Jeśli potrzebujesz spójnego wyniku, wygeneruj go więcej niż raz i wybierz najlepszy.
Tagi fonemów dla modeli v2
W modelach v2 określaj wymowę za pomocą tagów fonemów SSML. Obsługiwane alfabety to CMU Arpabet oraz Międzynarodowy Alfabet Fonetyczny (IPA).
Tagi fonemów są zgodne tylko z modelem eleven_flash_v2.
W modelach v2 zalecamy CMU Arpabet, ponieważ zapewnia spójne i przewidywalne wyniki. IPA również może działać skutecznie, ale CMU Arpabet zwykle jest bardziej niezawodny.
Tagi fonemów działają tylko dla pojedynczych słów. Jeśli imię i nazwisko mają być wymawiane w określony sposób, musisz utworzyć tag fonemu dla każdego słowa.
Aby zachować poprawną wymowę słów wielosylabowych, zadbaj o właściwe oznaczenie akcentu:
Tagi aliasów
W modelach, które nie obsługują tagów fonemów, możesz spróbować zapisywać słowa bardziej fonetycznie. Możesz też stosować różne triki, np. wielkie litery, myślniki, apostrofy, a nawet pojedyncze cudzysłowy wokół jednej litery lub kilku liter.
Na przykład słowo „trapezii” można zapisać jako „trapezIi”, by mocniej podkreślić „ii”.
Możesz zastąpić słowo bezpośrednio w tekście. Jeśli jednak chcesz określić wymowę innymi słowami lub frazami przy użyciu słownika wymowy, użyj tagów aliasów. To przydaje się przy generowaniu z Multilingual v2, który nie obsługuje tagów fonemów. Słowników wymowy możesz używać w ElevenCreative Studio, Dubbing Studio oraz Speech Synthesis przez API.
Na przykład jeśli tekst zawiera nazwę o nietypowej wymowie, z którą AI może mieć trudność, możesz użyć tagu aliasu, by określić jej wymowę:
Jeśli chcesz mieć pewność, że skrót będzie zawsze wymawiany w określony sposób, gdy pojawi się w tekście, możesz użyć tagu aliasu:
Słowniki wymowy
Niektóre nasze narzędzia, takie jak ElevenCreative Studio i Dubbing Studio, pozwalają tworzyć i przesyłać słowniki wymowy. Możesz w nich określić wymowę wybranych słów, np. nazw postaci lub marek, albo sposób odczytywania skrótów.
Słowniki wymowy umożliwiają to przez przesłanie pliku leksykonu lub słownika, który określa pary słów i ich wymowę — za pomocą alfabetu fonetycznego albo zamiany słów.
Gdy któreś z tych słów pojawi się w projekcie, model AI wymówi je zgodnie z określoną zamianą.
Aby dodać plik słownika wymowy, otwórz ustawienia projektu i prześlij plik TXT lub w formacie .PLS. Po dodaniu słownika do projektu automatycznie sprawdzimy, które fragmenty projektu trzeba ponownie przekonwertować z użyciem nowego pliku słownika, i oznaczymy je jako nieprzekonwertowane.
Obecnie obsługujemy tylko słowniki wymowy, które określają zamiany za pomocą tagów fonemów lub aliasów.
Zarówno fonemy, jak i aliasy to zestawy reguł określających wyszukiwane słowo lub frazę, nazywane grafemem, oraz to, czym zostaną zastąpione. Pamiętaj, że wyszukiwanie rozróżnia wielkość liter. Podczas sprawdzania słowa do zastąpienia w słowniku wymowy słownik jest przeszukiwany od początku do końca i używane jest tylko pierwsze dopasowanie.
Przykłady słowników wymowy
Poniżej znajdziesz przykłady słowników wymowy w CMU Arpabet i IPA, zawierające fonem określający wymowę słowa „Apple” oraz alias zastępujący „UN” frazą „United Nations”:
Aby wygenerować plik słownika wymowy .pls, możesz skorzystać z kilku narzędzi open source:
- Sequitur G2P - Narzędzie open source, które uczy się reguł wymowy z danych i może generować transkrypcje fonetyczne.
- Phonetisaurus - System G2P open source trenowany na istniejących słownikach, takich jak CMUdict.
- eSpeak - Syntezator mowy, który może generować transkrypcje fonemów z tekstu.
- CMU Pronouncing Dictionary - Gotowy słownik angielski z transkrypcjami fonetycznymi.
Emocje
Przekazuj emocje przez kontekst narracyjny lub jawne tagi dialogowe. Dzięki temu AI lepiej rozumie ton i emocję, które ma naśladować.
Jawne tagi dialogowe dają bardziej przewidywalne wyniki niż poleganie wyłącznie na kontekście, ale model nadal będzie wypowiadał wskazówki dotyczące emocji. Jeśli nie są potrzebne, możesz je usunąć w postprodukcji za pomocą edytora audio.
Tempo
Na tempo audio duży wpływ ma materiał użyty do stworzenia głosu. Tworząc głos, zalecamy używanie dłuższych, ciągłych próbek, aby uniknąć problemów z tempem, takich jak nienaturalnie szybka mowa.
Aby kontrolować szybkość generowanego audio, możesz użyć ustawienia szybkości. Pozwala ono przyspieszyć lub spowolnić generowaną mowę. Ustawienie szybkości jest dostępne w Text to Speech na stronie i przez API, a także w ElevenCreative Studio i Agents Platform. Znajdziesz je w ustawieniach głosu.
Wartość domyślna to 1.0, co oznacza, że szybkość nie jest zmieniana. Wartości poniżej 1.0 spowalniają głos, maksymalnie do 0.7. Wartości powyżej 1.0 przyspieszają głos, maksymalnie do 1.2. Skrajne wartości mogą wpłynąć na jakość generowanej mowy.
Tempo możesz też kontrolować, pisząc naturalnym, narracyjnym stylem.
Wskazówki
Typowe problemy
Niespójne pauzy: upewnij się, że do pauz używasz składni
<break time=“x.xs” />.- Błędy wymowy: używaj tagów fonemów CMU Arpabet lub IPA, aby precyzyjnie określić wymowę.
Niewłaściwe emocje: dodaj kontekst narracyjny lub jawne tagi, by wskazać emocje. Pamiętaj, aby usunąć tekst wskazówek emocjonalnych w postprodukcji.
Wskazówki, jak poprawić wyniki
Eksperymentuj z innym sformułowaniem, aby uzyskać pożądane tempo lub emocje. W przypadku złożonych efektów dźwiękowych podziel prompty na mniejsze, kolejne elementy i połącz wyniki ręcznie.
Kontrola kreatywna
Choć aktywnie rozwijamy „Director’s Mode”, by dać użytkownikom jeszcze większą kontrolę nad wynikami, oto kilka tymczasowych technik, które pomogą zwiększyć kreatywność i precyzję:
Styl narracyjny
Pisz prompty w stylu narracyjnym, podobnym do scenariusza, aby skutecznie kierować tonem i tempem.
Warstwowe wyniki
Generuj efekty dźwiękowe lub mowę w segmentach, a następnie nakładaj je na siebie w programie do edycji audio, by tworzyć bardziej złożone kompozycje.
Eksperymenty fonetyczne
Jeśli wymowa nie jest idealna, eksperymentuj z alternatywną pisownią lub przybliżeniami fonetycznymi, aby uzyskać pożądany efekt.
Normalizacja tekstu
Podczas korzystania z Text to Speech z bardziej złożonymi elementami, takimi jak numery telefonów, kody pocztowe czy e-maile, mogą być one błędnie wymawiane. Często wynika to z tego, że konkretne elementy nie znalazły się w zbiorze treningowym, a mniejsze modele nie potrafią uogólnić sposobu ich wymowy. Ten przewodnik wyjaśnia, kiedy pojawiają się takie różnice i jak zadbać o poprawną wymowę.
Normalizacja jest domyślnie włączona we wszystkich modelach TTS, aby poprawić wymowę liczb, dat i innych złożonych elementów tekstu.
Dlaczego modele różnie odczytują dane wejściowe?
Niektóre modele są trenowane, by odczytywać liczby i wyrażenia w bardziej naturalny dla człowieka sposób. Na przykład fraza “$1,000,000” jest poprawnie odczytywana jako “one million dollars” przez model Eleven Multilingual v2. Jednak ten sam zapis model Eleven Flash v2.5 odczytuje jako “one thousand thousand dollars”.
Wynika to z tego, że Multilingual v2 jest większym modelem i lepiej potrafi uogólniać sposób odczytywania liczb tak, by brzmiało to naturalniej dla słuchaczy. Flash v2.5 jest znacznie mniejszym modelem, więc nie ma takich możliwości.
Typowe przykłady
Modele Text to Speech mogą mieć trudności z poniższymi elementami:
- Numerami telefonów (“123-456-7890”)
- Walutami (“$47,345.67”)
- Wydarzeniami w kalendarzu (“2024-01-01”)
- Godzinami (“9:23 AM”)
- Adresami (“123 Main St, Anytown, USA”)
- Adresami URL (“example.com/link/to/resource”)
- Skrótami jednostek (“TB” zamiast “Terabyte”)
- Skrótami klawiszowymi (“Ctrl + Z”)
Jak temu zapobiec
Używaj wytrenowanych modeli
Najprostszym sposobem jest użycie modelu TTS wytrenowanego do bardziej naturalnego odczytywania liczb i wyrażeń, takiego jak Eleven Multilingual v2. Nie zawsze jest to jednak możliwe, na przykład gdy w twoim zastosowaniu kluczowe są niskie opóźnienia (np. w agentach konwersacyjnych).
Dodaj normalizację do promptów LLM
Jeśli używasz LLM do generowania tekstu dla TTS, możesz dodać instrukcje normalizacji do promptu.
Używaj jasnych i konkretnych promptów
LLM najlepiej reagują na uporządkowane i jednoznaczne instrukcje. Prompt powinien wyraźnie określać, że tekst ma zostać przekonwertowany do formatu czytelnego dla mowy.
Uwzględnij różne formaty liczb
Nie wszystkie liczby odczytuje się tak samo. Zastanów się, jak powinny być wypowiadane różne typy liczb:
- Liczby główne: 123 → “one hundred twenty-three”
- Liczby porządkowe: 2nd → “second”
- Wartości pieniężne: $45.67 → “forty-five dollars and sixty-seven cents”
- Numery telefonów: “123-456-7890” → “one two three, four five six, seven eight nine zero”
- Liczby dziesiętne i ułamki: “3.5” → “three point five”, “⅔” → “two-thirds”
- Liczby rzymskie: “XIV” → “fourteen” (lub “the fourteenth”, jeśli to tytuł)
Usuń lub rozwiń skróty
Dla jasności popularne skróty należy rozwinąć:
- “Dr.” → “Doctor”
- “Ave.” → “Avenue”
- “St.” → “Street” (ale “St. Patrick” powinno pozostać bez zmian)
Możesz poprosić o wyraźne rozwinięcie w prompcie:
Rozwiń wszystkie skróty do pełnych form wypowiadanych.
Normalizacja wyrażeń alfanumerycznych
Normalizacja nie dotyczy tylko liczb — dla jasności warto też normalizować niektóre wyrażenia alfanumeryczne:
- Skróty klawiszowe: “Ctrl + Z” → “control z”
- Skróty jednostek: “100km” → “one hundred kilometers”
- Symbole: “100%” → “one hundred percent”
- Adresy URL: “elevenlabs.io/docs” → “eleven labs dot io slash docs”
- Wydarzenia w kalendarzu: “2024-01-01” → “January first, two-thousand twenty-four”
Weź pod uwagę przypadki brzegowe
Różne konteksty mogą wymagać różnych konwersji:
- Daty: “01/02/2023” → “January second, twenty twenty-three” lub “the first of February, twenty twenty-three” (zależnie od języka)
- Godziny: “14:30” → “two thirty PM”
Jeśli potrzebujesz konkretnego formatu, zaznacz to wyraźnie w prompcie.
Wszystko razem
Ten prompt będzie dobrym punktem wyjścia dla większości zastosowań:
Użyj wyrażeń regularnych do wstępnego przetwarzania
Jeśli używasz kodu do promptowania LLM, możesz użyć wyrażeń regularnych, aby znormalizować tekst przed przekazaniem go do modelu. To bardziej zaawansowana technika, która wymaga pewnej znajomości wyrażeń regularnych. Oto kilka prostych przykładów:
Prompty w Eleven v4
Ta sekcja dotyczy Eleven v4. Wiele poniższych technik sprawdza się też w Eleven v3. Ogólnie Eleven v4 to wyraźne ulepszenie względem Eleven v3 i daje lepsze wyniki w niemal każdym przypadku. Zdecydowanie zalecamy przejście na v4 i przetestowanie go z własnymi głosami oraz treściami, aby zobaczyć różnicę. Kilka skrajnych przypadków może wymagać innego rozwiązania, ale dla większości użytkowników v4 będzie lepszym wyborem.
Informacje o zmianach w modelu — Voice Cloning, obsłudze akcentów, wariantach i porównaniach — znajdziesz w Eleven v4.
Eleven v4 i Eleven v3 nie obsługują tagów przerwy SSML. Używaj tagów audio, interpunkcji (wielokropków) i struktury tekstu, aby sterować pauzami i tempem.
Wybór głosu
Głos wciąż ma znaczenie. Sposób mówienia, który jest już w danych treningowych — szept, krzyk, konkretny styl — jest modelowi łatwiej odtworzyć. Poproszenie o coś spoza tych danych jest trudniejsze. Eleven v4 lepiej niż wcześniejsze modele stosuje się do tagów audio, także gdy głos nie był trenowany w danym stylu. Głos, który nigdy nie szeptał, nadal powinien reagować na [whispering], a głos, który nigdy nie krzyczał — na [shouting]. Może to jednak działać mniej niezawodnie, a wynik nie zawsze będzie optymalny. Wstępne testy pokazują, że działa to całkiem dobrze. Zdecydowanie zalecamy przetestowanie tego z wybranym głosem i w konkretnym zastosowaniu.
Tagi audio
Tagi audio (np. [whispering], [shouting], [laughing]) pozwalają precyzyjnie sterować sposobem mówienia, a Eleven v4 obsługuje je z większą finezją niż wcześniejsze modele. Nie są jeszcze idealne, a my nadal je rozwijamy, by model niezawodniej stosował się do instrukcji z tagów — to obszar, nad którym stale pracujemy i który będzie coraz lepszy.
Dużo pomaga precyzyjne określenie tego, czego chcesz. Ponieważ Eleven v4 jest trenowany zarówno do generowania stylów wypowiedzi, jak i efektów dźwiękowych, tag może czasem zostać zinterpretowany jako prośba o efekt dźwiękowy zamiast instrukcji dotyczącej mówienia (lub odwrotnie). Tagi jasno opisujące pożądaną jakość głosu (np. [low, gravelly voice] zamiast czegoś, co można odczytać jako sygnał dźwiękowy) pomagają modelowi wygenerować zamierzony efekt. Zalecamy testowanie konkretnych tagów i sformułowań dla twojego zastosowania — i spodziewaj się, że będzie to stale ulepszane.
Tagi działają lepiej, gdy dany styl mówienia jest już w danych treningowych głosu. Eleven v4 może
nadal zastosować tag, w którym głos nie był trenowany, np. [whispering] lub [shouting], ale
wynik może nie być optymalny.
Związane z głosem
Te tagi sterują sposobem mówienia i ekspresją emocji:
[laughs],[laughs harder],[starts laughing],[wheezing][whispers][sighs],[exhales][sarcastic],[curious],[excited],[crying],[snorts],[mischievously]
Efekty dźwiękowe
Dodaj dźwięki otoczenia i efekty:
[gunshot],[applause],[clapping],[explosion][swallows],[gulps]
Unikalne i specjalne
Eksperymentalne tagi do kreatywnych zastosowań:
[strong X accent](zastąp X wybranym akcentem)[sings],[woo],[fart]
Niektóre eksperymentalne tagi mogą działać mniej spójnie w różnych głosach. Dokładnie je przetestuj przed użyciem na produkcji.
Interpunkcja
Interpunkcja znacząco wpływa na sposób mówienia w v4:
- Wielokropki (…) dodają pauzy i podkreślają wagę wypowiedzi
- Wielkie litery wzmacniają akcent
- Standardowa interpunkcja nadaje naturalny rytm mowie
Przykłady z jednym mówcą
Używaj tagów świadomie i dopasowuj je do charakteru głosu. Medytacyjny głos nie powinien krzyczeć, a energiczny głos nie będzie przekonująco szeptać.
Ekspresyjny monolog
Dynamiczny i humorystyczny
Symulacja obsługi klienta
Dialog z wieloma mówcami
v4 skutecznie obsługuje prompty z wieloma głosami. Przypisz każdemu mówcy osobny głos z Voice Library, aby tworzyć realistyczne rozmowy.
Prezentacja dialogu
Komedia z błędami
Nakładające się wypowiedzi
Ulepszanie tekstu wejściowego
W interfejsie ElevenLabs możesz automatycznie wygenerować pasujące tagi audio dla wpisanego tekstu, klikając przycisk „Enhance”. W tle używany jest LLM, który ulepsza tekst wejściowy za pomocą następującego promptu:
Wskazówki
Łączenie tagów
Możesz łączyć wiele tagów audio, aby uzyskać złożoną ekspresję emocji. Testuj różne połączenia, aby sprawdzić, co najlepiej działa z twoim głosem.
Dopasowanie głosu
Dopasuj tagi do charakteru głosu i jego danych treningowych. Poważny, profesjonalny głos może
słabo reagować na żartobliwe tagi, takie jak [giggles] czy [mischievously].
Struktura tekstu
Struktura tekstu mocno wpływa na wynik w v4. Aby uzyskać najlepsze efekty, używaj naturalnych wzorców mowy, poprawnej interpunkcji i jasnego kontekstu emocjonalnego.
Eksperymentowanie
Poza tą listą prawdopodobnie istnieje wiele innych skutecznych tagów. Eksperymentuj z opisami stanów emocjonalnych i działań, aby odkryć, co działa w twoim konkretnym zastosowaniu.
Przykłady
Aktorstwo głosowe
Długa narracja
Prompty w Eleven v3
Techniki promptowania opisane w Prompting Eleven v4 dotyczą też Eleven v3, w tym wyboru głosu, tagów audio, interpunkcji i dialogów z wieloma mówcami.
Profesjonalne klony głosu (PVC) nie są w pełni zoptymalizowane pod kątem Eleven v3, co może skutkować niższą jakością klonu niż w przypadku wcześniejszych modeli. PVC są obsługiwane w v4, więc jeśli chcesz użyć Professional Voice Clone lub głosu z Voice Library, zalecamy wypróbowanie Eleven v4.