For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Przewodnik po zamianie tekstu na mowę z ElevenLabs
Omówienie
Technologia Text to Speech od ElevenLabs to ważna część naszej oferty. Zapewnia wysokiej jakości mowę generowaną przez AI w różnych zastosowaniach na całym świecie. Prawdopodobnie już słyszałeś nasze głosy w akcji, tworzące naturalne doświadczenia audio.
Wygenerowanie pierwszego audio za pomocą Text to Speech jest bardzo proste. Aby jednak w pełni wykorzystać tę funkcję, warto pamiętać o kilku rzeczach.
Kliknij przycisk „Generate”, aby utworzyć plik audio.
Ustawienia
Poznaj głosy, modele i ustawienia do tworzenia wysokiej jakości mowy.
Używane ustawienia, zwłaszcza głos i model, znacząco wpływają na wynik. Warto je poznać i zrozumieć dobre praktyki. Inne ustawienia też wpływają na wynik, ale mniej niż wybrany głos i model.
Kolejność ważności jest następująca: najważniejszy jest wybór głosu, potem modelu, a następnie ustawienia modelu. Wszystkie te elementy i ich połączenie wpływają na wynik.
Głosy
Głosy
Oferujemy wiele rodzajów głosów, w tym wybrane Default Voices, rozbudowaną Voices Library with niemal każdym głosem, jaki możesz sobie wyobrazić, w pełni syntetyczne głosy tworzone narzędziem Voice Design oraz własną kolekcję sklonowanych głosów dzięki technologiom Instant Voice Cloning i Professional Voice Cloning.
Nie wszystkie głosy są takie same, a wiele zależy od materiału źródłowego użytego do ich stworzenia. Niektóre zapewniają lepszą, bardziej ludzką interpretację, a inne są bardziej stabilne.
Wybór właściwego głosu do konkretnych treści jest kluczowy. To prawdopodobnie decyzja o największym wpływie na końcowy wynik. Określa płeć, ton, akcent, rytm i sposób wypowiedzi. Warto poświęcić więcej czasu na wybór idealnego głosu i odpowiednie testy, aby mieć pewność, że jest spójny i spełnia oczekiwania.
Aby generować mowę w konkretnym języku, najlepsze wyniki uzyskasz, używając rodzimego głosu z Voice Library lub klonując głos mówiący w tym języku z właściwym akcentem. Technicznie każdy głos może mówić w każdym języku, ale zachowa swój oryginalny akcent. Na przykład rodzimy głos angielski użyty do generowania francuskiej mowy prawdopodobnie wygeneruje francuski z angielskim akcentem, ponieważ AI musi uogólnić, jak ten głos brzmiałby w języku, na którym nie był trenowany.
Jeśli podoba ci się głos, ale chcesz zmienić sposób wypowiedzi, pomoże nasze narzędzie Voice Remixing. Pozwala używać promptów w języku naturalnym, aby zmienić sposób wypowiedzi, rytm, ton, płeć, a nawet akcent. Przy zmianie akcentu bardzo ważne są głos bazowy i docelowy akcent. Wyniki mogą się różnić — czasem wszystko działa idealnie, a czasem potrzeba kilku prób.
Voice Remixing może dać bardzo dobre wyniki, ale zwykle nie będą tak dobre jak właściwie sklonowany Professional Voice Clone. Będą bliższe jakości Instant Voice Clone.
Pamiętaj, że remix głosu działa tylko z wybranymi głosami. Na przykład nie możesz remiksować głosów z Voice Library — tylko głosy utworzone przez siebie lub głosy domyślne.
Modele
Modele
Oferujemy dwie rodziny modeli: Standard (high-quality) oraz Flash, zoptymalizowane pod kątem bardzo niskich opóźnień. Większość rodzin obejmuje wersje wyłącznie angielskie i wielojęzyczne.
Eleven v4 to nasz najnowszy model. Występuje w dwóch wersjach: Eleven v4 i Eleven v4 Turbo.
Wybór modelu ma drugi co do wielkości wpływ na końcowy wynik audio, zaraz po wyborze głosu. Polecamy przetestować różne modele z wybranym głosem, aby znaleźć najlepsze połączenie. Wszystkie modele mają mocne i słabe strony, a z niektórymi głosami działają lepiej niż z innymi, dlatego warto dobrać odpowiednią parę.
Jeśli wynik będzie wyłącznie po angielsku, zdecydowanie polecamy jeden z modeli tylko angielskich. Często łatwiej się z nimi pracuje, są stabilniejsze i ogólnie lepiej sprawdzają się w treściach angielskich. Jeśli treść będzie w innym języku lub może być wielojęzyczna, musisz użyć jednego z modeli wielojęzycznych.
Najczęściej używa się stabilności około 50, podobieństwa około 75 i stylu ustawionego na 0, a potem wprowadza niewielkie zmiany. Oczywiście wszystko zależy od oryginalnego głosu i stylu, który chcesz uzyskać.
Warto pamiętać, że AI jest niedeterministyczna — ustawienie suwaków na konkretne wartości nie gwarantuje za każdym razem tych samych wyników. Suwaki działają raczej jak zakres, określając, jak duża może być losowość między generacjami.
Prędkość
Ustawienie prędkości pozwala przyspieszyć lub spowolnić generowaną mowę. Wartość domyślna to 1.0, czyli prędkość nie jest zmieniana. Wartości poniżej 1.0 spowalniają głos, maksymalnie do 0.7. Wartości powyżej 1.0 przyspieszają głos, maksymalnie do 1.2. Skrajne wartości mogą wpłynąć na jakość generowanej mowy.
Prędkość nie jest dostępna dla modelu Eleven v3.
Stabilność
Suwak stabilności określa stabilność głosu i losowość między generacjami. Obniżenie go daje głosowi szerszy zakres emocji. Jak wspomniano wcześniej, duży wpływ ma też oryginalny głos. Zbyt niskie ustawienie może prowadzić do dziwnych, zbyt losowych interpretacji i sprawiać, że postać mówi za szybko. Z kolei zbyt wysokie może dać monotonny głos z ograniczonymi emocjami.
Aby uzyskać żywszą i bardziej dramatyczną interpretację, zalecamy obniżyć stabilność i wygenerować kilka wersji, aż znajdziesz tę, która ci się podoba.
Jeśli natomiast chcesz bardziej poważnej interpretacji, przy bardzo wysokich wartościach nawet monotonicznej, zalecamy zwiększyć stabilność. Ponieważ wynik jest bardziej spójny i stabilny, zwykle nie musisz generować tylu próbek, aby uzyskać oczekiwany rezultat. Eksperymentuj, aby znaleźć najlepsze ustawienie!
Podobieństwo
Suwak podobieństwa określa, jak ściśle AI ma trzymać się oryginalnego głosu podczas jego odtwarzania. Jeśli oryginalne audio jest niskiej jakości, a suwak podobieństwa jest ustawiony zbyt wysoko, AI może odtworzyć artefakty lub szum tła obecne w oryginalnym nagraniu.
Podobieństwo nie jest dostępne dla modelu Eleven v3.
Wzmocnienie stylu
Wraz z nowszymi modelami dodaliśmy też ustawienie wzmocnienia stylu. Próbuje ono podkreślić styl oryginalnego mówcy. Zużywa dodatkowe zasoby obliczeniowe i może zwiększyć opóźnienie, jeśli jest ustawione na wartość inną niż 0. Ważne: korzystanie z tego ustawienia może nieco zmniejszyć stabilność modelu, ponieważ stara się on podkreślić i naśladować styl oryginalnego głosu.
Ogólnie zalecamy zawsze pozostawić to ustawienie na 0.
Speaker Boost
To ustawienie zwiększa podobieństwo do oryginalnego mówcy. Wymaga jednak nieco większego obciążenia obliczeniowego, co zwiększa opóźnienie. Różnice wprowadzane przez to ustawienie są zwykle dość subtelne.
Speaker Boost nie jest dostępny dla modelu Eleven v3.
Generowanie
Gdy wybierzesz głos, model i ustawienia, proces generowania jest prosty: wpisujesz tekst, naciskasz „Generate Speech”, a następnie generowane jest audio.
Choć na pierwszy rzut oka proces jest bardzo prosty, podany tekst ma ogromne znaczenie dla uzyskania oczekiwanego wyniku. Używanie słów, które mogą być „poza rozkładem” — czyli takich, z którymi AI rzadko spotykała się podczas trenowania — na przykład dziwnych nazw, nietypowych skrótów, symboli czy emoji, może zdezorientować AI i sprawić, że wynik będzie mniej stabilny. Emoji i niektóre symbole są szczególnie trudne dla AI do prawidłowej interpretacji.
Gdy używasz Text to Speech przez interfejs, automatycznie normalizujemy wpisany tekst, aby poprawić jego czytelność i ułatwić AI przetwarzanie. Zwykle zamienia to symbole i liczby na zapis słowny, co pomaga AI w prawidłowej wymowie.
Zdecydowanie zalecamy nie zapisywać liczb cyframi ani nie używać symboli, zwłaszcza w modelach wielojęzycznych, choć dotyczy to też modeli tylko angielskich. Liczby i symbole są zapisywane tak samo w wielu językach, ale wymawiane inaczej, więc cyfry tworzą dla AI niejednoznaczność. Na przykład liczba „1” jest zapisywana identycznie po angielsku i w wielu innych językach, ale wymawiana inaczej. Zapisanie liczby słownie, na przykład „one”, eliminuje potrzebę interpretowania przez AI, co ma zrobić.
Pracujemy nad bardziej zaawansowanymi workflow, które pozwolą ci wpływać na sposób wypowiedzi i interpretację AI za pomocą tak zwanych Audio Tags. Ta funkcja jest dostępna w Eleven v4 i Eleven v3. Jeśli chcesz dowiedzieć się więcej, polecamy nasz przewodnik po promptach.
FAQ
Dobry materiał wejściowy to dobry wynik
Pierwszy i jeden z najważniejszych czynników to dobry, wysokiej jakości i spójny materiał wejściowy, który zapewnia dobry, wysokiej jakości i spójny wynik.
Jeśli przekażesz AI materiał audio gorszej jakości — na przykład z dużym szumem, pogłosem przy wyraźnej mowie, wieloma mówcami albo niespójną głośnością, wykonaniem czy sposobem mówienia — AI będzie działać mniej stabilnie, a wynik stanie się bardziej nieprzewidywalny.
Jeśli planujesz sklonować własny głos, gorąco polecamy zapoznać się z wytycznymi w dokumentacji dotyczącymi tworzenia poprawnych klonów głosu. Zapewni ci to najlepszą możliwą bazę na start. Nawet jeśli chcesz używać tylko Instant Voice Clones, warto też przeczytać sekcję Professional Voice Cloning. Znajdziesz tam cenne informacje o tworzeniu klonów głosu, choć wymagania tych dwóch technologii nieco się różnią.
Używaj odpowiedniego głosu
Drugim czynnikiem jest to, że wybrany głos ma ogromny wpływ na wynik. Jak wspomniano wcześniej, niezwykle ważna jest jakość i spójność próbek użytych do stworzenia danego klonu, ale także język i ton głosu.
Jeśli chcesz uzyskać głos brzmiący radośnie i pogodnie, użyj głosu sklonowanego z radosnych i pogodnych próbek. Jeśli natomiast zależy ci na głosie refleksyjnym i posępnym, wybierz głos o takich cechach.
Kluczowe jest też użycie głosu wytrenowanego w odpowiednim języku. Na przykład wszystkie profesjonalne klony głosu, które oferujemy jako głosy domyślne, są angielskie i trenowane na angielskich próbkach. Dlatego ich działanie w innych językach może być nieprzewidywalne. Używaj głosu sklonowanego z próbek, w których mówi on językiem, w jakim ma potem mówić AI.
Stosuj poprawne formatowanie
Może się to wydawać mało istotne, ale może mieć duże znaczenie. AI próbuje zrozumieć, jak coś przeczytać, na podstawie kontekstu tekstu — nie tylko użytych słów, lecz także ich układu, interpunkcji, gramatyki i ogólnego formatowania.
Może to nieznacznie, ale wyraźnie wpłynąć na sposób mówienia AI. Jeśli zrobisz błąd w słowie, AI go nie poprawi i spróbuje przeczytać je tak, jak zostało zapisane.
Niedeterministyczność
Ustawienia AI są niedeterministyczne, co oznacza, że nawet przy tych samych warunkach początkowych (głosie, ustawieniach, modelu) wynik będzie się nieco różnić — podobnie jak aktor głosowy za każdym razem interpretuje tekst trochę inaczej.
Ta zmienność może wynikać z różnych czynników, takich jak wspomniane wcześniej opcje: głos, ustawienia i model. Zwykle jej zakres można kontrolować suwakiem stabilności. Niższe ustawienie stabilności oznacza większe różnice między generacjami, ale też większą ekspresję AI.
Większa zmienność często jest pożądana, ponieważ zbyt wysoka stabilność może sprawić, że niektóre głosy zabrzmią monotonnie — AI ma wtedy mniej swobody, by tworzyć bardziej zróżnicowane treści. Z kolei zbyt niska stabilność może powodować inne problemy i niestabilne generacje, zwłaszcza w przypadku głosów sklonowanych z materiału audio gorszej jakości.
Domyślne ustawienie 50 to zwykle świetny punkt wyjścia dla większości zastosowań.
Czym jest Eleven v4?
Zalecamy przejście na Eleven v4 i przetestowanie go na własnych treściach.
Eleven v4 to nasz najnowszy i najbardziej zaawansowany model Text to Speech oraz pierwszy z nowej generacji modeli. W porównaniu z Eleven v3 poprawia jakość wyników, wierność głosu, emocje, tagi audio i obsługę języków.
Dokładność klonowania głosu robi duży krok naprzód w Eleven v4. Klonowane głosy wierniej niż w jakimkolwiek wcześniejszym modelu oddają cechy głosu źródłowego — barwę, rytm i sposób mówienia.
Instant Voice Clones (IVC) są w Eleven v4 dokładniejsze niż kiedykolwiek. Wierniej oddają najważniejsze cechy głosu źródłowego, więc łatwiej szybko stworzyć przekonujący klon na podstawie krótkiej próbki audio.
Professional Voice Clones (PVC) są w pełni obsługiwane w Eleven v4. Korzystają z tych samych ulepszeń dokładności głosu i oferują wierniejsze odwzorowanie głosu źródłowego w workflow wymagających najwyższej spójności i kontroli.
Eleven v4 występuje w dwóch wariantach, więc możesz wybrać odpowiedni balans jakości i szybkości dla swojego zastosowania:
Eleven v4 (eleven_v4) — nasz model o najwyższej jakości, idealny do tworzenia treści, audiobooków, głosów postaci i zastosowań, w których jakość jest najważniejsza.
Eleven v4 Turbo (eleven_v4_turbo) — bardzo wysoka jakość przy imponująco niskich opóźnieniach, stworzony do zastosowań w czasie rzeczywistym, takich jak agenci konwersacyjni i interaktywne doświadczenia głosowe.
Oba warianty korzystają z dwóch ustawień głosu: Stability i Similarity. Suwaki Style i Speed nie są dostępne w Eleven v4, a SSML nie jest obsługiwany.
Gdy język, w którym generujesz, jest taki sam jak język głosu referencyjnego, oryginalny akcent zostaje zachowany tak jak wcześniej. Gdy język generowania różni się od języka głosu referencyjnego, Eleven v4 generuje płynną, naturalnie brzmiącą mowę w języku docelowym — zamiast przenosić akcent głosu referencyjnego z jego oryginalnego języka.
Informacje o klonowaniu, akcentach, porównaniach i pełny opis znajdziesz w Eleven v4. Informacje o tagach i promptowaniu znajdziesz w Promptowanie Eleven v4.
Czym jest Eleven v3?
Zalecamy przejście na Eleven
v4 i przetestowanie go
na własnych treściach. Wiele technik promptowania dla Eleven
v4 działa też w
Eleven v3.
Eleven v3 to ekspresyjny model Text to Speech o szerokim zakresie emocji. Generuje naturalną, realistyczną mowę z bogatą ekspresją emocjonalną i rozumieniem kontekstu w ponad 70 językach.
Eleven v3 oferuje:
Obsługę tagów audio
emocje: [sad][angry][happily]
wskazówki dotyczące sposobu mówienia: [whispers][shouts]
Regulacja szybkości głosu jest dostępna w Text to Speech przez Speech Synthesis, Studio, ElevenAgents i nasze API.
Szybkość głosu możesz ustawić za pomocą opcji Speed.
Dostępne wartości mieszczą się w zakresie od 0.7 do 1.2. Wartości poniżej 1 spowalniają mowę, a wartości powyżej 1 ją przyspieszają. Skrajne wartości mogą wpłynąć na jakość generowanej mowy.
To ustawienie jest dostępne dla wszystkich głosów i modeli. Znajdziesz je w ustawieniach głosu.
Informacje o sterowaniu mową przez API znajdziesz w naszej dokumentacji API.
Czy mogę używać tego samego sklonowanego/zaprojektowanego głosu w różnych językach?
Każdy głos może mówić w dowolnym z obsługiwanych języków.
W obecnym modelu nie wybierasz konkretnego języka. Zamiast tego piszesz w języku, w którym AI ma mówić, a AI automatycznie go rozpoznaje. Ponieważ różne języki mogą mieć podobne słowa i słownictwo, ale zupełnie inną wymowę i akcent, użyj sklonowanego głosu utworzonego na podstawie nagrania w danym języku i z właściwym akcentem.
Język określa tekst, a akcent i wymowę sam głos. Aby działać optymalnie, AI potrzebuje obu tych kontekstów.
Pracujemy nad nową technologią, która ułatwi wybór języka, ale ze względu na sposób działania AI wciąż jest to w trakcie rozwoju.
Jak pobrać wygenerowane pliki z Text to Speech?
Wygenerowane pliki możesz pobrać na dwa sposoby:
Możesz pobrać plik od razu po wygenerowaniu treści, klikając przycisk pobierania w prawym dolnym rogu.
Wcześniej wygenerowane pliki możesz pobrać z historii.
Aby otworzyć historię, zaloguj się na konto, wybierz Text to Speech na pasku bocznym, a następnie kliknij kartę historii w panelu po prawej stronie ekranu. Na wąskich ekranach możesz otworzyć historię, klikając ikonę historii nad przyciskiem Generuj mowę.
W historii kliknij ikonę pobierania, aby wybrać pobranie pliku jako MP3 (128 kb/s) lub WAV.
Możesz też kliknąć Zaawansowane, aby pobrać plik w dodatkowych formatach:
MP3 (192 kb/s)
MP3 (256 kb/s)
M4A
FLAC
Czy głosy mogą wydawać dźwięk oddychania?
Tak. W Eleven v4 i Eleven v3 możesz używać tagów audio, takich jak [sighs] lub [exhales], aby dodać oddechy i podobne reakcje do wygenerowanej mowy.
Nasze modele Flash i Turbo zostały stworzone specjalnie do zastosowań wymagających niskich opóźnień.
Flash v2 i Flash v2.5 to nasze modele o ultraniskich opóźnieniach, generujące audio w mniej niż 75 ms. Flash v2 obsługuje tylko angielski, a Flash v2.5 — 32 języki. Pełną listę obsługiwanych języków znajdziesz
tutaj.
Nasze modele Turbo również mają niskie opóźnienia, ale ponieważ modele Flash dają bardzo podobne wyniki, polecamy Flash zamiast Turbo. Turbo v2 obsługuje tylko angielski, a Turbo v2.5 — 32 języki. Jest też o 25% szybszy od Turbo v2 i generuje audio w około 300 ms.
Zarówno Flash, jak i Turbo to mocno zoptymalizowane modele, stworzone specjalnie do zastosowań wymagających niskich opóźnień — bez utraty jakości głosu i przy zachowaniu standardu jakości znanego z naszych modeli.
Oba modele są tańsze przy generowaniu przez API. Szczegóły znajdziesz w cenniku API.
Oferujemy też ElevenAgents, naszą platformę do wdrażania dostosowanych, interaktywnych agentów głosowych. Więcej informacji znajdziesz w dokumentacji ElevenAgents.
Jak dodać pauzy?
Możesz dodać pauzę lub przerwę na kilka sposobów i wpłynąć na rytm oraz tempo wypowiedzi. Wybrana metoda zależy od modelu.
Tagi audio (Eleven v4 i Eleven v3)
W Eleven v4 i Eleven v3 używaj tagów audio oraz interpunkcji, aby kontrolować tempo i sposób wypowiedzi. Te modele nie obsługują tagów przerw SSML.
Tagi przerw (Multilingual v2, Flash v2 i Flash v2.5)
Najbardziej niezawodnym sposobem dodania pauzy w Multilingual v2, Flash v2 i Flash v2.5 jest użycie składni tagu przerwy SSML <break time="1.5s" />. Tworzy ona dokładną i naturalną pauzę w mowie. To nie jest tylko cisza wstawiona między słowa — model rozumie tę składnię i dodaje naturalną pauzę.
Sposób obsługi tych pauz przez model może się różnić. Użyty głos odgrywa kluczową rolę w wyniku. Niektóre głosy, trenowane z kilkoma „eee” i „yyy”, mogą dodawać takie manieryzmy podczas pauz, jak robi to prawdziwy mówca.
Przykład może wyglądać tak:
„Daj mi sekundę, żebym to przemyślał.” <break time="1.0s" /> „Tak, to by zadziałało.”
Czas przerwy należy podawać w sekundach. AI obsługuje pauzy do 3 sekund i można ich używać w Text to Speech oraz przez API.
Użycie zbyt wielu przerw SSML w tekście może powodować problemy. Mowa może przyspieszyć, a w audio może pojawić się więcej szumów i innych artefaktów. Pracujemy nad rozwiązaniem tego problemu.
Interpunkcja
Te opcje są mniej niezawodne niż tagi przerw lub tagi audio, ale nadal mogą wpłynąć na tempo.
Zwykły myślnik - lub pauza — często działają dobrze. Aby uzyskać dłuższą pauzę, możesz dodać kilka myślników, np. -- --.
„Robi - się - późno.”
Wielokropek ... może czasem dodać pauzę między słowami, ale zwykle wprowadza też do głosu wahanie lub nerwowość, które nie zawsze pasują.
„Ja… tak, chyba tak…”
Jak wymusić konkretną wymowę słowa lub nazwy?
Eleven v3 ma natywną obsługę międzynarodowego alfabetu fonetycznego (IPA). Więcej informacji znajdziesz w IPA w Eleven v3.
Tagi fonemów SSML (tylko Flash v2 i Turbo v2)
W Flash v2 i Turbo v2 możesz wymusić określoną wymowę za pomocą tagów fonemów SSML. Obsługujemy zarówno IPA, jak i CMU. W obecnej implementacji CMU jest zwykle nieco bardziej przewidywalne i spójne. Więcej informacji znajdziesz w naszym przewodniku po wymowie.
Alternatywna pisownia
Możesz też znaleźć alternatywną pisownię i zapisać słowo bardziej fonetycznie. Możesz używać różnych sztuczek, takich jak wielkie litery, myślniki, apostrofy, a nawet pojedyncze cudzysłowy wokół jednej litery lub kilku liter.
Na przykład słowo „trapezii” można zapisać jako „trapezIi”, aby mocniej podkreślić „ii” w tym słowie.
Jak działają tagi audio w Eleven v3 i v4?
Eleven v4 i Eleven v3 obsługują tagi audio. Polecamy Eleven v4. Umieść krótką instrukcję w nawiasach kwadratowych i wstaw ją w tekście tam, gdzie ma zmienić się sposób wypowiedzi. Te same tagi działają w obu modelach.
Emocje: [curious][crying][mischievously]
Wskazówki dotyczące sposobu wypowiedzi: [whispers][shouts]
Pliki wygenerowane w Text to Speech lub Voice Changer możesz pobrać jako MP3, WAV, M4A lub FLAC. Pliki WAV, M4A i FLAC trzeba pobrać z historii.
Jak pobrać pliki WAV
Wybierz Text to Speech lub Voice Changer na pasku bocznym, a następnie otwórz historię, klikając kartę historii w panelu po prawej stronie ekranu. Na wąskich ekranach możesz otworzyć historię, klikając ikonę historii nad przyciskiem Generuj mowę.
W historii kliknij ikonę pobierania, aby wybrać pobranie pliku jako MP3 lub WAV.
Jak pobrać pliki FLAC lub M4A
Wybierz Text to Speech lub Voice Changer na pasku bocznym, a następnie otwórz historię, klikając kartę historii w panelu po prawej stronie ekranu. Na wąskich ekranach możesz otworzyć historię, klikając ikonę historii nad przyciskiem Generuj mowę.
W historii kliknij ikonę pobierania, aby wybrać pobranie pliku jako MP3 lub WAV. Aby uzyskać dostęp do dodatkowych formatów, w tym FLAC i M4A, kliknij Zaawansowane i wybierz preferowany format.
Jak wybrać język i akcent?
Język przy generowaniu na stronie
Gdy generujesz audio na stronie ElevenLabs, nasze AI automatycznie wykrywa język na podstawie kontekstu tekstu promptu. Dlatego najlepiej unikać używania wielu języków w jednym prompcie, ponieważ może to utrudnić określenie, którego języka użyć. Obecnie nie można wskazać języka podczas generowania na stronie.
Język przy generowaniu przez API
Jeśli generujesz audio przez API, możesz ręcznie określić język promptu za pomocą parametru language_code. To opcjonalny parametr, który przyjmuje kody języków ISO 639-1.
Może to być przydatne w przypadku krótkich lub niejednoznacznych promptów, na przykład gdy tekst zawiera tylko liczby. Określenie języka zapewnia zastosowanie przez normalizator odpowiednich reguł dla danego języka.
Więcej informacji o normalizacji znajdziesz w tym artykule.
Akcent
Akcent używany podczas generowania pochodzi z wybranego głosu. Jeśli użyjesz głosu, który nie był trenowany w języku, w którym generujesz, możesz usłyszeć lekki akcent z oryginalnego języka tego głosu.
Aby uzyskać najlepsze wyniki, polecamy użyć głosu trenowanego na nagraniach w języku, w którym generujesz, i z preferowanym akcentem. Pomaga to AI dokładniej rozumieć wymowę i intonację.
Jest to szczególnie ważne w przypadku języków podobnych do siebie lub mających wiele wspólnych słów. Wybór głosu trenowanego w odpowiednim języku sprawia, że AI używa prawidłowej wymowy i akcentu.
Możesz:
Utworzyć sklonowany głos na podstawie nagrań w preferowanym języku i akcencie.
Przejrzeć Voice Library i użyć filtrów wyszukiwania, aby znaleźć odpowiednie głosy,
które spełniają twoje potrzeby.
Ile kosztuje generowanie w Eleven v3 (Alpha)?
Koszt generowania w Eleven v3 na stronie wynosi 1 kredyt za znak. Generowanie przez API jest tańsze — szczegóły znajdziesz w cenniku API.
W Eleven v4 i Eleven v3 możesz używać tagów audio, takich jak [laughs], by dodać śmiech i inne reakcje do generowanej mowy. Więcej informacji znajdziesz w przewodniku po promptowaniu.
W przypadku innych modeli emocjonalność wypowiedzi zależy od kontekstu, interpunkcji i ustawień głosu. Zobacz Jak uzyskać emocje?.
Jak tworzyć emocje?
Model uwzględnia szerszy kontekst każdej wypowiedzi — ocenia, czy coś ma sens, na podstawie powiązania z poprzedzającym i następującym tekstem. Dzięki temu może właściwie intonować dłuższe fragmenty, nadając kilku zdaniom spójny wzorzec emocjonalny.
Wskazówki dotyczące uzyskiwania emocji:
Kontekst jest kluczowy przy generowaniu konkretnych emocji. Jeśli wpiszesz śmieszny tekst lub tekst ze śmiechem, możesz uzyskać radosną wypowiedź. To samo dotyczy złości, smutku i innych emocji — kluczowe jest ustawienie kontekstu.
Interpunkcja i ustawienia głosu mają największy wpływ na sposób wygłoszenia tekstu.
Dodaj nacisk, ujmując ważne słowa lub frazy w cudzysłów.
W przypadku mowy generowanej klonowanym głosem styl mówienia z próbek przesłanych do klonowania jest odtwarzany w wyniku. Jeśli mowa w przesłanej próbce jest monotonna, modelowi będzie trudno wygenerować ekspresyjną wypowiedź.
W Eleven v4 i Eleven v3 możesz też używać tagów audio, aby bardziej bezpośrednio kontrolować emocje i sposób mówienia, na przykład [happy], [sad], [angry], [whispers] i [laughs]. Więcej informacji znajdziesz w przewodniku po promptowaniu.
Te wskazówki pomagają kierować emocjonalnością wypowiedzi, ale nie gwarantują konkretnego rezultatu.
Czy mogę odsłuchać audio przed pobraniem bez utraty limitu?
Niestety obecnie nie oferujemy naliczania opłat przy pobieraniu jako alternatywy dla naliczania przy generowaniu. Nie ma obecnie możliwości odsłuchania wygenerowanego audio bez zużywania limitu.
Gdy klikniesz na stronie „Generuj”, kredyty zostaną pobrane, ponieważ serwery muszą się uruchomić, a audio musi zostać wygenerowane. Nie da się przetestować ani odsłuchać głosu na własnym tekście bez użycia kredytów.
W Text to Speech na stronie pozwalamy na dwie bezpłatne regeneracje w następujących sytuacjach:
Prompt (dla Text to Speech) lub plik (dla Voice Changer), głos i model pozostają takie same. Możesz zmieniać suwaki ustawień głosu.
Pierwsze generowanie wykonano mniej niż dwie godziny temu.
Od wygenerowania oryginalnego audio nie odświeżono strony.
Jeśli te warunki są spełnione, zobaczysz opcję „Wygeneruj mowę ponownie”, a po najechaniu na przycisk „Wygeneruj mowę ponownie” wyświetli się liczba pozostałych bezpłatnych regeneracji:
Gdy wykorzystasz bezpłatne regeneracje, przycisk ponownie zmieni się w „Generuj mowę”, a wyświetli się liczba kredytów, które zostaną użyte do generowania:
Bezpłatne regeneracje są dostępne tylko w Text to Speech na stronie. Nie są dostępne przez API.
Sprawdzamy, czy możemy umożliwić odsłuch w tej jakości bez podnoszenia cen lub kosztów. Szukamy też sposobów, by AI dało się lepiej kontrolować, tak aby odsłuch nie był potrzebny i by pożądany wynik udało się uzyskać już za pierwszym razem.
Czym jest tryb dialogu?
Eleven v4 i Eleven v3 oferują tryb dialogu, który pozwala generować dynamiczne rozmowy z wieloma mówcami, z naturalnym tempem oraz obsługą przerwań, zmian tonu i sygnałów emocjonalnych zależnych od kontekstu rozmowy.
Tryb dialogu jest dostępny, gdy używasz wielu mówców na stronie.
Możesz też używać endpointów API Text to Dialogue do generowania interakcji wielu mówców. Więcej informacji znajdziesz w naszej dokumentacji API:
Każdy głos może mówić w każdym języku obsługiwanym obecnie przez AI. Jeśli jednak nie używasz głosu natywnego dla języka, w którym ma mówić AI — na przykład używasz wygenerowanego głosu lub głosu sklonowanego z angielskiej mowy — AI może mieć lekki angielski akcent albo przechodzić między podobnymi językami.
W obecnym modelu nie wybierasz konkretnego języka. Zamiast tego piszesz w języku, w którym AI ma mówić, a AI rozpoznaje go automatycznie. Ponieważ różne języki mogą mieć podobne słowa i słownictwo, ale znacznie różnić się wymową i akcentem, używaj klonowanego głosu, który został sklonowany w danym języku i z właściwym akcentem. Zapewni to AI najwięcej kontekstu potrzebnego do określenia, jak i w jakim języku coś powiedzieć.
Język określa tekst, a akcent i wymowę — sam głos.
Pracujemy nad nową technologią, która umożliwi wybór języka, ale sposób działania AI sprawia, że wszystko to nadal jest w trakcie rozwoju.
Jaka jest maksymalna liczba znaków i ilość tekstu, które mogę wygenerować?
W Text to Speech na stronie możesz wygenerować do 5000 znaków w jednej generacji w każdym płatnym planie i do 2500 znaków we wszystkich darmowych planach.
Jeśli jednak planujesz generować dłuższe treści, liczące więcej niż kilka tysięcy znaków, zdecydowanie polecamy Studio, w którym łatwo wygenerujesz bardzo długie treści, takie jak książki i powieści. Więcej przeczytasz tutaj.
Jeśli generujesz przez API, maksymalna długość tekstu wejściowego zależy od używanego modelu:
Text to Speech
Flash v2.5 – do 40 000 znaków (~40 minut audio)
Turbo v2.5 – do 40 000 znaków (~40 minut audio)
Flash v2 – do 30 000 znaków (~30 minut audio)
Turbo v2 – do 30 000 znaków (~30 minut audio)
Multilingual v2 – do 10 000 znaków (~10 minut audio)
Voice Changer
Multilingual v2 – do 10 minut audio
Które głosy w bibliotece głosów są natywne dla danego języka?
Wszystkie gotowe i wygenerowane głosy są angielskie. Oznacza to, że mogą nie mieć właściwego akcentu ani wymowy w innych językach.
W Voice Library, w kategorii profesjonalnej, znajdziesz głosy udostępnione nam przez społeczność. Są to Professional Voice Clones ich własnych głosów. Zwykle mają tag językowy wskazujący język, w którym zostały sklonowane, więc są natywne dla tego języka. Możesz też użyć filtra wyszukiwania języków, aby wybrać konkretne języki.
Dlaczego liczby, daty, symbole i akronimy nie są poprawnie wymawiane lub odczytywane w odpowiednim języku?
Liczby, daty, symbole i skróty mogą być wyzwaniem dla AI, ponieważ często można je poprawnie odczytać na kilka sposobów. Zależy to też od używanego języka, na przykład „11” można odczytać jako „Eleven”, ale po hiszpańsku może to być „Once”, a po niemiecku „Elf”.
Jest kilka sposobów, aby zapewnić poprawne odczytanie liczb, dat, skrótów i symboli.
Zapisz je w całości słowami
Aby uzyskać najlepsze rezultaty, zalecamy zapisywanie liczb, skrótów, dat i symboli w całości słowami, tak jak AI ma je odczytać. Dzięki temu AI ma najwięcej kontekstu i poda poprawny wynik. Na przykład zamiast „$100” zalecamy wpisać „sto dolarów”, aby uzyskać oczekiwany rezultat.
Korzystanie z LLM
Jeśli używasz dużego modelu językowego do generowania promptów tekstowych, na przykład w ElevenAgents, możesz polecić modelowi, aby zawsze zapisywał liczby, daty, symbole i skróty słowami, w sposób, w jaki AI ma je odczytać.
Normalizacja
Jeśli generujesz przez API, możesz określić, czy zastosować normalizację tekstu za pomocą parametru apply_text_normalization. Normalizacja tekstu zapisuje liczby i daty słowami, co poprawia wymowę. Ta opcja zwiększa opóźnienie, ponieważ proces normalizacji wymaga dodatkowego czasu przetwarzania.
Parametr apply_text_normalization ma trzy tryby:
on — jest zawsze stosowany
off — nigdy nie jest stosowany
auto — AI automatycznie decyduje, kiedy zastosować normalizację tekstu
Możesz też określić język promptu za pomocą parametru language_code. To opcjonalny parametr, który przyjmuje kody językowe ISO 639-1.
Może to być przydatne przy krótkich lub niejednoznacznych promptach, na przykład gdy tekst zawiera tylko liczby lub symbole. Określenie języka zapewnia, że normalizator zastosuje właściwe reguły dla danego języka.
Normalizacja jest domyślnie włączona podczas generowania przez Text to Speech na stronie.
W Studio normalizacja jest domyślnie stosowana automatycznie, co oznacza, że AI decyduje, kiedy ją zastosować. Możesz też ustawić jej stałe stosowanie — ta opcja znajduje się w Ustawieniach projektu na karcie Zaawansowane.
Dlaczego mój głos błędnie wymawia niektóre słowa?
Błędna wymowa może mieć kilka przyczyn. Najczęstszą są po prostu literówki. AI nie próbuje poprawiać błędnie zapisanych słów, tylko czyta je dokładnie tak, jak zostały napisane. Dlatego przed odczytaniem tekstu przez AI warto sprawdzić, czy jest poprawny i gotowy.
Jeśli chcesz wymusić konkretną wymowę, możesz użyć tagów fonemów SSML w naszym modelu Flash v2. Więcej informacji znajdziesz w naszym przewodniku po wymowie.
Czasem AI może źle wymówić słowa lub użyć innego akcentu, niż się spodziewasz. Może się tak zdarzyć z kilku powodów, a w większości przypadków zależy to od głosu i języka. Najlepszym sposobem na zapewnienie właściwego akcentu i wymowy jest sklonowanie głosu z odpowiednim akcentem i wymową. Da to AI najwięcej kontekstu podczas generowania audio.
Język określa tekst, a akcent — głos. Jeśli więc piszesz w języku, który ma wiele wspólnych słów z innym językiem lub jest z nim blisko spokrewniony, AI może mieć trudność z ustaleniem wymowy niektórych słów albo przełączaniem się między akcentami.
W pewnych sytuacjach AI może jednak źle wymawiać poprawnie zapisane słowa, nawet po angielsku. Wydaje się, że zależy to głównie od użytego głosu i tekstu, ale powinno zdarzać się rzadko.