Voice Design

Przewodnik po tworzeniu głosów na podstawie promptu tekstowego.

Voice Design

Przegląd

Voice Design pomaga twórcom, gdy dokładnego głosu, którego szukają, nie ma w Voice Library. Jeśli nie znajdziesz odpowiedniego głosu do projektu, możesz go stworzyć. Voice Design najlepiej sprawdza się do szybkiego testowania i iteracji, a jakość wyników może się różnić zależnie od promptu i zastosowania. Jeśli potrzebujesz najbardziej spójnej jakości gotowej do produkcji, Professional Voice Clones (PVC) to obecnie głosy najwyższej jakości na naszej platformie — jeśli więc w naszej bibliotece jest PVC odpowiadający twoim potrzebom, zalecamy użycie go.

Voice Design znajdziesz w aplikacji ElevenLabs: Voices -> My Voices -> Add a new voice -> Voice Design, lub przez API.

Po kliknięciu generowania stworzymy dla ciebie trzy opcje głosu. Jedyny koszt korzystania z Voice Design to liczba kredytów za wygenerowanie tekstu podglądu. Opłatę pobieramy tylko raz, mimo że generujemy trzy próbki. Liczbę znaków, które zostaną odjęte, zobaczysz w polu tekstowym „Text to preview”.

Po wygenerowaniu możesz wybrać i zapisać jeden z wyników, który zajmie jedno miejsce na głos.

Przewodnik po promptach

Prompt to podstawa twojego głosu. Określa dla modelu rodzaj głosu, który chcesz stworzyć — od akcentu i typu postaci po płeć i charakter głosu. Dobrze napisany prompt może zdecydować o różnicy między ogólnym głosem a takim, który naprawdę pasuje do twojej wizji. Ogólnie bardziej opisowe i szczegółowe prompty dają dokładniejsze i bardziej zniuansowane wyniki. Im więcej szczegółów podasz — w tym wiek, płeć, ton, akcent, tempo, emocje, styl i inne — tym lepiej model zinterpretuje i stworzy głos, który będzie celowy i dopasowany.

Czasem jednak działają też krótkie i proste prompty, zwłaszcza gdy zależy ci na bardziej neutralnym lub uniwersalnym głosie. Na przykład „Spokojny męski narrator” może dać dokładnie to, czego potrzebujesz, bez wchodzenia w szczegóły — szczególnie jeśli nie tworzysz konkretnej postaci ani stylu. Właściwy poziom szczegółowości zależy od zastosowania. Tworzysz postać fantasy? Wirtualnego asystenta? Zmęczoną nowojorczankę po sześćdziesiątce z suchym poczuciem humoru? Im wyraźniej określisz to w prompcie, tym bliżej wyobrażonego efektu będzie wynik.

Zalecany format promptu

Aby uzyskać spójne wyniki, użyj w prompcie tego formatu:

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Przykład:

Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.

Typowe błędy, których warto unikać

  • Nie używaj słowa „accent”, gdy masz na myśli intonację — może to wywołać niechciane zmiany dialektu. Zamiast tego opisz intonację, akcentowanie lub sposób mówienia.
  • Unikaj słów związanych z efektami — określenia takie jak „reverb”, „echo”, „phone” czy „tape” mogą negatywnie wpłynąć na jakość wyniku.
  • Wyraźnie określ język i dialekt — zawsze podaj język i wariant regionalny w pierwszym zdaniu, aby uniknąć odchylenia.

Jakość audio

Jakość audio to czystość, klarowność i ogólna wierność wygenerowanego głosu. Domyślnie ElevenLabs stara się tworzyć czyste, naturalnie brzmiące audio — ale jeśli projekt wymaga określonego poziomu jakości, najlepiej wyraźnie uwzględnić go w promptcie.

Aby uzyskać wysoką jakość, dodaj do opisu głosu frazę, taką jak „idealna jakość audio” lub „nagranie jakości studyjnej”. Pomaga to zapewnić maksymalną klarowność, minimalne zniekształcenia i dopracowane brzmienie.

Możesz też użyć konkretnych określeń jakości, które dają spójne wyniki:

  • Jakość OK
  • Dobra jakość
  • Bardzo dobra jakość
  • Doskonała jakość
  • Jakość studyjna
  • Jakość emisyjna

Te określenia pomagają uzyskać najwyższą jakość audio, gdy dodasz je do promptu.

Dodanie takich fraz może czasem ogólnie obniżyć dokładność promptu, jeśli głos jest bardzo konkretny lub niszowy.

Są też kreatywne przypadki, w których niższa jakość audio jest zamierzona, na przykład przy symulacji rozmowy telefonicznej, starej audycji radiowej lub znalezionego nagrania. W takich sytuacjach pomiń określenia jakości albo wyraźnie dodaj frazy takie jak:

  • „Audio niskiej jakości”
  • „Słaba jakość audio”
  • „Brzmi jak poczta głosowa”
  • „Przytłumione i odległe, jak ze starego magnetofonu”

Miejsce tej frazy w promptcie jest dowolne — może pojawić się na początku lub na końcu; zauważyliśmy, że działa dobrze w obu miejscach.

Wiek, ton/barwa i płeć

Te trzy cechy są podstawą projektowania głosu — kształtują jego ogólny charakter i emocjonalny wydźwięk. Im więcej szczegółów podasz, tym łatwiej AI stworzy głos pasujący do twojej wizji — niezależnie od tego, czy tworzysz wiarygodną postać, przekonującego narratora czy wirtualnego asystenta.

Wiek

Opis postrzeganego wieku głosu pomaga określić jego dojrzałość, teksturę i energię. Używaj konkretnych określeń, by naprowadzić AI na odpowiednią jakość głosu.

Przydatne określenia:

  • „Nastoletni mężczyzna” / „nastoletnia kobieta”
  • „Młody dorosły” / „po dwudziestce” / „około trzydziestki”
  • „Mężczyzna w średnim wieku” / „kobieta po czterdziestce”
  • „Starszy mężczyzna” / „starsza kobieta” / „mężczyzna po osiemdziesiątce”

Ton/barwa

To fizyczna jakość głosu, kształtowana przez wysokość, rezonans i teksturę. Różni się od emocjonalnego sposobu mówienia czy nastawienia.

Popularne określenia tonu/barwy:

  • „Głęboki” / „niski”
  • „Gładki” / „bogaty”
  • „Chropowaty” / „ochrypły”
  • „Nosowy” / „piskliwy”
  • „Lekki” / „oddechowy”
  • „Donośny” / „rezonujący”
  • „Lekki” / „cienki”
  • „Ciepły” / „łagodny”
  • „Metaliczny” / „blaszany”

Płeć

Płeć często wpływa na wysokość, ciężar i brzmienie głosu — ale możesz wyjść poza proste kategorie, opisując brzmienie zamiast tożsamości.

Przykłady:

  • „Niski, zachrypnięty głos kobiecy”
  • „Męski głos, głęboki i rezonujący”
  • „Głos neutralny płciowo — miękki i średnio wysoki”

Akcent

Akcent ma kluczowe znaczenie dla regionalnej, kulturowej i emocjonalnej tożsamości głosu. Jeśli projekt wymaga autentycznego brzmienia — osadzonego w realizmie lub stylizowanego pod postać — jasne i celowe określenie pożądanego akcentu jest niezbędne.

Wybór słów ma znaczenie — niektóre określenia dają bardziej spójne wyniki. Na przykład „wyraźny” często działa lepiej niż „silny”, gdy opisujesz, jak zauważalny ma być akcent. Warto próbować różnych wersji — zachęcamy do eksperymentowania ze słowami oraz jak najbardziej kreatywnych i szczegółowych opisów.

Uważaj na słowo „akcent” — jeśli chodzi ci o intonację lub wzorce akcentowania, użyj właśnie tych określeń. Użycie słowa „akcent”, gdy masz na myśli intonację, może wywołać niechcianą zmianę dialektu.

  • Przykłady jasnych promptów dotyczących akcentu:
    • „Mężczyzna w średnim wieku z wyraźnym francuskim akcentem”
    • „Młoda kobieta z lekkim południowym zaśpiewem”
    • „Starszy mężczyzna z mocnym wschodnioeuropejskim akcentem”
    • „Pogodna kobieta mówiąca z wyraźnym brytyjskim akcentem”
    • „Młodszy mężczyzna z łagodnym irlandzkim zaśpiewem”
    • „Autorytatywny głos z neutralnym amerykańskim akcentem”
    • „Mężczyzna z regionalnym australijskim akcentem, wyluzowany i mówiący przez nos”

Unikaj zbyt ogólnych określeń, takich jak „zagraniczny” czy „egzotyczny” — są nieprecyzyjne i mogą dawać niespójne wyniki.

Łącz akcent z innymi cechami, takimi jak ton, wiek czy tempo, aby lepiej kontrolować efekt. Na przykład: „Sarkastyczna starsza kobieta z wyraźnym nowojorskim akcentem, mówiąca powoli”.

W przypadku głosów fantasy lub fikcyjnych możesz wskazać rzeczywiste akcenty jako inspirację:

  • „Elf z porządnym, wyraźnym brytyjskim akcentem. Jest królewski i melodyjny.”
  • „Goblin z chropowatym wschodnioeuropejskim akcentem.”

Tempo

Tempo określa szybkość i rytm, z jakimi mówi głos. To kluczowy element kształtujący osobowość, emocjonalny ton i klarowność głosu. Jasne określenie tempa jest szczególnie ważne przy projektowaniu głosów do konkretnych zastosowań, takich jak opowiadanie historii, reklamy, dialogi postaci czy treści instruktażowe.

Używaj prostego języka, aby opisać, jak szybko lub wolno głos ma mówić. Możesz też opisać charakter tempa — czy jest stałe, nieregularne, celowe czy swobodne. Jeśli tempo się zmienia, koniecznie wskaż gdzie i dlaczego.

Przykłady określeń tempa:

  • „Mówi szybko” / „w szybkim tempie”
  • „W normalnym tempie” / „mówi normalnie”
  • „Mówi powoli” / „w wolnym rytmie”
  • „Celowe i miarowe tempo”
  • „Przeciągane, jakby delektował się każdym słowem”
  • „W pośpiesznym rytmie, jakby się spieszył”
  • „Swobodne, konwersacyjne tempo”
  • „Rytmiczne i muzyczne tempo”
  • „Nieregularne tempo, z nagłymi pauzami i przyspieszeniami”
  • „Równe tempo, ze stałymi odstępami między słowami”
  • „Mowa staccato”

Tekst podglądu

Gdy napiszesz dobry prompt głosowy, tekst użyty do podglądu tego głosu ma kluczowy wpływ na jego faktyczne brzmienie. Tekst podglądu działa jak scenariusz wykonania — nadaje ton, tempo i emocjonalny sposób mówienia, które głos będzie próbował odtworzyć.

Aby uzyskać najlepsze wyniki, tekst podglądu powinien uzupełniać opis głosu, a nie mu przeczyć. Na przykład jeśli prompt opisuje „spokojny, refleksyjny głos młodszej kobiety z lekkim japońskim akcentem”, zdanie takie jak „Hej! Nie mogę znieść tego, co zrobiłeś z tym cholernym miejscem!!!” będzie z nim niezgodne. Model spróbuje pogodzić tę sprzeczność, co często prowadzi do nienaturalnych lub niespójnych wyników.

Zamiast tego użyj przykładowego tekstu, który odzwierciedla zamierzoną osobowość i emocjonalny ton głosu. W powyższym przykładzie tekst typu „Ostatnio jest cicho… Miałam czas pomyśleć i może właśnie tego potrzebowałam najbardziej.” wspiera prompt i pomaga wygenerować bardziej naturalny, spójny głos.

Zauważyliśmy też, że dłuższe teksty podglądu zwykle dają bardziej stabilne i ekspresyjne wyniki. Krótkie frazy mogą czasem brzmieć urywanie lub niespójnie, zwłaszcza przy testowaniu subtelnych cech, takich jak ton czy tempo. Więcej kontekstu — pełne zdanie albo nawet krótki akapit — pozwala modelowi stworzyć płynniejszą i dokładniejszą reprezentację głosu.

Parametry

Głośność

Steruje głośnością generowania Text to Preview, a ostatecznie także głosu po zapisaniu.

Skala wskazówek

Określa, jak ściśle model trzyma się Promptu. Wyższe wartości oznaczają większą zgodność z promptem, ale mogą pogorszyć jakość audio, jeśli prompt jest bardzo niszowy. Niższe wartości dają modelowi więcej swobody twórczej kosztem dokładności promptu. Użyj niższej wartości, jeśli wykonanie i jakość audio są ogólnie ważniejsze niż idealne odwzorowanie promptu. Wysokie wartości zalecamy, gdy kluczowa jest dokładność akcentu lub tonu.

Atrybuty i przykłady

Eksperymentuj ze sposobem zapisu tych określeń. Na przykład „Idealna jakość audio” można też zapisać jako „jakość audio jest idealna”. Czasem daje to różne wyniki!

AtrybutPrzykłady
WiekMłody, młodszy, dorosły, stary, starszy, po czterdziestce
Akcent„wyraźny” szkocki akcent, „lekki” azjatycko-amerykański akcent, południowoamerykański akcent
PłećMęska, żeńska, neutralna płciowo, niejednoznaczna płeć
Ton/barwa/wysokośćGłęboki, ciepły, chropowaty, gładki, piskliwy, maślany, ochrypły, nosowy, gardłowy, ostry, robotyczny, eteryczny
TempoNormalny rytm, szybkie tempo, szybko, powoli, przeciągane, spokojne tempo, naturalne/konwersacyjne tempo
Jakość audioIdealna jakość audio, jakość audio jest „OK”, słaba jakość audio
Postać / zawódPirat, biznesmen, rolnik, polityk, terapeuta, ogr, boska istota, prezenter telewizyjny
EmocjaEnergiczny, podekscytowany, smutny, emocjonalny, sarkastyczny, oschły
WysokośćNiski, wysoki, normalna wysokość

Przykładowe prompty i podglądy tekstu

Typ głosuPrompt/opisPodgląd tekstuSkala wskazówek
Kobiecy komentator sportowyEnergiczna komentatorka sportowa z mocnym brytyjskim akcentem, z pasją relacjonująca mecz piłki nożnej w bardzo szybkim tempie. Jej głos jest żywy, entuzjastyczny i w pełni oddaje emocje wydarzeń.O MÓJ BOŻE — CO ZA GOL! Przejmuje piłkę tuż za linią środkową, mija DWÓCH obrońców, jakby w ogóle ich TAM nie było, i z całej siły pakuje ją w górny róg! Bramkarz nie miał ŻADNYCH SZANS! To ZAGRANIE ŚWIATOWEJ KLASY młodej napastniczki, a tłum zrywa się na NOGI! Ten mecz OŻYŁ i CZUĆ, jak ZMIENIA się jego dynamika!25%
Sierżant musztryWojskowy sierżant musztry krzyczący na swój oddział żołnierzy. Brzmi gniewnie i mówi szybko.SŁUCHAĆ MNIE, wy żałosna zbieranino! Nie przyszedłem tu niańczyć — przyszedłem SZKOLIĆ ŻOŁNIERZY! Ruszacie się, kiedy każę się ruszać, i oddychacie, kiedy każę oddychać! Macie dziesięć sekund, żeby ustawić się w szeregu, albo tego pożałujecie!!25%
Zły ogrOgromny zły ogr mówiący szybko. Ma głupkowaty, donośny ton.”Wasza broń to dla mnie wykałaczki. [laughs] Poddajcie się teraz, a może dam wam szybką śmierć. Obalałem królestwa i pożerałem armie. Jaką macie przeciwko mnie nadzieję?“30%
Brytyjski przedsiębiorca, z którym łatwo się utożsamićDoskonała jakość audio. Mężczyzna po trzydziestce lub na początku czterdziestki z mocnym brytyjskim akcentem, mówiący w naturalnym tempie jak do przyjaciela.[laughs] Widzisz, o to chodzi. TY widzisz firmę, a ja widzę… [lip smacks] ja widzę obietnicę, rozumiesz, o co mi chodzi? [exhales] Nie budujemy tylko dla zysku, budujemy, żeby, żeby WSPIERAĆ! Jeśli nasza technologia nie zostawia świata życzliwszym, mądrzejszym i lepiej połączonym, niż go zastaliśmy… [sighs] to co my tu w ogóle robimy?40%
Kobieta z PołudniaStarsza kobieta z mocnym południowym akcentem. Jest miła i sarkastyczna.”No cóż, kochanieńki, jeśli będziemy tylko gonić za tytułami i trofeami, przegapimy cały sens. [light chuckle] Wolałabym stworzyć coś, co ułatwi ludziom życie — a jeśli zrobię to w szpilkach, z uśmiechem i odrobiną zadziorności, to tym lepiej.”35%
Głos z trailera filmowegoDramatyczny głos budujący napięcie w trailerach filmowych, zwykle kojarzony z kinem akcji lub thrillerami”W świecie na skraju chaosu powstanie jeden bohater. Przygotuj się na historię epickich rozmiarów, wkrótce na wielkim ekranie.”20%
Piszcząca myszkaSłodka mała piszcząca myszka”Może jestem mała, ale charakter mam wielki! [giggles] Uważaj, wielkie stopy, bo podgryzę ci palce tak, że tego nie zapomnisz!“20%
Wściekły piratWściekły stary pirat, głośny i rubaszny”Przetrwałem sztormy, po których włosy stają się białe, i morskie potwory, od których drżą kolana. Myślisz, że możesz zadrzeć z kapitanem Czarnym Sercem i ujść z życiem?“30%
NowojorczykGłęboki, chropowaty, mocny nowojorski akcent; twardy, zmęczony życiem, często cyniczny”Chodzę tymi ulicami dłużej, niż możesz sobie wyobrazić, dzieciaku. Nic, co powiesz lub zrobisz, już mnie nie zaskoczy.”40%
Hiszpańska agentka wsparciaRodzima hiszpańszczyzna, hiszpański europejski (bez cech hiszpańskiego latynoamerykańskiego). Kobieta, 35–40 lat. Dobra jakość. Persona: godna zaufania agentka wsparcia. Emocje: uspokajająca, uważna, pewna siebie.Gładka, naturalna barwa z łagodną intonacją, bliskim brzmieniem i sygnałem bez szumów. Przekazuje informacje w spokojnym tempie, wyraźnie akcentując pomocne treści oraz budząc empatię i zaufanie.30%
Arabska obsługa klientaRodzimy arabski, z lekkim wpływem akcentu znad Zatoki Perskiej (ZEA). Kobieta, 30–40 lat. Doskonała jakość. Persona: profesjonalna agentka obsługi klienta. Emocje: ciepła, pewna siebie, uprzejma.Aksamitna barwa o spokojnym tonie, wyważonym tempie i łagodnej intonacji, z bliskim brzmieniem mikrofonu zapewniającym sygnał wysokiej jakości bez artefaktów. Wyraźna obecność i delikatny nacisk na przyjazne dla klienta zwroty ułatwiają zrozumienie.35%
Polski kreatywny narratorRodzimy polski. Mężczyzna, 48–58 lat. Doskonała jakość. Persona: kreatywny marzyciel. Emocje: ciekawy, łagodny, zachęcający.Głos jest gładki i bez artefaktów, o ciepłej, angażującej barwie i równym tempie, z naturalnym efektem bliskości. Jasna intonacja i precyzyjny akcent prowadzą słuchacza przez narrację.32%
Szalony naukowiecGłos ekscentrycznego geniusza nauki o szybkim, chaotycznym sposobie mówienia, który przyspiesza pod wpływem ekscytacji. Jego akcent z niemiecką nutą staje się wyraźniejszy, gdy jest wzburzony. Wysokość głosu mocno się zmienia — od zamyślonych pomruków po maniakalne okrzyki — z częstymi wybuchami szaleńczego śmiechu.”Jestem doktorem Heinrichem, rewolucyjnym geniuszem odrzuconym przez ciasnogłowy naukowy establishment! Bah! Nazywali moje teorie niemożliwymi, a metody nieetycznymi — ale kto śmieje się teraz? (maniacal laughter) Przez dwadzieścia lat doskonaliłem moje dzieło w tym górskim laboratorium, okiełznując energie wykraczające poza ludzkie pojmowanie! Głupcy z akademii pożałują swoich drwin, gdy mój destabilizator kwantowy ujawni multiwszechświat. A może nowe formy życia… eksperyment ma pewne nieprzewidywalne zmienne… FASCYNUJĄCE!“38%

FAQ

Voice Design pozwala stworzyć unikalny głos na podstawie promptu tekstowego.

Przydaje się, gdy nie możesz znaleźć dokładnie takiego głosu, jakiego potrzebujesz, w naszej Voice Library. Zamiast wybierać spośród istniejących opcji, możesz teraz wygenerować własny głos, opisując go własnymi słowami.

Aby zacząć, wpisz prompt opisujący głos, którego chcesz użyć. Możesz podać takie szczegóły jak akcent, płeć, tempo, ton i styl mówienia. Im bardziej konkretny prompt, tym lepiej głos będzie odpowiadał twoim oczekiwaniom. Jeśli jednak nie masz pewności, sprawdzi się też prosty prompt, np. „spokojny narrator”.

Głosy utworzone w Voice Design działają z Eleven v4, naszym najnowszym modelem, oraz wcześniejszymi modelami, w tym Eleven v3. Obsługują tagi audio. W Eleven v4 mogą być mniej ekspresyjne niż we wcześniejszych modelach.

Więcej wskazówek o pisaniu skutecznych promptów znajdziesz w naszym przewodniku po Voice Design.

Uwaga: Voice Design wciąż jest eksperymentalne. Professional Voice Clones oferują najwyższą jakość i spójność. Jeśli znajdziesz PVC, które spełnia twoje potrzeby, zalecamy jego użycie. Professional Voice Clones są w pełni obsługiwane w Eleven v4. Nie są w pełni zoptymalizowane dla Eleven v3.

Voice Design może generować szeroką gamę głosów — od realistycznych, przypominających ludzki głos po bardziej kreatywne głosy postaci.

Jeśli nie wiesz, od czego zacząć, wypróbuj prosty prompt, np. „kobieta w średnim wieku czytająca wiadomości”. Bardziej szczegółowe prompty zwykle dają jednak dokładniejsze i bardziej zniuansowane wyniki.

W prompcie możesz uwzględnić różne cechy, takie jak:

  • wiek
  • płeć
  • akcent
  • ton
  • tempo
  • emocje
  • styl mówienia
  • jakość audio

Dwie dodatkowe opcje pomagają kształtować wynik:

  • Głośność dostosowuje poziom głośności podglądu i zapisanego głosu.
  • Skala zgodności określa, jak ściśle wygenerowany głos podąża za twoim promptem.

Więcej pomocy w tworzeniu promptów znajdziesz w naszym przewodniku po Voice Design.

Voice Design zużywa kredyty tylko wtedy, gdy generujesz głosy.

Za każdym razem, gdy klikasz Wygeneruj głos, tworzymy trzy propozycje głosu na podstawie twojego promptu. Opłata zależy od liczby znaków w tekście podglądu.

Możesz wpisać własny tekst podglądu albo użyć przycisku Generuj automatycznie, by utworzyć go automatycznie. Automatycznie generowane podglądy zawierają odpowiednie tagi audio.

Więcej informacji znajdziesz w naszym przewodniku po Voice Design.

No results