Voice Design
Przewodnik po tworzeniu głosów na podstawie promptu tekstowego.
Przegląd
Voice Design pomaga twórcom, gdy dokładnego głosu, którego szukają, nie ma w Voice Library. Jeśli nie znajdziesz odpowiedniego głosu do projektu, możesz go stworzyć. Voice Design najlepiej sprawdza się do szybkiego testowania i iteracji, a jakość wyników może się różnić zależnie od promptu i zastosowania. Jeśli potrzebujesz najbardziej spójnej jakości gotowej do produkcji, Professional Voice Clones (PVC) to obecnie głosy najwyższej jakości na naszej platformie — jeśli więc w naszej bibliotece jest PVC odpowiadający twoim potrzebom, zalecamy użycie go.
Voice Design znajdziesz w aplikacji ElevenLabs: Voices -> My Voices -> Add a new voice -> Voice Design, lub przez API.
Po kliknięciu generowania stworzymy dla ciebie trzy opcje głosu. Jedyny koszt korzystania z Voice Design to liczba kredytów za wygenerowanie tekstu podglądu. Opłatę pobieramy tylko raz, mimo że generujemy trzy próbki. Liczbę znaków, które zostaną odjęte, zobaczysz w polu tekstowym „Text to preview”.
Po wygenerowaniu możesz wybrać i zapisać jeden z wyników, który zajmie jedno miejsce na głos.
Przewodnik po promptach
Prompt to podstawa twojego głosu. Określa dla modelu rodzaj głosu, który chcesz stworzyć — od akcentu i typu postaci po płeć i charakter głosu. Dobrze napisany prompt może zdecydować o różnicy między ogólnym głosem a takim, który naprawdę pasuje do twojej wizji. Ogólnie bardziej opisowe i szczegółowe prompty dają dokładniejsze i bardziej zniuansowane wyniki. Im więcej szczegółów podasz — w tym wiek, płeć, ton, akcent, tempo, emocje, styl i inne — tym lepiej model zinterpretuje i stworzy głos, który będzie celowy i dopasowany.
Czasem jednak działają też krótkie i proste prompty, zwłaszcza gdy zależy ci na bardziej neutralnym lub uniwersalnym głosie. Na przykład „Spokojny męski narrator” może dać dokładnie to, czego potrzebujesz, bez wchodzenia w szczegóły — szczególnie jeśli nie tworzysz konkretnej postaci ani stylu. Właściwy poziom szczegółowości zależy od zastosowania. Tworzysz postać fantasy? Wirtualnego asystenta? Zmęczoną nowojorczankę po sześćdziesiątce z suchym poczuciem humoru? Im wyraźniej określisz to w prompcie, tym bliżej wyobrażonego efektu będzie wynik.
Zalecany format promptu
Aby uzyskać spójne wyniki, użyj w prompcie tego formatu:
Przykład:
Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.
Typowe błędy, których warto unikać
- Nie używaj słowa „accent”, gdy masz na myśli intonację — może to wywołać niechciane zmiany dialektu. Zamiast tego opisz intonację, akcentowanie lub sposób mówienia.
- Unikaj słów związanych z efektami — określenia takie jak „reverb”, „echo”, „phone” czy „tape” mogą negatywnie wpłynąć na jakość wyniku.
- Wyraźnie określ język i dialekt — zawsze podaj język i wariant regionalny w pierwszym zdaniu, aby uniknąć odchylenia.
Jakość audio
Jakość audio to czystość, klarowność i ogólna wierność wygenerowanego głosu. Domyślnie ElevenLabs stara się tworzyć czyste, naturalnie brzmiące audio — ale jeśli projekt wymaga określonego poziomu jakości, najlepiej wyraźnie uwzględnić go w promptcie.
Aby uzyskać wysoką jakość, dodaj do opisu głosu frazę, taką jak „idealna jakość audio” lub „nagranie jakości studyjnej”. Pomaga to zapewnić maksymalną klarowność, minimalne zniekształcenia i dopracowane brzmienie.
Możesz też użyć konkretnych określeń jakości, które dają spójne wyniki:
- Jakość OK
- Dobra jakość
- Bardzo dobra jakość
- Doskonała jakość
- Jakość studyjna
- Jakość emisyjna
Te określenia pomagają uzyskać najwyższą jakość audio, gdy dodasz je do promptu.
Dodanie takich fraz może czasem ogólnie obniżyć dokładność promptu, jeśli głos jest bardzo konkretny lub niszowy.
Są też kreatywne przypadki, w których niższa jakość audio jest zamierzona, na przykład przy symulacji rozmowy telefonicznej, starej audycji radiowej lub znalezionego nagrania. W takich sytuacjach pomiń określenia jakości albo wyraźnie dodaj frazy takie jak:
- „Audio niskiej jakości”
- „Słaba jakość audio”
- „Brzmi jak poczta głosowa”
- „Przytłumione i odległe, jak ze starego magnetofonu”
Miejsce tej frazy w promptcie jest dowolne — może pojawić się na początku lub na końcu; zauważyliśmy, że działa dobrze w obu miejscach.
Wiek, ton/barwa i płeć
Te trzy cechy są podstawą projektowania głosu — kształtują jego ogólny charakter i emocjonalny wydźwięk. Im więcej szczegółów podasz, tym łatwiej AI stworzy głos pasujący do twojej wizji — niezależnie od tego, czy tworzysz wiarygodną postać, przekonującego narratora czy wirtualnego asystenta.
Wiek
Opis postrzeganego wieku głosu pomaga określić jego dojrzałość, teksturę i energię. Używaj konkretnych określeń, by naprowadzić AI na odpowiednią jakość głosu.
Przydatne określenia:
- „Nastoletni mężczyzna” / „nastoletnia kobieta”
- „Młody dorosły” / „po dwudziestce” / „około trzydziestki”
- „Mężczyzna w średnim wieku” / „kobieta po czterdziestce”
- „Starszy mężczyzna” / „starsza kobieta” / „mężczyzna po osiemdziesiątce”
Ton/barwa
To fizyczna jakość głosu, kształtowana przez wysokość, rezonans i teksturę. Różni się od emocjonalnego sposobu mówienia czy nastawienia.
Popularne określenia tonu/barwy:
- „Głęboki” / „niski”
- „Gładki” / „bogaty”
- „Chropowaty” / „ochrypły”
- „Nosowy” / „piskliwy”
- „Lekki” / „oddechowy”
- „Donośny” / „rezonujący”
- „Lekki” / „cienki”
- „Ciepły” / „łagodny”
- „Metaliczny” / „blaszany”
Płeć
Płeć często wpływa na wysokość, ciężar i brzmienie głosu — ale możesz wyjść poza proste kategorie, opisując brzmienie zamiast tożsamości.
Przykłady:
- „Niski, zachrypnięty głos kobiecy”
- „Męski głos, głęboki i rezonujący”
- „Głos neutralny płciowo — miękki i średnio wysoki”
Akcent
Akcent ma kluczowe znaczenie dla regionalnej, kulturowej i emocjonalnej tożsamości głosu. Jeśli projekt wymaga autentycznego brzmienia — osadzonego w realizmie lub stylizowanego pod postać — jasne i celowe określenie pożądanego akcentu jest niezbędne.
Wybór słów ma znaczenie — niektóre określenia dają bardziej spójne wyniki. Na przykład „wyraźny” często działa lepiej niż „silny”, gdy opisujesz, jak zauważalny ma być akcent. Warto próbować różnych wersji — zachęcamy do eksperymentowania ze słowami oraz jak najbardziej kreatywnych i szczegółowych opisów.
Uważaj na słowo „akcent” — jeśli chodzi ci o intonację lub wzorce akcentowania, użyj właśnie tych określeń. Użycie słowa „akcent”, gdy masz na myśli intonację, może wywołać niechcianą zmianę dialektu.
- Przykłady jasnych promptów dotyczących akcentu:
- „Mężczyzna w średnim wieku z wyraźnym francuskim akcentem”
- „Młoda kobieta z lekkim południowym zaśpiewem”
- „Starszy mężczyzna z mocnym wschodnioeuropejskim akcentem”
- „Pogodna kobieta mówiąca z wyraźnym brytyjskim akcentem”
- „Młodszy mężczyzna z łagodnym irlandzkim zaśpiewem”
- „Autorytatywny głos z neutralnym amerykańskim akcentem”
- „Mężczyzna z regionalnym australijskim akcentem, wyluzowany i mówiący przez nos”
Unikaj zbyt ogólnych określeń, takich jak „zagraniczny” czy „egzotyczny” — są nieprecyzyjne i mogą dawać niespójne wyniki.
Łącz akcent z innymi cechami, takimi jak ton, wiek czy tempo, aby lepiej kontrolować efekt. Na przykład: „Sarkastyczna starsza kobieta z wyraźnym nowojorskim akcentem, mówiąca powoli”.
W przypadku głosów fantasy lub fikcyjnych możesz wskazać rzeczywiste akcenty jako inspirację:
- „Elf z porządnym, wyraźnym brytyjskim akcentem. Jest królewski i melodyjny.”
- „Goblin z chropowatym wschodnioeuropejskim akcentem.”
Tempo
Tempo określa szybkość i rytm, z jakimi mówi głos. To kluczowy element kształtujący osobowość, emocjonalny ton i klarowność głosu. Jasne określenie tempa jest szczególnie ważne przy projektowaniu głosów do konkretnych zastosowań, takich jak opowiadanie historii, reklamy, dialogi postaci czy treści instruktażowe.
Używaj prostego języka, aby opisać, jak szybko lub wolno głos ma mówić. Możesz też opisać charakter tempa — czy jest stałe, nieregularne, celowe czy swobodne. Jeśli tempo się zmienia, koniecznie wskaż gdzie i dlaczego.
Przykłady określeń tempa:
- „Mówi szybko” / „w szybkim tempie”
- „W normalnym tempie” / „mówi normalnie”
- „Mówi powoli” / „w wolnym rytmie”
- „Celowe i miarowe tempo”
- „Przeciągane, jakby delektował się każdym słowem”
- „W pośpiesznym rytmie, jakby się spieszył”
- „Swobodne, konwersacyjne tempo”
- „Rytmiczne i muzyczne tempo”
- „Nieregularne tempo, z nagłymi pauzami i przyspieszeniami”
- „Równe tempo, ze stałymi odstępami między słowami”
- „Mowa staccato”
Tekst podglądu
Gdy napiszesz dobry prompt głosowy, tekst użyty do podglądu tego głosu ma kluczowy wpływ na jego faktyczne brzmienie. Tekst podglądu działa jak scenariusz wykonania — nadaje ton, tempo i emocjonalny sposób mówienia, które głos będzie próbował odtworzyć.
Aby uzyskać najlepsze wyniki, tekst podglądu powinien uzupełniać opis głosu, a nie mu przeczyć. Na przykład jeśli prompt opisuje „spokojny, refleksyjny głos młodszej kobiety z lekkim japońskim akcentem”, zdanie takie jak „Hej! Nie mogę znieść tego, co zrobiłeś z tym cholernym miejscem!!!” będzie z nim niezgodne. Model spróbuje pogodzić tę sprzeczność, co często prowadzi do nienaturalnych lub niespójnych wyników.
Zamiast tego użyj przykładowego tekstu, który odzwierciedla zamierzoną osobowość i emocjonalny ton głosu. W powyższym przykładzie tekst typu „Ostatnio jest cicho… Miałam czas pomyśleć i może właśnie tego potrzebowałam najbardziej.” wspiera prompt i pomaga wygenerować bardziej naturalny, spójny głos.
Zauważyliśmy też, że dłuższe teksty podglądu zwykle dają bardziej stabilne i ekspresyjne wyniki. Krótkie frazy mogą czasem brzmieć urywanie lub niespójnie, zwłaszcza przy testowaniu subtelnych cech, takich jak ton czy tempo. Więcej kontekstu — pełne zdanie albo nawet krótki akapit — pozwala modelowi stworzyć płynniejszą i dokładniejszą reprezentację głosu.
Parametry
Głośność
Steruje głośnością generowania Text to Preview, a ostatecznie także głosu po zapisaniu.
Skala wskazówek
Określa, jak ściśle model trzyma się Promptu. Wyższe wartości oznaczają większą zgodność z promptem, ale mogą pogorszyć jakość audio, jeśli prompt jest bardzo niszowy. Niższe wartości dają modelowi więcej swobody twórczej kosztem dokładności promptu. Użyj niższej wartości, jeśli wykonanie i jakość audio są ogólnie ważniejsze niż idealne odwzorowanie promptu. Wysokie wartości zalecamy, gdy kluczowa jest dokładność akcentu lub tonu.
Atrybuty i przykłady
Eksperymentuj ze sposobem zapisu tych określeń. Na przykład „Idealna jakość audio” można też zapisać jako „jakość audio jest idealna”. Czasem daje to różne wyniki!