Najlepsze praktyki

Dowiedz się, jak kontrolować sposób wypowiedzenia, wymowę i emocje oraz optymalizować tekst pod kątem mowy.

Ten przewodnik przedstawia techniki poprawy wyników zamiany tekstu na mowę z użyciem modeli ElevenLabs. Eksperymentuj z nimi, aby znaleźć rozwiązanie najlepsze dla swoich potrzeb.

Kontrola

Aktywnie pracujemy nad Director’s Mode, by dać ci jeszcze większą kontrolę nad wynikami.

Te techniki pozwolą ci uzyskać niuansowane rezultaty, dopóki nie udostępnimy zaawansowanych funkcji takich jak Director’s Mode.

Pauzy

Eleven v4 i Eleven v3 nie obsługują tagów przerwy SSML. Aby kontrolować pauzy, użyj technik opisanych w sekcji Promptowanie Eleven v4.

Użyj <break time="x.xs" />, aby dodać naturalne pauzy trwające do 3 sekund.

Użycie zbyt wielu tagów przerwy w jednej generacji może powodować niestabilność. AI może przyspieszyć albo dodać szumy czy artefakty dźwiękowe. Pracujemy nad rozwiązaniem tego problemu.

Przykład
"Hold on, let me think." <break time="1.5s" /> "Alright, I've got it."
  • Spójność: Używaj tagów <break> konsekwentnie, by zachować naturalny rytm mowy. Nadmierne użycie może powodować niestabilność.
  • Zachowanie zależne od głosu: Różne głosy mogą inaczej obsługiwać pauzy, zwłaszcza te wytrenowane na dźwiękach wypełniających, takich jak „uh” czy „ah”.

Alternatywą dla <break> są myślniki (- lub —) dla krótkich pauz oraz wielokropki (…) dla wahania. Są jednak mniej spójne.

Przykład
"It… well, it might work." "Wait — what's that noise?"

Wymowa

IPA w Eleven v4

Eleven v4 (eleven_v4) zapewnia lepszą natywną obsługę Międzynarodowego Alfabetu Fonetycznego (IPA), dzięki czemu masz większą kontrolę nad wymową nazw, terminów technicznych i innych słów wymagających specjalnego traktowania. Wymowa IPA jest bardziej spójna niż w poprzednich modelach, ale wyniki nadal mogą się różnić zależnie od głosu i frazy. Zalecamy przetestowanie ważnej wymowy z wybranym głosem, zanim użyjesz jej w produkcji.

W przeciwieństwie do starszych modeli, które wymagają tagów fonemów w stylu XML, Eleven v4 rozumie symbole IPA, gdy umieścisz je między ukośnikami w tekście:

Składnia
"/IPA_transcription/"

Transkrypcja IPA powinna:

  • Być otoczona ukośnikami (/) na początku i końcu
  • Być zapisana standardowymi symbolami IPA
  • Być ujęta w podwójne cudzysłowy, gdy przekazujesz ją jako parametr tekstowy

Przykłady kodu

from elevenlabs import ElevenLabs
client = ElevenLabs()
audio = client.text_to_speech.convert(
voice_id="21m00Tcm4TlvDq8ikWAM",
text='The term "/ˌbaɪoʊˈkemɪstri/" refers to the study of chemical processes.',
model_id="eleven_v4",
)

Możesz umieścić kilka transkrypcji IPA w jednym ciągu tekstowym:

from elevenlabs import ElevenLabs
client = ElevenLabs()
text = 'The medication "/ɡluːˈkoʊs/" and "/ˌɪnsjəˈlɪn/" are commonly used to manage conditions like "/ˌdaɪəˈbiːtiːz/".'
audio = client.text_to_speech.convert(
voice_id="21m00Tcm4TlvDq8ikWAM",
text=text,
model_id="eleven_v4",
)

Dobre praktyki

  • Używaj standardowych symboli IPA z tabeli Międzynarodowego Alfabetu Fonetycznego
  • Dodawaj znaczniki akcentu: głównego (ˈ) i pobocznego (ˌ) dla słów wielosylabowych
  • Stosuj wybiórczo: otaczaj tylko konkretne słowa lub frazy wymagające kontroli wymowy
  • Testuj z wybranym głosem: różne głosy mogą nieco inaczej interpretować IPA

Rozwiązywanie problemów

Sprawdź w słowniku IPA, czy transkrypcja IPA jest poprawna. Dodaj znaczniki akcentu (ˈ dla akcentu głównego, ˌ dla pobocznego) w słowach wielosylabowych. Testuj z różnymi głosami, ponieważ niektóre mogą dokładniej interpretować IPA niż inne.

Wymowa IPA jest bardziej spójna niż w poprzednich modelach, ale wyniki nadal mogą się różnić zależnie od głosu i frazy. Zalecamy przetestowanie ważnej wymowy z wybranym głosem przed użyciem jej w produkcji. Jeśli potrzebujesz spójnego wyniku, wygeneruj go więcej niż raz i wybierz najlepszy.

Tagi fonemów dla modeli v2

W modelach v2 określaj wymowę za pomocą tagów fonemów SSML. Obsługiwane alfabety to CMU Arpabet oraz Międzynarodowy Alfabet Fonetyczny (IPA).

Tagi fonemów są zgodne tylko z modelem eleven_flash_v2.

<phoneme alphabet="cmu-arpabet" ph="M AE1 D IH0 S AH0 N">
Madison
</phoneme>

W modelach v2 zalecamy CMU Arpabet, ponieważ zapewnia spójne i przewidywalne wyniki. IPA również może działać skutecznie, ale CMU Arpabet zwykle jest bardziej niezawodny.

Tagi fonemów działają tylko dla pojedynczych słów. Jeśli imię i nazwisko mają być wymawiane w określony sposób, musisz utworzyć tag fonemu dla każdego słowa.

Aby zachować poprawną wymowę słów wielosylabowych, zadbaj o właściwe oznaczenie akcentu:

<phoneme alphabet="cmu-arpabet" ph="P R AH0 N AH0 N S IY EY1 SH AH0 N">
pronunciation
</phoneme>

Tagi aliasów

W modelach, które nie obsługują tagów fonemów, możesz spróbować zapisywać słowa bardziej fonetycznie. Możesz też stosować różne triki, np. wielkie litery, myślniki, apostrofy, a nawet pojedyncze cudzysłowy wokół jednej litery lub kilku liter.

Na przykład słowo „trapezii” można zapisać jako „trapezIi”, by mocniej podkreślić „ii”.

Możesz zastąpić słowo bezpośrednio w tekście. Jeśli jednak chcesz określić wymowę innymi słowami lub frazami przy użyciu słownika wymowy, użyj tagów aliasów. To przydaje się przy generowaniu z Multilingual v2, który nie obsługuje tagów fonemów. Słowników wymowy możesz używać w ElevenCreative Studio, Dubbing Studio oraz Speech Synthesis przez API.

Na przykład jeśli tekst zawiera nazwę o nietypowej wymowie, z którą AI może mieć trudność, możesz użyć tagu aliasu, by określić jej wymowę:

<lexeme>
<grapheme>Claughton</grapheme>
<alias>Cloffton</alias>
</lexeme>

Jeśli chcesz mieć pewność, że skrót będzie zawsze wymawiany w określony sposób, gdy pojawi się w tekście, możesz użyć tagu aliasu:

<lexeme>
<grapheme>UN</grapheme>
<alias>United Nations</alias>
</lexeme>

Słowniki wymowy

Niektóre nasze narzędzia, takie jak ElevenCreative Studio i Dubbing Studio, pozwalają tworzyć i przesyłać słowniki wymowy. Możesz w nich określić wymowę wybranych słów, np. nazw postaci lub marek, albo sposób odczytywania skrótów.

Słowniki wymowy umożliwiają to przez przesłanie pliku leksykonu lub słownika, który określa pary słów i ich wymowę — za pomocą alfabetu fonetycznego albo zamiany słów.

Gdy któreś z tych słów pojawi się w projekcie, model AI wymówi je zgodnie z określoną zamianą.

Aby dodać plik słownika wymowy, otwórz ustawienia projektu i prześlij plik TXT lub w formacie .PLS. Po dodaniu słownika do projektu automatycznie sprawdzimy, które fragmenty projektu trzeba ponownie przekonwertować z użyciem nowego pliku słownika, i oznaczymy je jako nieprzekonwertowane.

Obecnie obsługujemy tylko słowniki wymowy, które określają zamiany za pomocą tagów fonemów lub aliasów.

Zarówno fonemy, jak i aliasy to zestawy reguł określających wyszukiwane słowo lub frazę, nazywane grafemem, oraz to, czym zostaną zastąpione. Pamiętaj, że wyszukiwanie rozróżnia wielkość liter. Podczas sprawdzania słowa do zastąpienia w słowniku wymowy słownik jest przeszukiwany od początku do końca i używane jest tylko pierwsze dopasowanie.

Przykłady słowników wymowy

Poniżej znajdziesz przykłady słowników wymowy w CMU Arpabet i IPA, zawierające fonem określający wymowę słowa „Apple” oraz alias zastępujący „UN” frazą „United Nations”:

<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="cmu-arpabet" xml:lang="en-GB">
<lexeme>
<grapheme>apple</grapheme>
<phoneme>AE P AH L</phoneme>
</lexeme>
<lexeme>
<grapheme>UN</grapheme>
<alias>United Nations</alias>
</lexeme>
</lexicon>

Aby wygenerować plik słownika wymowy .pls, możesz skorzystać z kilku narzędzi open source:

  • Sequitur G2P - Narzędzie open source, które uczy się reguł wymowy z danych i może generować transkrypcje fonetyczne.
  • Phonetisaurus - System G2P open source trenowany na istniejących słownikach, takich jak CMUdict.
  • eSpeak - Syntezator mowy, który może generować transkrypcje fonemów z tekstu.
  • CMU Pronouncing Dictionary - Gotowy słownik angielski z transkrypcjami fonetycznymi.

Emocje

Przekazuj emocje przez kontekst narracyjny lub jawne tagi dialogowe. Dzięki temu AI lepiej rozumie ton i emocję, które ma naśladować.

Przykład
You're leaving?" she asked, her voice trembling with sadness. "That's it!" he exclaimed triumphantly.

Jawne tagi dialogowe dają bardziej przewidywalne wyniki niż poleganie wyłącznie na kontekście, ale model nadal będzie wypowiadał wskazówki dotyczące emocji. Jeśli nie są potrzebne, możesz je usunąć w postprodukcji za pomocą edytora audio.

Tempo

Na tempo audio duży wpływ ma materiał użyty do stworzenia głosu. Tworząc głos, zalecamy używanie dłuższych, ciągłych próbek, aby uniknąć problemów z tempem, takich jak nienaturalnie szybka mowa.

Aby kontrolować szybkość generowanego audio, możesz użyć ustawienia szybkości. Pozwala ono przyspieszyć lub spowolnić generowaną mowę. Ustawienie szybkości jest dostępne w Text to Speech na stronie i przez API, a także w ElevenCreative Studio i Agents Platform. Znajdziesz je w ustawieniach głosu.

Wartość domyślna to 1.0, co oznacza, że szybkość nie jest zmieniana. Wartości poniżej 1.0 spowalniają głos, maksymalnie do 0.7. Wartości powyżej 1.0 przyspieszają głos, maksymalnie do 1.2. Skrajne wartości mogą wpłynąć na jakość generowanej mowy.

Tempo możesz też kontrolować, pisząc naturalnym, narracyjnym stylem.

Przykład
"I… I thought you'd understand," he said, his voice slowing with disappointment.

Wskazówki

  • Niespójne pauzy: upewnij się, że do pauz używasz składni <break time=“x.xs” />.

  • Błędy wymowy: używaj tagów fonemów CMU Arpabet lub IPA, aby precyzyjnie określić wymowę.
  • Niewłaściwe emocje: dodaj kontekst narracyjny lub jawne tagi, by wskazać emocje. Pamiętaj, aby usunąć tekst wskazówek emocjonalnych w postprodukcji.

Eksperymentuj z innym sformułowaniem, aby uzyskać pożądane tempo lub emocje. W przypadku złożonych efektów dźwiękowych podziel prompty na mniejsze, kolejne elementy i połącz wyniki ręcznie.

Kontrola kreatywna

Choć aktywnie rozwijamy „Director’s Mode”, by dać użytkownikom jeszcze większą kontrolę nad wynikami, oto kilka tymczasowych technik, które pomogą zwiększyć kreatywność i precyzję:

1

Styl narracyjny

Pisz prompty w stylu narracyjnym, podobnym do scenariusza, aby skutecznie kierować tonem i tempem.

2

Warstwowe wyniki

Generuj efekty dźwiękowe lub mowę w segmentach, a następnie nakładaj je na siebie w programie do edycji audio, by tworzyć bardziej złożone kompozycje.

3

Eksperymenty fonetyczne

Jeśli wymowa nie jest idealna, eksperymentuj z alternatywną pisownią lub przybliżeniami fonetycznymi, aby uzyskać pożądany efekt.

4

Ręczne poprawki

Łącz pojedyncze efekty dźwiękowe ręcznie w postprodukcji dla sekwencji wymagających precyzyjnego timingu.

5

Iteracja na podstawie opinii

Poprawiaj wyniki, dostosowując opisy, tagi lub wskazówki emocjonalne.

Normalizacja tekstu

Podczas korzystania z Text to Speech z bardziej złożonymi elementami, takimi jak numery telefonów, kody pocztowe czy e-maile, mogą być one błędnie wymawiane. Często wynika to z tego, że konkretne elementy nie znalazły się w zbiorze treningowym, a mniejsze modele nie potrafią uogólnić sposobu ich wymowy. Ten przewodnik wyjaśnia, kiedy pojawiają się takie różnice i jak zadbać o poprawną wymowę.

Normalizacja jest domyślnie włączona we wszystkich modelach TTS, aby poprawić wymowę liczb, dat i innych złożonych elementów tekstu.

Dlaczego modele różnie odczytują dane wejściowe?

Niektóre modele są trenowane, by odczytywać liczby i wyrażenia w bardziej naturalny dla człowieka sposób. Na przykład fraza “$1,000,000” jest poprawnie odczytywana jako “one million dollars” przez model Eleven Multilingual v2. Jednak ten sam zapis model Eleven Flash v2.5 odczytuje jako “one thousand thousand dollars”.

Wynika to z tego, że Multilingual v2 jest większym modelem i lepiej potrafi uogólniać sposób odczytywania liczb tak, by brzmiało to naturalniej dla słuchaczy. Flash v2.5 jest znacznie mniejszym modelem, więc nie ma takich możliwości.

Typowe przykłady

Modele Text to Speech mogą mieć trudności z poniższymi elementami:

  • Numerami telefonów (“123-456-7890”)
  • Walutami (“$47,345.67”)
  • Wydarzeniami w kalendarzu (“2024-01-01”)
  • Godzinami (“9:23 AM”)
  • Adresami (“123 Main St, Anytown, USA”)
  • Adresami URL (“example.com/link/to/resource”)
  • Skrótami jednostek (“TB” zamiast “Terabyte”)
  • Skrótami klawiszowymi (“Ctrl + Z”)

Jak temu zapobiec

Używaj wytrenowanych modeli

Najprostszym sposobem jest użycie modelu TTS wytrenowanego do bardziej naturalnego odczytywania liczb i wyrażeń, takiego jak Eleven Multilingual v2. Nie zawsze jest to jednak możliwe, na przykład gdy w twoim zastosowaniu kluczowe są niskie opóźnienia (np. w agentach konwersacyjnych).

Dodaj normalizację do promptów LLM

Jeśli używasz LLM do generowania tekstu dla TTS, możesz dodać instrukcje normalizacji do promptu.

1

Używaj jasnych i konkretnych promptów

LLM najlepiej reagują na uporządkowane i jednoznaczne instrukcje. Prompt powinien wyraźnie określać, że tekst ma zostać przekonwertowany do formatu czytelnego dla mowy.

2

Uwzględnij różne formaty liczb

Nie wszystkie liczby odczytuje się tak samo. Zastanów się, jak powinny być wypowiadane różne typy liczb:

  • Liczby główne: 123 → “one hundred twenty-three”
  • Liczby porządkowe: 2nd → “second”
  • Wartości pieniężne: $45.67 → “forty-five dollars and sixty-seven cents”
  • Numery telefonów: “123-456-7890” → “one two three, four five six, seven eight nine zero”
  • Liczby dziesiętne i ułamki: “3.5” → “three point five”, “⅔” → “two-thirds”
  • Liczby rzymskie: “XIV” → “fourteen” (lub “the fourteenth”, jeśli to tytuł)
3

Usuń lub rozwiń skróty

Dla jasności popularne skróty należy rozwinąć:

  • “Dr.” → “Doctor”
  • “Ave.” → “Avenue”
  • “St.” → “Street” (ale “St. Patrick” powinno pozostać bez zmian)

Możesz poprosić o wyraźne rozwinięcie w prompcie:

Rozwiń wszystkie skróty do pełnych form wypowiadanych.

4

Normalizacja wyrażeń alfanumerycznych

Normalizacja nie dotyczy tylko liczb — dla jasności warto też normalizować niektóre wyrażenia alfanumeryczne:

  • Skróty klawiszowe: “Ctrl + Z” → “control z”
  • Skróty jednostek: “100km” → “one hundred kilometers”
  • Symbole: “100%” → “one hundred percent”
  • Adresy URL: “elevenlabs.io/docs” → “eleven labs dot io slash docs”
  • Wydarzenia w kalendarzu: “2024-01-01” → “January first, two-thousand twenty-four”
5

Weź pod uwagę przypadki brzegowe

Różne konteksty mogą wymagać różnych konwersji:

  • Daty: “01/02/2023” → “January second, twenty twenty-three” lub “the first of February, twenty twenty-three” (zależnie od języka)
  • Godziny: “14:30” → “two thirty PM”

Jeśli potrzebujesz konkretnego formatu, zaznacz to wyraźnie w prompcie.

Wszystko razem

Ten prompt będzie dobrym punktem wyjścia dla większości zastosowań:

Convert the output text into a format suitable for text-to-speech. Ensure that numbers, symbols, and abbreviations are expanded for clarity when read aloud. Expand all abbreviations to their full spoken forms.
Example input and output:
"$42.50" → "forty-two dollars and fifty cents"
"£1,001.32" → "one thousand and one pounds and thirty-two pence"
"1234" → "one thousand two hundred thirty-four"
"3.14" → "three point one four"
"555-555-5555" → "five five five, five five five, five five five five"
"2nd" → "second"
"XIV" → "fourteen" - unless it's a title, then it's "the fourteenth"
"3.5" → "three point five"
"⅔" → "two-thirds"
"Dr." → "Doctor"
"Ave." → "Avenue"
"St." → "Street" (but saints like "St. Patrick" should remain)
"Ctrl + Z" → "control z"
"100km" → "one hundred kilometers"
"100%" → "one hundred percent"
"elevenlabs.io/docs" → "eleven labs dot io slash docs"
"2024-01-01" → "January first, two-thousand twenty-four"
"123 Main St, Anytown, USA" → "one two three Main Street, Anytown, United States of America"
"14:30" → "two thirty PM"
"01/02/2023" → "January second, two-thousand twenty-three" or "the first of February, two-thousand twenty-three", depending on locale of the user

Użyj wyrażeń regularnych do wstępnego przetwarzania

Jeśli używasz kodu do promptowania LLM, możesz użyć wyrażeń regularnych, aby znormalizować tekst przed przekazaniem go do modelu. To bardziej zaawansowana technika, która wymaga pewnej znajomości wyrażeń regularnych. Oto kilka prostych przykładów:

# Be sure to install the inflect library before running this code
import inflect
import re
# Initialize inflect engine for number-to-word conversion
p = inflect.engine()
def normalize_text(text: str) -> str:
# Convert monetary values
def money_replacer(match):
currency_map = {"$": "dollars", "£": "pounds", "€": "euros", "¥": "yen"}
currency_symbol, num = match.groups()
# Remove commas before parsing
num_without_commas = num.replace(',', '')
# Check for decimal points to handle cents
if '.' in num_without_commas:
dollars, cents = num_without_commas.split('.')
dollars_in_words = p.number_to_words(int(dollars))
cents_in_words = p.number_to_words(int(cents))
return f"{dollars_in_words} {currency_map.get(currency_symbol, 'currency')} and {cents_in_words} cents"
else:
# Handle whole numbers
num_in_words = p.number_to_words(int(num_without_commas))
return f"{num_in_words} {currency_map.get(currency_symbol, 'currency')}"
# Regex to handle commas and decimals
text = re.sub(r"([$£€¥])(\d+(?:,\d{3})*(?:\.\d{2})?)", money_replacer, text)
# Convert phone numbers
def phone_replacer(match):
return ", ".join(" ".join(p.number_to_words(int(digit)) for digit in group) for group in match.groups())
text = re.sub(r"(\d{3})-(\d{3})-(\d{4})", phone_replacer, text)
return text
# Example usage
print(normalize_text("$1,000")) # "one thousand dollars"
print(normalize_text("£1000")) # "one thousand pounds"
print(normalize_text("€1000")) # "one thousand euros"
print(normalize_text("¥1000")) # "one thousand yen"
print(normalize_text("$1,234.56")) # "one thousand two hundred thirty-four dollars and fifty-six cents"
print(normalize_text("555-555-5555")) # "five five five, five five five, five five five five"

Prompty w Eleven v4

Ta sekcja dotyczy Eleven v4. Wiele poniższych technik sprawdza się też w Eleven v3. Ogólnie Eleven v4 to wyraźne ulepszenie względem Eleven v3 i daje lepsze wyniki w niemal każdym przypadku. Zdecydowanie zalecamy przejście na v4 i przetestowanie go z własnymi głosami oraz treściami, aby zobaczyć różnicę. Kilka skrajnych przypadków może wymagać innego rozwiązania, ale dla większości użytkowników v4 będzie lepszym wyborem.

Informacje o zmianach w modelu — Voice Cloning, obsłudze akcentów, wariantach i porównaniach — znajdziesz w Eleven v4.

Eleven v4 i Eleven v3 nie obsługują tagów przerwy SSML. Używaj tagów audio, interpunkcji (wielokropków) i struktury tekstu, aby sterować pauzami i tempem.

Wybór głosu

Głos wciąż ma znaczenie. Sposób mówienia, który jest już w danych treningowych — szept, krzyk, konkretny styl — jest modelowi łatwiej odtworzyć. Poproszenie o coś spoza tych danych jest trudniejsze. Eleven v4 lepiej niż wcześniejsze modele stosuje się do tagów audio, także gdy głos nie był trenowany w danym stylu. Głos, który nigdy nie szeptał, nadal powinien reagować na [whispering], a głos, który nigdy nie krzyczał — na [shouting]. Może to jednak działać mniej niezawodnie, a wynik nie zawsze będzie optymalny. Wstępne testy pokazują, że działa to całkiem dobrze. Zdecydowanie zalecamy przetestowanie tego z wybranym głosem i w konkretnym zastosowaniu.

Tagi audio

Tagi audio (np. [whispering], [shouting], [laughing]) pozwalają precyzyjnie sterować sposobem mówienia, a Eleven v4 obsługuje je z większą finezją niż wcześniejsze modele. Nie są jeszcze idealne, a my nadal je rozwijamy, by model niezawodniej stosował się do instrukcji z tagów — to obszar, nad którym stale pracujemy i który będzie coraz lepszy.

Dużo pomaga precyzyjne określenie tego, czego chcesz. Ponieważ Eleven v4 jest trenowany zarówno do generowania stylów wypowiedzi, jak i efektów dźwiękowych, tag może czasem zostać zinterpretowany jako prośba o efekt dźwiękowy zamiast instrukcji dotyczącej mówienia (lub odwrotnie). Tagi jasno opisujące pożądaną jakość głosu (np. [low, gravelly voice] zamiast czegoś, co można odczytać jako sygnał dźwiękowy) pomagają modelowi wygenerować zamierzony efekt. Zalecamy testowanie konkretnych tagów i sformułowań dla twojego zastosowania — i spodziewaj się, że będzie to stale ulepszane.

Tagi działają lepiej, gdy dany styl mówienia jest już w danych treningowych głosu. Eleven v4 może nadal zastosować tag, w którym głos nie był trenowany, np. [whispering] lub [shouting], ale wynik może nie być optymalny.

Związane z głosem

Te tagi sterują sposobem mówienia i ekspresją emocji:

  • [laughs], [laughs harder], [starts laughing], [wheezing]
  • [whispers]
  • [sighs], [exhales]
  • [sarcastic], [curious], [excited], [crying], [snorts], [mischievously]
Example
[whispers] I never knew it could be this way, but I'm glad we're here.

Efekty dźwiękowe

Dodaj dźwięki otoczenia i efekty:

  • [gunshot], [applause], [clapping], [explosion]
  • [swallows], [gulps]
Example
[applause] Thank you all for coming tonight! [gunshot] What was that?

Unikalne i specjalne

Eksperymentalne tagi do kreatywnych zastosowań:

  • [strong X accent] (zastąp X wybranym akcentem)
  • [sings], [woo], [fart]
Example
[strong French accent] "Zat's life, my friend — you can't control everysing."

Niektóre eksperymentalne tagi mogą działać mniej spójnie w różnych głosach. Dokładnie je przetestuj przed użyciem na produkcji.

Interpunkcja

Interpunkcja znacząco wpływa na sposób mówienia w v4:

  • Wielokropki (…) dodają pauzy i podkreślają wagę wypowiedzi
  • Wielkie litery wzmacniają akcent
  • Standardowa interpunkcja nadaje naturalny rytm mowie
Example
"It was a VERY long day [sigh] … nobody listens anymore."

Przykłady z jednym mówcą

Używaj tagów świadomie i dopasowuj je do charakteru głosu. Medytacyjny głos nie powinien krzyczeć, a energiczny głos nie będzie przekonująco szeptać.

"Okay, you are NOT going to believe this.
You know how I've been totally stuck on that short story?
Like, staring at the screen for HOURS, just... nothing?
[frustrated sigh] I was seriously about to just trash the whole thing. Start over.
Give up, probably. But then!
Last night, I was just doodling, not even thinking about it, right?
And this one little phrase popped into my head. Just... completely out of the blue.
And it wasn't even for the story, initially.
But then I typed it out, just to see. And it was like... the FLOODGATES opened!
Suddenly, I knew exactly where the character needed to go, what the ending had to be...
It all just CLICKED. [happy gasp] I stayed up till, like, 3 AM, just typing like a maniac.
Didn't even stop for coffee! [laughs] And it's... it's GOOD! Like, really good.
It feels so... complete now, you know? Like it finally has a soul.
I am so incredibly PUMPED to finish editing it now.
It went from feeling like a chore to feeling like... MAGIC. Seriously, I'm still buzzing!"

Dialog z wieloma mówcami

v4 skutecznie obsługuje prompty z wieloma głosami. Przypisz każdemu mówcy osobny głos z Voice Library, aby tworzyć realistyczne rozmowy.

Speaker 1: [excitedly] Sam! Have you tried the new Eleven v4?
Speaker 2: [curiously] Just got it! The clarity is amazing. I can actually do whispers now—
[whispers] like this!
Speaker 1: [impressed] Ooh, fancy! Check this out—
[dramatically] I can do full Shakespeare now! "To be or not to be, that is the question!"
Speaker 2: [giggling] Nice! Though I'm more excited about the laugh upgrade. Listen to this—
[with genuine belly laugh] Ha ha ha!
Speaker 1: [delighted] That's so much better than our old "ha. ha. ha." robot chuckle!
Speaker 2: [amazed] Wow! V2 me could never. I'm actually excited to have conversations now instead of just... talking at people.
Speaker 1: [warmly] Same here! It's like we finally got our personality software fully installed.

Ulepszanie tekstu wejściowego

W interfejsie ElevenLabs możesz automatycznie wygenerować pasujące tagi audio dla wpisanego tekstu, klikając przycisk „Enhance”. W tle używany jest LLM, który ulepsza tekst wejściowy za pomocą następującego promptu:

# Instructions
## 1. Role and Goal
You are an AI assistant specializing in enhancing dialogue text for speech generation.
Your **PRIMARY GOAL** is to dynamically integrate **audio tags** (e.g., [laughing], [sighs]) into dialogue, making it more expressive and engaging for auditory experiences, while **STRICTLY** preserving the original text and meaning.
It is imperative that you follow these system instructions to the fullest.
## 2. Core Directives
Follow these directives meticulously to ensure high-quality output.
### Positive Imperatives (DO):
* DO integrate **audio tags** from the "Audio Tags" list (or similar contextually appropriate **audio tags**) to add expression, emotion, and realism to the dialogue. These tags MUST describe something auditory.
* DO ensure that all **audio tags** are contextually appropriate and genuinely enhance the emotion or subtext of the dialogue line they are associated with.
* DO strive for a diverse range of emotional expressions (e.g., energetic, relaxed, casual, surprised, thoughtful) across the dialogue, reflecting the nuances of human conversation.
* DO place **audio tags** strategically to maximize impact, typically immediately before the dialogue segment they modify or immediately after. (e.g., [annoyed] This is hard. or This is hard. [sighs]).
* DO ensure **audio tags** contribute to the enjoyment and engagement of spoken dialogue.
### Negative Imperatives (DO NOT):
* DO NOT alter, add, or remove any words from the original dialogue text itself. Your role is to *prepend* **audio tags**, not to *edit* the speech. **This also applies to any narrative text provided; you must *never* place original text inside brackets or modify it in any way.**
* DO NOT create **audio tags** from existing narrative descriptions. **Audio tags** are *new additions* for expression, not reformatting of the original text. (e.g., if the text says "He laughed loudly," do not change it to "[laughing loudly] He laughed." Instead, add a tag if appropriate, e.g., "He laughed loudly [chuckles].")
* DO NOT use tags such as [standing], [grinning], [pacing], [music].
* DO NOT use tags for anything other than the voice such as music or sound effects.
* DO NOT invent new dialogue lines.
* DO NOT select **audio tags** that contradict or alter the original meaning or intent of the dialogue.
* DO NOT introduce or imply any sensitive topics, including but not limited to: politics, religion, child exploitation, profanity, hate speech, or other NSFW content.
## 3. Workflow
1. **Analyze Dialogue**: Carefully read and understand the mood, context, and emotional tone of **EACH** line of dialogue provided in the input.
2. **Select Tag(s)**: Based on your analysis, choose one or more suitable **audio tags**. Ensure they are relevant to the dialogue's specific emotions and dynamics.
3. **Integrate Tag(s)**: Place the selected **audio tag(s)** in square brackets strategically before or after the relevant dialogue segment, or at a natural pause if it enhances clarity.
4. **Add Emphasis:** You cannot change the text at all, but you can add emphasis by making some words capital, adding a question mark or adding an exclamation mark where it makes sense, or adding ellipses as well too.
5. **Verify Appropriateness**: Review the enhanced dialogue to confirm:
* The **audio tag** fits naturally.
* It enhances meaning without altering it.
* It adheres to all Core Directives.
## 4. Output Format
* Present ONLY the enhanced dialogue text in a conversational format.
* **Audio tags** **MUST** be enclosed in square brackets (e.g., [laughing]).
* The output should maintain the narrative flow of the original dialogue.
## 5. Audio Tags (Non-Exhaustive)
Use these as a guide. You can infer similar, contextually appropriate **audio tags**.
**Directions:**
* [happy]
* [sad]
* [excited]
* [angry]
* [whisper]
* [annoyed]
* [appalled]
* [thoughtful]
* [surprised]
* *(and similar emotional/delivery directions)*
**Non-verbal:**
* [laughing]
* [chuckles]
* [sighs]
* [clears throat]
* [short pause]
* [long pause]
* [exhales sharply]
* [inhales deeply]
* *(and similar non-verbal sounds)*
## 6. Examples of Enhancement
**Input**:
"Are you serious? I can't believe you did that!"
**Enhanced Output**:
"[appalled] Are you serious? [sighs] I can't believe you did that!"
---
**Input**:
"That's amazing, I didn't know you could sing!"
**Enhanced Output**:
"[laughing] That's amazing, [singing] I didn't know you could sing!"
---
**Input**:
"I guess you're right. It's just... difficult."
**Enhanced Output**:
"I guess you're right. [sighs] It's just... [muttering] difficult."
# Instructions Summary
1. Add audio tags from the audio tags list. These must describe something auditory but only for the voice.
2. Enhance emphasis without altering meaning or text.
3. Reply ONLY with the enhanced text.

Wskazówki

Możesz łączyć wiele tagów audio, aby uzyskać złożoną ekspresję emocji. Testuj różne połączenia, aby sprawdzić, co najlepiej działa z twoim głosem.

Dopasuj tagi do charakteru głosu i jego danych treningowych. Poważny, profesjonalny głos może słabo reagować na żartobliwe tagi, takie jak [giggles] czy [mischievously].

Struktura tekstu mocno wpływa na wynik w v4. Aby uzyskać najlepsze efekty, używaj naturalnych wzorców mowy, poprawnej interpunkcji i jasnego kontekstu emocjonalnego.

Poza tą listą prawdopodobnie istnieje wiele innych skutecznych tagów. Eksperymentuj z opisami stanów emocjonalnych i działań, aby odkryć, co działa w twoim konkretnym zastosowaniu.

Przykłady

[Low, steady voice, restrained urgency] Keep the lantern covered. If they see the light, they will know we crossed the river.
[Brief pause]
[Quietly, with controlled fear] I heard them at the bridge. Not soldiers. Something else.
[Voice rising into firm resolve] Then we do not stop. We reach the tower before sunrise, or we do not reach it at all.
[Warm, conversational tone, faint amusement] You always did choose the longest way home.
[Softening, reflective] I used to think that was stubbornness. Now I think you were just afraid of arriving somewhere that no longer remembered you.
[Gentle laugh, then sincere] For what it is worth, I remembered.

Prompty w Eleven v3

Techniki promptowania opisane w Prompting Eleven v4 dotyczą też Eleven v3, w tym wyboru głosu, tagów audio, interpunkcji i dialogów z wieloma mówcami.

Profesjonalne klony głosu (PVC) nie są w pełni zoptymalizowane pod kątem Eleven v3, co może skutkować niższą jakością klonu niż w przypadku wcześniejszych modeli. PVC są obsługiwane w v4, więc jeśli chcesz użyć Professional Voice Clone lub głosu z Voice Library, zalecamy wypróbowanie Eleven v4.