Tekst na dialog

Dowiedz się, jak tworzyć wciągające, naturalnie brzmiące dialogi z ElevenLabs.

Omówienie

API ElevenLabs Text to Dialogue tworzy naturalnie brzmiące, ekspresyjne dialogi z tekstu za pomocą Eleven v4 i Eleven v3. Polecamy Eleven v4. Popularne zastosowania to:

  • Tworzenie perfekcyjnych rozmów do gier wideo
  • Tworzenie wciągających dialogów do podcastów i innych treści audio
  • Ożywianie audiobooków ekspresyjną narracją

Aby uzyskać pożądany efekt, może być potrzebnych kilka generacji. Integrując Text to Dialogue z aplikacją, rozważ wygenerowanie kilku wersji i pozwól użytkownikowi wybrać najlepszą.

Posłuchaj przykładu:

Opcje głosów

ElevenLabs oferuje tysiące głosów tworzonych na wiele sposobów. Eleven v4 obsługuje ponad 90 języków, a Eleven v3 — ponad 70.

Dowiedz się więcej o naszych opcjach głosów.

Prompty

Modele odczytują kontekst emocjonalny bezpośrednio z tekstu. Na przykład dodanie opisu, takiego jak „powiedziała podekscytowana”, lub użycie wykrzykników wpłynie na emocje w mowie. Ustawienia głosu, takie jak Stabilność i Podobieństwo, pomagają zachować spójność, a bazowe emocje wynikają ze wskazówek w tekście.

Więcej informacji znajdziesz w przewodniku po promptach.

Emocjonalne wykonanie z tagami audio

Ta funkcja jest nadal aktywnie rozwijana, więc wyniki mogą się różnić.

Eleven v4 i Eleven v3 pozwalają używać niewerbalnych zdarzeń audio, aby wpływać na sposób wypowiedzenia dialogu. Wstaw je do tekstu w nawiasach kwadratowych.

W Text to Dialogue każda kwestia ma własny tekst i głos. Dodaj tagi audio w tekście kwestii, na którą mają wpłynąć. voice_id nadal wybiera głos mówiącego dla danej kwestii, a tagi określają sposób jej wypowiedzenia.

Na przykład jeden mówiący może używać jednego głosu, gdy tekst zaczyna się od [giggling], a kolejny innego głosu, gdy tekst zaczyna się od [whispering]. Przykład API łączący tagi z voice_id znajdziesz w szybkim starcie Text to Dialogue.

Tagi audio to instrukcje w języku naturalnym, a nie parametr enum. Umieść instrukcję w nawiasach kwadratowych w miejscu tekstu, w którym sposób wypowiedzenia ma się zmienić. Poniższe przykłady nie wyczerpują możliwości; więcej wskazówek o skutecznych tagach znajdziesz w przewodniku po promptach.

Tagi audio występują w kilku formach:

Emocje i sposób wypowiedzenia

Na przykład [sad], [laughing] i [whispering]

Zdarzenia audio

Na przykład [leaves rustling], [gentle footsteps] i [applause].

Ogólny kierunek

Na przykład [football], [wrestling match] i [auctioneer].

Przykłady:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

Możesz też użyć interpunkcji, by wskazać przebieg dialogu, na przykład przerwania:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Wielokropki mogą wskazywać niedokończone zdania:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

Domyślny format odpowiedzi to mp3, ale dostępne są też inne formaty, takie jak pcm i ulaw.

  • MP3
    • Częstotliwość próbkowania: 22.05kHz - 44.1kHz
    • Przepływność: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Częstotliwość próbkowania: 16kHz - 44.1kHz
    • Przepływność: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Głębia 16-bitowa
  • μ-law
    • Częstotliwość próbkowania 8kHz
    • Zoptymalizowany do zastosowań telefonicznych
  • A-law
    • Częstotliwość próbkowania 8kHz
    • Zoptymalizowany do zastosowań telefonicznych
  • Opus
    • Częstotliwość próbkowania: 48kHz
    • Przepływność: 32kbps - 192kbps

Opcje audio o wyższej jakości są dostępne tylko w płatnych planach — szczegóły znajdziesz na stronie cen.

Obsługiwane języki

Eleven v4 obsługuje ponad 90 języków. Eleven v3 obsługuje ponad 70 języków. Pełne listy znajdziesz na stronach Eleven v4 i Eleven v3.

FAQ

Text to Dialogue jest dostępne w modelach Eleven v4 i Eleven v3.

Tak. Zachowujesz własność każdego wygenerowanego audio. Prawa do użytku komercyjnego są jednak dostępne tylko w płatnych planach. W ramach płatnej subskrypcji możesz używać wygenerowanego audio komercyjnie i zarabiać na wynikach, jeśli masz prawa własności intelektualnej do treści wejściowej.

Bezpłatna regeneracja pozwala ponownie wygenerować tę samą treść zamiany tekstu na mowę bez dodatkowych kosztów, pod warunkiem że:

  • Jest dostępna tylko w panelu ElevenLabs.
  • Każdy fragment treści możesz zregenerować bezpłatnie maksymalnie 2 razy.
  • Treść musi być dokładnie taka sama jak w poprzedniej generacji. Każda zmiana tekstu, ustawień głosu lub innych parametrów wymaga nowej, płatnej generacji.

Bezpłatne regeneracje przydają się, gdy w audio występuje niewielkie zniekształcenie. Według wewnętrznych testów ElevenLabs regeneracje rozwiązują około połowy problemów z jakością, a pozostałe zwykle wynikają ze słabych danych treningowych.

Liczba mówiących w dialogu nie jest ograniczona.

Modele są niedeterministyczne. Aby uzyskać większą spójność, użyj opcjonalnego parametru seed , choć nadal mogą wystąpić drobne różnice.

Aby generacja była niezawodna, utrzymuj łączną długość wszystkich wartości inputs[].text na poziomie maksymalnie 2000 znaków na żądanie. Podziel dłuższy tekst na części i połącz wynikowe audio w aplikacji.

Kluczowe informacje

  • Modele: Dostępne w Eleven v4 i Eleven v3
  • Mówiący: Brak limitu liczby mówiących w dialogu
  • Rozmiar żądania: Łączna długość wszystkich wartości inputs[].text nie powinna przekraczać 2000 znaków na żądanie
  • Deterministyczność: Wynik jest niedeterministyczny — użyj parametru seed, aby uzyskać bardziej spójne rezultaty
  • Bezpłatne regeneracje: Do 2 bezpłatnych regeneracji na generację (ta sama treść, te same parametry, tylko w panelu)
  • Własność: Zachowujesz własność wygenerowanego audio; użytek komercyjny wymaga płatnego planu