Tekst na dialog
Dowiedz się, jak tworzyć wciągające, naturalnie brzmiące dialogi z ElevenLabs.
Omówienie
API ElevenLabs Text to Dialogue tworzy naturalnie brzmiące, ekspresyjne dialogi z tekstu za pomocą Eleven v4 i Eleven v3. Polecamy Eleven v4. Popularne zastosowania to:
- Tworzenie perfekcyjnych rozmów do gier wideo
- Tworzenie wciągających dialogów do podcastów i innych treści audio
- Ożywianie audiobooków ekspresyjną narracją
Aby uzyskać pożądany efekt, może być potrzebnych kilka generacji. Integrując Text to Dialogue z aplikacją, rozważ wygenerowanie kilku wersji i pozwól użytkownikowi wybrać najlepszą.
Posłuchaj przykładu:
Opcje głosów
ElevenLabs oferuje tysiące głosów tworzonych na wiele sposobów. Eleven v4 obsługuje ponad 90 języków, a Eleven v3 — ponad 70.
- Biblioteka głosów z ponad 3000 głosów udostępnionych przez społeczność
- Profesjonalne klonowanie głosu dla replik o najwyższej wierności
- Błyskawiczne klonowanie głosu do szybkiego kopiowania głosu
- Voice Design do tworzenia własnych głosów na podstawie opisów tekstowych
Dowiedz się więcej o naszych opcjach głosów.
Prompty
Modele odczytują kontekst emocjonalny bezpośrednio z tekstu. Na przykład dodanie opisu, takiego jak „powiedziała podekscytowana”, lub użycie wykrzykników wpłynie na emocje w mowie. Ustawienia głosu, takie jak Stabilność i Podobieństwo, pomagają zachować spójność, a bazowe emocje wynikają ze wskazówek w tekście.
Więcej informacji znajdziesz w przewodniku po promptach.
Emocjonalne wykonanie z tagami audio
Eleven v4 i Eleven v3 pozwalają używać niewerbalnych zdarzeń audio, aby wpływać na sposób wypowiedzenia dialogu. Wstaw je do tekstu w nawiasach kwadratowych.
W Text to Dialogue każda kwestia ma własny tekst i głos. Dodaj tagi audio w tekście kwestii, na którą mają wpłynąć. voice_id nadal wybiera głos mówiącego dla danej kwestii, a tagi określają sposób jej wypowiedzenia.
Na przykład jeden mówiący może używać jednego głosu, gdy tekst zaczyna się od [giggling], a kolejny innego głosu, gdy tekst zaczyna się od [whispering]. Przykład API łączący tagi z voice_id znajdziesz w szybkim starcie Text to Dialogue.
Tagi audio to instrukcje w języku naturalnym, a nie parametr enum. Umieść instrukcję w nawiasach kwadratowych w miejscu tekstu, w którym sposób wypowiedzenia ma się zmienić. Poniższe przykłady nie wyczerpują możliwości; więcej wskazówek o skutecznych tagach znajdziesz w przewodniku po promptach.
Tagi audio występują w kilku formach:
Emocje i sposób wypowiedzenia
Na przykład [sad], [laughing] i [whispering]
Zdarzenia audio
Na przykład [leaves rustling], [gentle footsteps] i [applause].
Ogólny kierunek
Na przykład [football], [wrestling match] i [auctioneer].
Przykłady:
Możesz też użyć interpunkcji, by wskazać przebieg dialogu, na przykład przerwania:
Wielokropki mogą wskazywać niedokończone zdania:
Obsługiwane formaty wyjściowe
Domyślny format odpowiedzi to mp3, ale dostępne są też inne formaty, takie jak pcm i ulaw.
- MP3
- Częstotliwość próbkowania: 22.05kHz - 44.1kHz
- Przepływność: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Częstotliwość próbkowania: 16kHz - 44.1kHz
- Przepływność: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Głębia 16-bitowa
- μ-law
- Częstotliwość próbkowania 8kHz
- Zoptymalizowany do zastosowań telefonicznych
- A-law
- Częstotliwość próbkowania 8kHz
- Zoptymalizowany do zastosowań telefonicznych
- Opus
- Częstotliwość próbkowania: 48kHz
- Przepływność: 32kbps - 192kbps
Opcje audio o wyższej jakości są dostępne tylko w płatnych planach — szczegóły znajdziesz na stronie cen.
Obsługiwane języki
Eleven v4 obsługuje ponad 90 języków. Eleven v3 obsługuje ponad 70 języków. Pełne listy znajdziesz na stronach Eleven v4 i Eleven v3.
FAQ
Z których modeli mogę korzystać?
Text to Dialogue jest dostępne w modelach Eleven v4 i Eleven v3.
Czy jestem właścicielem wygenerowanego audio?
Tak. Zachowujesz własność każdego wygenerowanego audio. Prawa do użytku komercyjnego są jednak dostępne tylko w płatnych planach. W ramach płatnej subskrypcji możesz używać wygenerowanego audio komercyjnie i zarabiać na wynikach, jeśli masz prawa własności intelektualnej do treści wejściowej.
Kiedy przysługuje bezpłatna regeneracja?
Bezpłatna regeneracja pozwala ponownie wygenerować tę samą treść zamiany tekstu na mowę bez dodatkowych kosztów, pod warunkiem że:
- Jest dostępna tylko w panelu ElevenLabs.
- Każdy fragment treści możesz zregenerować bezpłatnie maksymalnie 2 razy.
- Treść musi być dokładnie taka sama jak w poprzedniej generacji. Każda zmiana tekstu, ustawień głosu lub innych parametrów wymaga nowej, płatnej generacji.
Bezpłatne regeneracje przydają się, gdy w audio występuje niewielkie zniekształcenie. Według wewnętrznych testów ElevenLabs regeneracje rozwiązują około połowy problemów z jakością, a pozostałe zwykle wynikają ze słabych danych treningowych.
Ilu mówiących może występować w dialogu?
Liczba mówiących w dialogu nie jest ograniczona.
Dlaczego wynik bywa niespójny?
Modele są niedeterministyczne. Aby uzyskać większą spójność, użyj opcjonalnego parametru seed , choć nadal mogą wystąpić drobne różnice.
Jak najlepiej konwertować duże ilości tekstu?
Aby generacja była niezawodna, utrzymuj łączną długość wszystkich wartości inputs[].text na poziomie maksymalnie 2000 znaków na żądanie. Podziel dłuższy tekst na części i połącz wynikowe audio w aplikacji.
Kluczowe informacje
- Modele: Dostępne w Eleven v4 i Eleven v3
- Mówiący: Brak limitu liczby mówiących w dialogu
- Rozmiar żądania: Łączna długość wszystkich wartości
inputs[].textnie powinna przekraczać 2000 znaków na żądanie - Deterministyczność: Wynik jest niedeterministyczny — użyj parametru
seed, aby uzyskać bardziej spójne rezultaty - Bezpłatne regeneracje: Do 2 bezpłatnych regeneracji na generację (ta sama treść, te same parametry, tylko w panelu)
- Własność: Zachowujesz własność wygenerowanego audio; użytek komercyjny wymaga płatnego planu