Text to Speech
Dowiedz się, jak zamieniać tekst w naturalnie brzmiące audio mówione z ElevenLabs.
Omówienie
API ElevenLabs Text to Speech (TTS) zamienia tekst w naturalnie brzmiące audio z niuansami intonacji, tempem i emocjami. Nasze modele dostosowują się do wskazówek w tekście w 32 językach i wielu stylach głosu. Możesz ich użyć do:
- Narracji globalnych kampanii medialnych i reklam
- Tworzenia audiobooków w wielu językach ze złożoną ekspresją emocjonalną
- Przesyłania audio z tekstu w czasie rzeczywistym
Posłuchaj przykładu:
Przejrzyj naszą bibliotekę głosów, aby znaleźć idealny głos do projektu.
Jakość głosu
W aplikacjach czasu rzeczywistego Flash v2.5 zapewnia ultraniskie opóźnienie 75 ms, a Multilingual v2 oferuje audio najwyższej jakości z bardziej niuansową ekspresją.
Opcje głosów
ElevenLabs oferuje tysiące głosów w 32 językach, tworzonych na wiele sposobów:
- Biblioteka głosów z ponad 3000 głosów udostępnionych przez społeczność
- Profesjonalne klonowanie głosu dla replik o najwyższej wierności
- Błyskawiczne klonowanie głosu do szybkiego kopiowania głosu
- Voice Design do tworzenia własnych głosów na podstawie opisów tekstowych
Dowiedz się więcej o naszych opcjach głosów.
Obsługiwane formaty wyjściowe
Domyślny format odpowiedzi to mp3, ale dostępne są też inne formaty, takie jak pcm i ulaw.
- MP3
- Częstotliwość próbkowania: 22.05kHz - 44.1kHz
- Przepływność: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Częstotliwość próbkowania: 16kHz - 44.1kHz
- Przepływność: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Głębia 16-bitowa
- μ-law
- Częstotliwość próbkowania 8kHz
- Zoptymalizowany do zastosowań telefonicznych
- A-law
- Częstotliwość próbkowania 8kHz
- Zoptymalizowany do zastosowań telefonicznych
- Opus
- Częstotliwość próbkowania: 48kHz
- Przepływność: 32kbps - 192kbps
Opcje audio o wyższej jakości są dostępne tylko w płatnych planach — szczegóły znajdziesz na stronie cen.
Obsługiwane języki
Nasze wielojęzyczne modele v2 obsługują 29 języków:
angielski (USA, Wielka Brytania, Australia, Kanada), japoński, chiński, niemiecki, hindi, francuski (Francja, Kanada), koreański, portugalski (Brazylia, Portugalia), włoski, hiszpański (Hiszpania, Meksyk), indonezyjski, niderlandzki, turecki, filipiński, polski, szwedzki, bułgarski, rumuński, arabski (Arabia Saudyjska, ZEA), czeski, grecki, fiński, chorwacki, malajski, słowacki, duński, tamilski, ukraiński i rosyjski.
Flash v2.5 obsługuje 32 języki — wszystkie języki z modeli v2 oraz:
węgierski, norweski i wietnamski
Po prostu wpisz tekst w jednym z obsługiwanych języków i wybierz pasujący głos z naszej biblioteki głosów. Aby uzyskać najbardziej naturalny efekt, wybierz głos z akcentem pasującym do docelowego języka i regionu.
Prompty
Modele odczytują kontekst emocjonalny bezpośrednio z tekstu. Na przykład dodanie opisu, takiego jak „powiedziała podekscytowana”, lub użycie wykrzykników wpłynie na emocje w mowie. Ustawienia głosu, takie jak Stabilność i Podobieństwo, pomagają zachować spójność, a bazowe emocje wynikają ze wskazówek w tekście.
Więcej informacji znajdziesz w przewodniku po promptach.
Model wypowie opisowy tekst, więc w razie potrzeby trzeba go ręcznie przyciąć lub usunąć z audio.
FAQ
Czy mogę sklonować własny głos?
Tak, możesz tworzyć błyskawiczne klony głosu własnego głosu z krótkich klipów audio. Aby uzyskać klony o wysokiej wierności, sprawdź funkcję profesjonalnego klonowania głosu.
Czy jestem właścicielem wygenerowanego audio?
Tak. Zachowujesz własność każdego wygenerowanego audio. Prawa do użytku komercyjnego są jednak dostępne tylko w płatnych planach. W ramach płatnej subskrypcji możesz używać wygenerowanego audio komercyjnie i zarabiać na wynikach, jeśli masz prawa własności intelektualnej do treści wejściowej.
Kiedy przysługuje bezpłatna regeneracja?
Bezpłatna regeneracja pozwala ponownie wygenerować tę samą treść zamiany tekstu na mowę bez dodatkowych kosztów, pod warunkiem że:
- Każdy fragment treści możesz zregenerować bezpłatnie maksymalnie 2 razy
- Treść musi być dokładnie taka sama jak w poprzedniej generacji. Każda zmiana tekstu, ustawień głosu lub innych parametrów wymaga nowej, płatnej generacji
Bezpłatne regeneracje przydają się, gdy w audio występuje niewielkie zniekształcenie. Według wewnętrznych testów ElevenLabs regeneracje rozwiązują około połowy problemów z jakością, a pozostałe zwykle wynikają ze słabych danych treningowych.
Jak zmniejszyć opóźnienie w zastosowaniach czasu rzeczywistego?
Użyj niskoopóźnieniowych modeli Flash modeli (Flash v2 lub v2.5), zoptymalizowanych pod kątem niemal rzeczywistych scenariuszy konwersacyjnych lub interaktywnych. Więcej informacji znajdziesz w przewodniku po optymalizacji opóźnień .
Dlaczego wynik bywa niespójny?
Modele są niedeterministyczne. Aby uzyskać większą spójność, użyj opcjonalnego parametru seed , choć nadal mogą wystąpić drobne różnice.
Jak najlepiej konwertować duże ilości tekstu?
Podziel długi tekst na segmenty i użyj streamingu do odtwarzania w czasie rzeczywistym oraz wydajnego przetwarzania. Aby zachować naturalną prozodię między fragmentami, dodaj parametry poprzedniego/następnego tekstu lub poprzedniego/następnego ID żądania.
Kluczowe informacje
- Deterministyczność: Wynik jest niedeterministyczny — użyj parametru
seed, aby uzyskać bardziej spójne rezultaty - Bezpłatne regeneracje: Do 2 bezpłatnych regeneracji na generację (tylko ta sama treść i parametry)
- Własność: Zachowujesz własność wygenerowanego audio; użytek komercyjny wymaga płatnego planu
- Zastosowania z niskim opóźnieniem: Użyj modeli Flash (
eleven_flash_v2lubeleven_flash_v2_5) — zobacz przewodnik po optymalizacji opóźnień - Długi tekst: Podziel długi tekst na segmenty; użyj parametrów
previous_text/next_text, aby zachować naturalną prozodię między fragmentami