Text to Speech

Dowiedz się, jak zamieniać tekst w naturalnie brzmiące audio mówione z ElevenLabs.

Omówienie

API ElevenLabs Text to Speech (TTS) zamienia tekst w naturalnie brzmiące audio z niuansami intonacji, tempem i emocjami. Nasze modele dostosowują się do wskazówek w tekście w 32 językach i wielu stylach głosu. Możesz ich użyć do:

  • Narracji globalnych kampanii medialnych i reklam
  • Tworzenia audiobooków w wielu językach ze złożoną ekspresją emocjonalną
  • Przesyłania audio z tekstu w czasie rzeczywistym

Posłuchaj przykładu:

Przejrzyj naszą bibliotekę głosów, aby znaleźć idealny głos do projektu.

Biblioteka głosów nie jest dostępna przez API dla użytkowników bezpłatnego planu.

Jakość głosu

W aplikacjach czasu rzeczywistego Flash v2.5 zapewnia ultraniskie opóźnienie 75 ms, a Multilingual v2 oferuje audio najwyższej jakości z bardziej niuansową ekspresją.

Opcje głosów

ElevenLabs oferuje tysiące głosów w 32 językach, tworzonych na wiele sposobów:

Dowiedz się więcej o naszych opcjach głosów.

Domyślny format odpowiedzi to mp3, ale dostępne są też inne formaty, takie jak pcm i ulaw.

  • MP3
    • Częstotliwość próbkowania: 22.05kHz - 44.1kHz
    • Przepływność: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Częstotliwość próbkowania: 16kHz - 44.1kHz
    • Przepływność: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Głębia 16-bitowa
  • μ-law
    • Częstotliwość próbkowania 8kHz
    • Zoptymalizowany do zastosowań telefonicznych
  • A-law
    • Częstotliwość próbkowania 8kHz
    • Zoptymalizowany do zastosowań telefonicznych
  • Opus
    • Częstotliwość próbkowania: 48kHz
    • Przepływność: 32kbps - 192kbps

Opcje audio o wyższej jakości są dostępne tylko w płatnych planach — szczegóły znajdziesz na stronie cen.

Obsługiwane języki

Nasze wielojęzyczne modele v2 obsługują 29 języków:

angielski (USA, Wielka Brytania, Australia, Kanada), japoński, chiński, niemiecki, hindi, francuski (Francja, Kanada), koreański, portugalski (Brazylia, Portugalia), włoski, hiszpański (Hiszpania, Meksyk), indonezyjski, niderlandzki, turecki, filipiński, polski, szwedzki, bułgarski, rumuński, arabski (Arabia Saudyjska, ZEA), czeski, grecki, fiński, chorwacki, malajski, słowacki, duński, tamilski, ukraiński i rosyjski.

Flash v2.5 obsługuje 32 języki — wszystkie języki z modeli v2 oraz:

węgierski, norweski i wietnamski

Po prostu wpisz tekst w jednym z obsługiwanych języków i wybierz pasujący głos z naszej biblioteki głosów. Aby uzyskać najbardziej naturalny efekt, wybierz głos z akcentem pasującym do docelowego języka i regionu.

Prompty

Modele odczytują kontekst emocjonalny bezpośrednio z tekstu. Na przykład dodanie opisu, takiego jak „powiedziała podekscytowana”, lub użycie wykrzykników wpłynie na emocje w mowie. Ustawienia głosu, takie jak Stabilność i Podobieństwo, pomagają zachować spójność, a bazowe emocje wynikają ze wskazówek w tekście.

Więcej informacji znajdziesz w przewodniku po promptach.

Model wypowie opisowy tekst, więc w razie potrzeby trzeba go ręcznie przyciąć lub usunąć z audio.

FAQ

Tak, możesz tworzyć błyskawiczne klony głosu własnego głosu z krótkich klipów audio. Aby uzyskać klony o wysokiej wierności, sprawdź funkcję profesjonalnego klonowania głosu.

Tak. Zachowujesz własność każdego wygenerowanego audio. Prawa do użytku komercyjnego są jednak dostępne tylko w płatnych planach. W ramach płatnej subskrypcji możesz używać wygenerowanego audio komercyjnie i zarabiać na wynikach, jeśli masz prawa własności intelektualnej do treści wejściowej.

Bezpłatna regeneracja pozwala ponownie wygenerować tę samą treść zamiany tekstu na mowę bez dodatkowych kosztów, pod warunkiem że:

  • Każdy fragment treści możesz zregenerować bezpłatnie maksymalnie 2 razy
  • Treść musi być dokładnie taka sama jak w poprzedniej generacji. Każda zmiana tekstu, ustawień głosu lub innych parametrów wymaga nowej, płatnej generacji

Bezpłatne regeneracje przydają się, gdy w audio występuje niewielkie zniekształcenie. Według wewnętrznych testów ElevenLabs regeneracje rozwiązują około połowy problemów z jakością, a pozostałe zwykle wynikają ze słabych danych treningowych.

Użyj niskoopóźnieniowych modeli Flash modeli (Flash v2 lub v2.5), zoptymalizowanych pod kątem niemal rzeczywistych scenariuszy konwersacyjnych lub interaktywnych. Więcej informacji znajdziesz w przewodniku po optymalizacji opóźnień .

Modele są niedeterministyczne. Aby uzyskać większą spójność, użyj opcjonalnego parametru seed , choć nadal mogą wystąpić drobne różnice.

Podziel długi tekst na segmenty i użyj streamingu do odtwarzania w czasie rzeczywistym oraz wydajnego przetwarzania. Aby zachować naturalną prozodię między fragmentami, dodaj parametry poprzedniego/następnego tekstu lub poprzedniego/następnego ID żądania.

Kluczowe informacje

  • Deterministyczność: Wynik jest niedeterministyczny — użyj parametru seed, aby uzyskać bardziej spójne rezultaty
  • Bezpłatne regeneracje: Do 2 bezpłatnych regeneracji na generację (tylko ta sama treść i parametry)
  • Własność: Zachowujesz własność wygenerowanego audio; użytek komercyjny wymaga płatnego planu
  • Zastosowania z niskim opóźnieniem: Użyj modeli Flash (eleven_flash_v2 lub eleven_flash_v2_5) — zobacz przewodnik po optymalizacji opóźnień
  • Długi tekst: Podziel długi tekst na segmenty; użyj parametrów previous_text / next_text, aby zachować naturalną prozodię między fragmentami