Tryb ekspresyjny
Twórz agentów głosowych, którzy dostosowują ton, tempo i emocjonalny sposób mówienia do kontekstu rozmowy.
Omówienie
Tryb ekspresyjny pozwala agentom mówić w sposób oddający intencję, emocje i nacisk, dostosowując się w czasie rzeczywistym do brzmienia i słów użytkowników. Opiera się na dwóch ulepszeniach systemowych w stosie konwersacyjnym:
- Eleven v3 Conversational — najbardziej inteligentny emocjonalnie i świadomy kontekstu model Text to Speech dostępny w ElevenAgents.
- Nowy system zmiany tur — lepiej dopasowany czas odpowiedzi i mniej przerwań.
Tryb ekspresyjny jest włączony domyślnie po wybraniu Eleven v3 Conversational jako modelu TTS agenta.
Eleven v3 Conversational
Eleven v3 Conversational to wersja Eleven v3 o bardzo niskich opóźnieniach, zoptymalizowana pod rozmowy na żywo. Zachowuje kontekst rozmowy między turami i dostosowuje sposób mówienia do tonu oraz intencji każdej wymiany.
- Sposób mówienia uwzględniający kontekst: Agenci dostosowują ton do kontekstu rozmowy — odpowiadają spokojniej, gdy użytkownik brzmi na zmartwionego, lub bardziej bezpośrednio, gdy ważna jest jasność.
- Bezpośrednia kontrola emocji: Kieruj sposobem mówienia za pomocą reguł w system prompt, od precyzyjnych wyzwalaczy po szersze scenariusze, by zachować zgodność z głosem marki i wymogami compliance.
- Obsługa ponad 70 języków: Rozszerzona z około 32 języków w modelach Flash, z lepszą ekspresją w językach, w których wcześniej brakowało niuansów, w tym japońskim.
- Tagi ekspresyjne: LLM może generować tagi takie jak
[laughs],[whispers]czy[sighs], aby kontrolować konkretne momenty wypowiedzi.
Eleven v3 Conversational kosztuje tyle samo co inne modele TTS ElevenLabs w Agents — od 0,08 USD za minutę.
System zmiany tur
Nowy system zmiany tur używa sygnałów w czasie rzeczywistym z Scribe v2 Realtime — w tym wskazówek emocjonalnych i wzorców mowy — aby określić, kiedy agent powinien mówić, zrobić pauzę lub czekać. Dzięki temu agenci odpowiadają bardziej naturalnie, szczególnie w sytuacjach pełnych emocji.
Na przykład „tak” może być pełnym potwierdzeniem albo wstępem do dalszej wypowiedzi. Analizując sposób jego wypowiedzenia (wskazówki mowy, takie jak prozodia) oraz transkrypcję, system bardziej naturalnie określa moment odpowiedzi agenta.
Zachowanie przy zmianie tur możesz dalej dostroić ustawieniem chęci zabierania głosu.
Konfiguracja
Włączanie trybu ekspresyjnego
Wybierz model TTS
Ustaw model TTS agenta na V3 Conversational. W tym modelu tryb ekspresyjny jest włączony domyślnie.
Aktualizacja w panelu
Aktualizacja przez CLI
Aktualizacja przez API
Otwórz agenta w panelu, przejdź do zakładki Głos agenta i wybierz V3 Conversational jako model Text to Speech. Zapisz zmiany.

Przykłady system promptów
Kieruj emocjonalnym sposobem mówienia agenta za pomocą instrukcji w języku naturalnym w system prompt. Model interpretuje je kontekstowo, więc nie musisz używać bezpośrednich tagów w każdej sytuacji.
Ogólne wskazówki
Konkretne wyzwalacze
Używanie tagów ekspresyjnych
Poza sposobem mówienia uwzględniającym kontekst LLM może generować bezpośrednie tagi do kontrolowania konkretnych momentów. Typowe tagi to:
[laughs]— Dodaje śmiech do wypowiedzi[whispers]— Obniża głośność do szeptu[sighs]— Dodaje westchnienie do wypowiedzi[slow]— Spowalnia tempo mowy[excited]— Dodaje emocje do wypowiedzi
Każdy tag wpływa na około następne 4–5 słów wypowiedzi, po czym sposób mówienia wraca do normy.
Dobre praktyki
Dopasuj sposób mówienia do kontekstu
Poprowadź agenta tak, aby dopasowywał emocjonalny sposób mówienia do sytuacji. Sfrustrowany klient powinien usłyszeć spokojną, empatyczną odpowiedź. Użytkownik dzielący się dobrą wiadomością powinien usłyszeć szczerą serdeczność. Niedopasowany ton podważa zaufanie.
Używaj reguł system prompt dla spójności
Zdefiniuj jasne wytyczne dotyczące tonu w system prompt, zamiast polegać wyłącznie na ocenie modelu. Zapewni to spójny sposób mówienia zgodny z głosem marki i wymogami compliance.
Testuj w różnych językach
Ekspresyjny sposób mówienia może różnić się między językami. Przetestuj agenta w każdym języku docelowym, aby upewnić się, że niuanse emocjonalne są odbierane zgodnie z zamierzeniem, zwłaszcza w językach o innych normach konwersacyjnych.
Połącz z ustawieniami chęci zabierania głosu
Połącz tryb ekspresyjny z odpowiednimi ustawieniami chęci zabierania głosu. Tryb cierpliwy daje użytkownikom więcej przestrzeni w emocjonalnie wrażliwych rozmowach, a tryb chętny sprawdza się w szybkich interakcjach.
Monitoruj i ulepszaj
Korzystaj z analityki rozmów, aby śledzić reakcje użytkowników na ekspresyjny sposób mówienia. Dopracowuj wytyczne dotyczące tonu na podstawie wyników rozmów i opinii użytkowników.
Ograniczenia
- Eleven v3 Conversational nie zachowuje cech Professional Voice Clones (PVC) — wynik może nie brzmieć jak oryginalny głos PVC.
- Efekty tagów ekspresyjnych trwają około 4–5 słów, po czym sposób mówienia wraca do normy.
- Ekspresyjność może różnić się między głosami i językami.
FAQ
Czy tryb ekspresyjny kosztuje więcej?
Nie. Eleven v3 Conversational kosztuje tyle samo co inne modele TTS ElevenLabs w Agents — od 0,08 USD za minutę.
Jak włączyć tryb ekspresyjny?
Wybierz V3 Conversational jako model TTS agenta. W tym modelu tryb ekspresyjny jest włączony domyślnie.
Jak działa system zmiany tur?
System wykorzystuje sygnały w czasie rzeczywistym z Scribe v2 Realtime, w tym wskazówki emocjonalne i wzorce mowy, aby przewidzieć, kiedy agent powinien odpowiedzieć. Analizuje zarówno transkrypcję, jak i sposób wypowiedzenia słów (prozodię), aby naturalnie wybrać moment odpowiedzi.
Czy mogę użyć trybu ekspresyjnego z moim Professional Voice Clone?
Eleven v3 Conversational obecnie nie zachowuje dobrze cech PVC. Jeśli utrzymanie tożsamości głosu PVC jest kluczowe, rozważ użycie Flash v2.
Ile języków obsługuje Eleven v3 Conversational?
Eleven v3 Conversational obsługuje ponad 70 języków, w porównaniu z około 32 w modelach Flash. Obejmuje to lepszą ekspresyjność w językach takich jak japoński, w których wcześniej brakowało niuansów.
Jak wypada na tle innych modeli TTS w ElevenAgents?
Eleven v3 Conversational oferuje większy zakres emocjonalny niż Flash i Multilingual v2 oraz potrafi dostosować sposób mówienia do kontekstu rozmowy. Obsługuje ponad 70 języków w porównaniu z około 32 w Flash. Kosztuje tyle samo co inne modele.