Tryb ekspresyjny

Twórz agentów głosowych, którzy dostosowują ton, tempo i emocjonalny sposób mówienia do kontekstu rozmowy.

Omówienie

Tryb ekspresyjny pozwala agentom mówić w sposób oddający intencję, emocje i nacisk, dostosowując się w czasie rzeczywistym do brzmienia i słów użytkowników. Opiera się na dwóch ulepszeniach systemowych w stosie konwersacyjnym:

  1. Eleven v3 Conversational — najbardziej inteligentny emocjonalnie i świadomy kontekstu model Text to Speech dostępny w ElevenAgents.
  2. Nowy system zmiany tur — lepiej dopasowany czas odpowiedzi i mniej przerwań.

Tryb ekspresyjny jest włączony domyślnie po wybraniu Eleven v3 Conversational jako modelu TTS agenta.

Eleven v3 Conversational

Eleven v3 Conversational to wersja Eleven v3 o bardzo niskich opóźnieniach, zoptymalizowana pod rozmowy na żywo. Zachowuje kontekst rozmowy między turami i dostosowuje sposób mówienia do tonu oraz intencji każdej wymiany.

  • Sposób mówienia uwzględniający kontekst: Agenci dostosowują ton do kontekstu rozmowy — odpowiadają spokojniej, gdy użytkownik brzmi na zmartwionego, lub bardziej bezpośrednio, gdy ważna jest jasność.
  • Bezpośrednia kontrola emocji: Kieruj sposobem mówienia za pomocą reguł w system prompt, od precyzyjnych wyzwalaczy po szersze scenariusze, by zachować zgodność z głosem marki i wymogami compliance.
  • Obsługa ponad 70 języków: Rozszerzona z około 32 języków w modelach Flash, z lepszą ekspresją w językach, w których wcześniej brakowało niuansów, w tym japońskim.
  • Tagi ekspresyjne: LLM może generować tagi takie jak [laughs], [whispers] czy [sighs], aby kontrolować konkretne momenty wypowiedzi.

Eleven v3 Conversational kosztuje tyle samo co inne modele TTS ElevenLabs w Agents — od 0,08 USD za minutę.

System zmiany tur

Nowy system zmiany tur używa sygnałów w czasie rzeczywistym z Scribe v2 Realtime — w tym wskazówek emocjonalnych i wzorców mowy — aby określić, kiedy agent powinien mówić, zrobić pauzę lub czekać. Dzięki temu agenci odpowiadają bardziej naturalnie, szczególnie w sytuacjach pełnych emocji.

Na przykład „tak” może być pełnym potwierdzeniem albo wstępem do dalszej wypowiedzi. Analizując sposób jego wypowiedzenia (wskazówki mowy, takie jak prozodia) oraz transkrypcję, system bardziej naturalnie określa moment odpowiedzi agenta.

Zachowanie przy zmianie tur możesz dalej dostroić ustawieniem chęci zabierania głosu.

Konfiguracja

Włączanie trybu ekspresyjnego

1

Wybierz model TTS

Ustaw model TTS agenta na V3 Conversational. W tym modelu tryb ekspresyjny jest włączony domyślnie.

Otwórz agenta w panelu, przejdź do zakładki Głos agenta i wybierz V3 Conversational jako model Text to Speech. Zapisz zmiany.

Włączanie trybu ekspresyjnego

2

Wskaż emocjonalny sposób mówienia w system prompt

Dodaj instrukcje do system prompt agenta, aby określić, jak ma dostosowywać ton. Możesz użyć ogólnych wskazówek lub konkretnych wyzwalaczy.

Przykłady system promptów

Kieruj emocjonalnym sposobem mówienia agenta za pomocą instrukcji w języku naturalnym w system prompt. Model interpretuje je kontekstowo, więc nie musisz używać bezpośrednich tagów w każdej sytuacji.

Ogólne wskazówki

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Konkretne wyzwalacze

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Używanie tagów ekspresyjnych

Poza sposobem mówienia uwzględniającym kontekst LLM może generować bezpośrednie tagi do kontrolowania konkretnych momentów. Typowe tagi to:

  • [laughs] — Dodaje śmiech do wypowiedzi
  • [whispers] — Obniża głośność do szeptu
  • [sighs] — Dodaje westchnienie do wypowiedzi
  • [slow] — Spowalnia tempo mowy
  • [excited] — Dodaje emocje do wypowiedzi

Każdy tag wpływa na około następne 4–5 słów wypowiedzi, po czym sposób mówienia wraca do normy.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Dobre praktyki

Poprowadź agenta tak, aby dopasowywał emocjonalny sposób mówienia do sytuacji. Sfrustrowany klient powinien usłyszeć spokojną, empatyczną odpowiedź. Użytkownik dzielący się dobrą wiadomością powinien usłyszeć szczerą serdeczność. Niedopasowany ton podważa zaufanie.

Zdefiniuj jasne wytyczne dotyczące tonu w system prompt, zamiast polegać wyłącznie na ocenie modelu. Zapewni to spójny sposób mówienia zgodny z głosem marki i wymogami compliance.

Ekspresyjny sposób mówienia może różnić się między językami. Przetestuj agenta w każdym języku docelowym, aby upewnić się, że niuanse emocjonalne są odbierane zgodnie z zamierzeniem, zwłaszcza w językach o innych normach konwersacyjnych.

Połącz tryb ekspresyjny z odpowiednimi ustawieniami chęci zabierania głosu. Tryb cierpliwy daje użytkownikom więcej przestrzeni w emocjonalnie wrażliwych rozmowach, a tryb chętny sprawdza się w szybkich interakcjach.

Korzystaj z analityki rozmów, aby śledzić reakcje użytkowników na ekspresyjny sposób mówienia. Dopracowuj wytyczne dotyczące tonu na podstawie wyników rozmów i opinii użytkowników.

Ograniczenia

  • Eleven v3 Conversational nie zachowuje cech Professional Voice Clones (PVC) — wynik może nie brzmieć jak oryginalny głos PVC.
  • Efekty tagów ekspresyjnych trwają około 4–5 słów, po czym sposób mówienia wraca do normy.
  • Ekspresyjność może różnić się między głosami i językami.

FAQ

Nie. Eleven v3 Conversational kosztuje tyle samo co inne modele TTS ElevenLabs w Agents — od 0,08 USD za minutę.

Wybierz V3 Conversational jako model TTS agenta. W tym modelu tryb ekspresyjny jest włączony domyślnie.

System wykorzystuje sygnały w czasie rzeczywistym z Scribe v2 Realtime, w tym wskazówki emocjonalne i wzorce mowy, aby przewidzieć, kiedy agent powinien odpowiedzieć. Analizuje zarówno transkrypcję, jak i sposób wypowiedzenia słów (prozodię), aby naturalnie wybrać moment odpowiedzi.

Eleven v3 Conversational obecnie nie zachowuje dobrze cech PVC. Jeśli utrzymanie tożsamości głosu PVC jest kluczowe, rozważ użycie Flash v2.

Eleven v3 Conversational obsługuje ponad 70 języków, w porównaniu z około 32 w modelach Flash. Obejmuje to lepszą ekspresyjność w językach takich jak japoński, w których wcześniej brakowało niuansów.

Eleven v3 Conversational oferuje większy zakres emocjonalny niż Flash i Multilingual v2 oraz potrafi dostosować sposób mówienia do kontekstu rozmowy. Obsługuje ponad 70 języków w porównaniu z około 32 w Flash. Kosztuje tyle samo co inne modele.

Powiązane funkcje