Hoppa till navigering

Expressivt läge

Bygg röststyrda agenter som anpassar ton, timing och känslomässig leverans utifrån konversationssammanhanget.

Översikt

Expressivt läge gör det möjligt för agenter att leverera tal som återspeglar avsikt, känsla och betoning, och anpassar sig i realtid efter hur användare låter och vad de säger. Det bygger på två förbättringar på systemnivå i konversationsstacken:

  1. Eleven v3 Conversational — den mest emotionellt intelligenta och kontextmedvetna Text to Speech-modellen som finns i ElevenAgents.
  2. Ett nytt turordningssystem — mer exakt tajmade svar med färre avbrott.

Expressivt läge aktiveras som standard när du väljer Eleven v3 Conversational som agentens TTS-modell.

Eleven v3 Conversational

Eleven v3 Conversational är en version av Eleven v3 med ultralåg latens, optimerad för direkta dialoger fram och tillbaka. Den behåller konversationskontext mellan turer och anpassar framförandet efter tonen och avsikten i varje utbyte.

  • Kontextmedvetet framförande: Agenter anpassar tonen efter konversationskontexten — de svarar lugnare när en användare låter orolig, eller mer direkt när tydlighet är viktigt.
  • Explicit känslokontroll: Styr framförandet med regler i systemprompten, från exakta utlösare till bredare scenarier, så att det passar varumärkets röst och efterlevnadskrav.
  • Stöd för över 70 språk: Utökat från cirka 32 språk i Flash-modeller, med bättre uttrycksfullhet på språk där nyanser tidigare släpat efter, inklusive japanska.
  • Expressiva taggar: LLM:en kan generera taggar som [laughs], [whispers] eller [sighs] för att styra specifika delar av framförandet.

Eleven v3 Conversational har samma pris som andra ElevenLabs TTS-modeller i Agents, från 0,08 USD per minut.

Turordningssystem

Det nya turordningssystemet använder signaler i realtid från Scribe v2 Realtime — inklusive emotionella signaler och talmönster — för att avgöra när en agent ska tala, pausa eller vänta. Det hjälper agenter att svara mer naturligt, särskilt i känslomässigt laddade situationer.

Till exempel kan “yeah” vara en fullständig bekräftelse eller en inledning till att fortsätta tala. Genom att analysera hur det sades (talsignaler som prosodi) utöver transkriptionen tajmar systemet agentens svar mer naturligt.

Turordningsbeteendet kan finjusteras ytterligare med inställningen turtagningsivrighet.

Konfiguration

Aktivera expressivt läge

1

Välj TTS-modell

Ställ in agentens TTS-modell på V3 Conversational. Expressivt läge aktiveras som standard med den här modellen.

Öppna agenten på instrumentpanelen, gå till fliken Agent Voice och välj V3 Conversational som din Text to Speech-modell. Spara ändringarna.

Aktivera expressivt läge

2

Styr känslomässigt framförande i systemprompten

Lägg till instruktioner i agentens systemprompt för att styra hur agenten anpassar sin ton. Du kan använda bred vägledning eller specifika utlösare.

Exempel på systemprompter

Styr agentens känslomässiga framförande med instruktioner på naturligt språk i systemprompten. Modellen tolkar dem kontextuellt, så explicita taggar krävs inte i varje situation.

Bred vägledning

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Specifika utlösare

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Använda expressiva taggar

Utöver kontextmedvetet framförande kan LLM:en generera explicita taggar för att styra specifika ögonblick. Vanliga taggar är:

  • [laughs] — Lägger till skratt i talet
  • [whispers] — Sänker volymen för viskning
  • [sighs] — Lägger till en suckande kvalitet
  • [slow] — Saktar ner talet
  • [excited] — Gör framförandet mer entusiastiskt

Varje tagg påverkar ungefär de nästa 4–5 orden innan talet återgår till normalt framförande.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Bästa praxis

Vägled agenten att anpassa sitt känslomässiga framförande efter situationen. En frustrerad kund bör höra ett lugnt, empatiskt svar. En användare som delar goda nyheter bör höra genuin värme. En ton som inte passar undergräver förtroendet.

Definiera tydliga tonriktlinjer i systemprompten i stället för att enbart förlita dig på modellens omdöme. Det säkerställer ett konsekvent framförande som stämmer överens med varumärkets röst och efterlevnadskrav.

Expressivt framförande kan variera mellan språk. Testa agenten på varje målspråk för att säkerställa att den känslomässiga nyansen förmedlas som avsett, särskilt på språk med andra samtalsnormer.

Kombinera expressivt läge med lämpliga inställningar för turtagningsivrighet. Tålmodigt läge ger användarna mer utrymme i känslomässigt känsliga samtal, medan ivrigt läge passar snabba interaktioner.

Använd konversationsanalys för att följa hur användare reagerar på expressivt framförande. Förfina tonriktlinjerna baserat på konversationsresultat och användarfeedback.

Begränsningar

  • Eleven v3 Conversational bevarar inte egenskaperna hos Professional Voice Clones (PVC:er) — resultatet kanske inte låter som den ursprungliga PVC-rösten.
  • Effekterna av expressiva taggar varar i ungefär 4–5 ord innan talet återgår till normalt framförande.
  • Uttrycksfullheten kan variera mellan röster och språk.

Vanliga frågor

Nej. Eleven v3 Conversational har samma pris som andra ElevenLabs TTS-modeller i Agents, från 0,08 USD per minut.

Välj V3 Conversational som agentens TTS-modell. Expressivt läge aktiveras som standard med den här modellen.

Systemet använder signaler i realtid från Scribe v2 Realtime, inklusive emotionella signaler och talmönster, för att förutsäga när agenten ska svara. Det analyserar både transkriptionen och hur orden uttalades (prosodi) för att tajma svaren naturligt.

Eleven v3 Conversational bevarar för närvarande inte PVC-egenskaper särskilt väl. Om det är avgörande att behålla din PVC-röstidentitet bör du överväga att använda Flash v2 i stället.

Eleven v3 Conversational stöder över 70 språk, utökat från cirka 32 i Flash-modeller. Det inkluderar förbättrad uttrycksfullhet på språk som japanska, där nyanser tidigare släpat efter.

Eleven v3 Conversational erbjuder ett större känslomässigt omfång än Flash och Multilingual v2, med möjlighet att anpassa framförandet efter konversationskontexten. Den stöder över 70 språk jämfört med cirka 32 för Flash. Den har samma pris som de andra modellerna.

Relaterade funktioner