Expressivt läge
Bygg röststyrda agenter som anpassar ton, timing och känslomässig leverans utifrån konversationssammanhanget.
Översikt
Expressivt läge gör det möjligt för agenter att leverera tal som återspeglar avsikt, känsla och betoning, och anpassar sig i realtid efter hur användare låter och vad de säger. Det bygger på två förbättringar på systemnivå i konversationsstacken:
- Eleven v3 Conversational — den mest emotionellt intelligenta och kontextmedvetna Text to Speech-modellen som finns i ElevenAgents.
- Ett nytt turordningssystem — mer exakt tajmade svar med färre avbrott.
Expressivt läge aktiveras som standard när du väljer Eleven v3 Conversational som agentens TTS-modell.
Eleven v3 Conversational
Eleven v3 Conversational är en version av Eleven v3 med ultralåg latens, optimerad för direkta dialoger fram och tillbaka. Den behåller konversationskontext mellan turer och anpassar framförandet efter tonen och avsikten i varje utbyte.
- Kontextmedvetet framförande: Agenter anpassar tonen efter konversationskontexten — de svarar lugnare när en användare låter orolig, eller mer direkt när tydlighet är viktigt.
- Explicit känslokontroll: Styr framförandet med regler i systemprompten, från exakta utlösare till bredare scenarier, så att det passar varumärkets röst och efterlevnadskrav.
- Stöd för över 70 språk: Utökat från cirka 32 språk i Flash-modeller, med bättre uttrycksfullhet på språk där nyanser tidigare släpat efter, inklusive japanska.
- Expressiva taggar: LLM:en kan generera taggar som
[laughs],[whispers]eller[sighs]för att styra specifika delar av framförandet.
Eleven v3 Conversational har samma pris som andra ElevenLabs TTS-modeller i Agents, från 0,08 USD per minut.
Turordningssystem
Det nya turordningssystemet använder signaler i realtid från Scribe v2 Realtime — inklusive emotionella signaler och talmönster — för att avgöra när en agent ska tala, pausa eller vänta. Det hjälper agenter att svara mer naturligt, särskilt i känslomässigt laddade situationer.
Till exempel kan “yeah” vara en fullständig bekräftelse eller en inledning till att fortsätta tala. Genom att analysera hur det sades (talsignaler som prosodi) utöver transkriptionen tajmar systemet agentens svar mer naturligt.
Turordningsbeteendet kan finjusteras ytterligare med inställningen turtagningsivrighet.
Konfiguration
Aktivera expressivt läge
Välj TTS-modell
Ställ in agentens TTS-modell på V3 Conversational. Expressivt läge aktiveras som standard med den här modellen.
Uppdatera via instrumentpanelen
Uppdatera via CLI
Uppdatera via API
Öppna agenten på instrumentpanelen, gå till fliken Agent Voice och välj V3 Conversational som din Text to Speech-modell. Spara ändringarna.

Exempel på systemprompter
Styr agentens känslomässiga framförande med instruktioner på naturligt språk i systemprompten. Modellen tolkar dem kontextuellt, så explicita taggar krävs inte i varje situation.
Bred vägledning
Specifika utlösare
Använda expressiva taggar
Utöver kontextmedvetet framförande kan LLM:en generera explicita taggar för att styra specifika ögonblick. Vanliga taggar är:
[laughs]— Lägger till skratt i talet[whispers]— Sänker volymen för viskning[sighs]— Lägger till en suckande kvalitet[slow]— Saktar ner talet[excited]— Gör framförandet mer entusiastiskt
Varje tagg påverkar ungefär de nästa 4–5 orden innan talet återgår till normalt framförande.
Bästa praxis
Anpassa framförandet efter kontexten
Vägled agenten att anpassa sitt känslomässiga framförande efter situationen. En frustrerad kund bör höra ett lugnt, empatiskt svar. En användare som delar goda nyheter bör höra genuin värme. En ton som inte passar undergräver förtroendet.
Använd regler i systemprompten för konsekvens
Definiera tydliga tonriktlinjer i systemprompten i stället för att enbart förlita dig på modellens omdöme. Det säkerställer ett konsekvent framförande som stämmer överens med varumärkets röst och efterlevnadskrav.
Testa på olika språk
Expressivt framförande kan variera mellan språk. Testa agenten på varje målspråk för att säkerställa att den känslomässiga nyansen förmedlas som avsett, särskilt på språk med andra samtalsnormer.
Kombinera med inställningar för turtagningsivrighet
Kombinera expressivt läge med lämpliga inställningar för turtagningsivrighet. Tålmodigt läge ger användarna mer utrymme i känslomässigt känsliga samtal, medan ivrigt läge passar snabba interaktioner.
Övervaka och iterera
Använd konversationsanalys för att följa hur användare reagerar på expressivt framförande. Förfina tonriktlinjerna baserat på konversationsresultat och användarfeedback.
Begränsningar
- Eleven v3 Conversational bevarar inte egenskaperna hos Professional Voice Clones (PVC:er) — resultatet kanske inte låter som den ursprungliga PVC-rösten.
- Effekterna av expressiva taggar varar i ungefär 4–5 ord innan talet återgår till normalt framförande.
- Uttrycksfullheten kan variera mellan röster och språk.
Vanliga frågor
Kostar expressivt läge mer?
Nej. Eleven v3 Conversational har samma pris som andra ElevenLabs TTS-modeller i Agents, från 0,08 USD per minut.
Hur aktiverar jag expressivt läge?
Välj V3 Conversational som agentens TTS-modell. Expressivt läge aktiveras som standard med den här modellen.
Hur fungerar turordningssystemet?
Systemet använder signaler i realtid från Scribe v2 Realtime, inklusive emotionella signaler och talmönster, för att förutsäga när agenten ska svara. Det analyserar både transkriptionen och hur orden uttalades (prosodi) för att tajma svaren naturligt.
Kan jag använda expressivt läge med min Professional Voice Clone?
Eleven v3 Conversational bevarar för närvarande inte PVC-egenskaper särskilt väl. Om det är avgörande att behålla din PVC-röstidentitet bör du överväga att använda Flash v2 i stället.
Hur många språk stöder Eleven v3 Conversational?
Eleven v3 Conversational stöder över 70 språk, utökat från cirka 32 i Flash-modeller. Det inkluderar förbättrad uttrycksfullhet på språk som japanska, där nyanser tidigare släpat efter.
Hur jämförs detta med andra TTS-modeller i ElevenAgents?
Eleven v3 Conversational erbjuder ett större känslomässigt omfång än Flash och Multilingual v2, med möjlighet att anpassa framförandet efter konversationskontexten. Den stöder över 70 språk jämfört med cirka 32 för Flash. Den har samma pris som de andra modellerna.