Hoppa till innehållet

Ramverk för utvärdering av voice agents: 6 pelare förklarade

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Röstassistenter behöver samordna en symfoni av verktyg som körs nästan samtidigt. Det är ett känsligt samspel: att spela in en kunds kommentarer med tal-till-text i realtid tal-till-text (STT), ta in sammanhanget och skapa ett svar med en stor språkmodell (LLM), och sedan generera en ljudfil med text-till-tal-programvara (TTS).

Med så många rörliga delar – hur utvärderar du en röstassistents prestanda på ett korrekt sätt?

I den här artikeln presenterar vi ett ramverk med sex pelare för att utvärdera röstassistenter, som visar exakt vad du ska mäta när du bedömer en agents framgång. Vi tar också upp varför olika branscher bör väga dessa pelare olika och vilka vanliga misstag du bör undvika vid utvärderingen.

Sammanfattning

  • De sex viktigaste pelarna för att utvärdera röstassistenter är TTS-röstkvalitet, samtalskvalitet, verktygsanvändning och uppgiftsutförande, intelligens, regelefterlevnad och säkerhet samt tillförlitlighet.
  • De viktigaste produktionsmålen är ett MOS på 4,3, en TSR över 85 % och tid till första ljud på under 500 ms.
  • Olika branscher väger varje pelare på olika sätt, och vissa driftsättningar prioriterar en framför de andra.
  • Vanliga testmisstag är att bara utvärdera rent ljud och att ignorera P99-toppar i latens.
  • ElevenLabs leder inom de mått som är viktigast: Scribe v2 har branschens lägsta WER på 2,2 % (Artificial Analysis, juni 2026), Flash v2.5 och Turbo v2.5 är toppmodeller för hastighet (Artificial Analysis, juni 2026), och ElevenAgents ger cirka 75 ms modellinferenslatens.

Vad är ett ramverk för utvärdering av röstassistenter?

Ett ramverk för utvärdering av AI-röstassistenter är ett strukturerat system som låter dig testa prestanda över flera dimensioner. Ett heltäckande ramverk innehåller mått för att bedöma allt från ljudåtergivning till samtalsflöde och regelefterlevnad.

Till skillnad från en textbaserad chattbot skickar en röstassistent varje interaktion genom minst tre sammankopplade tekniker: automatisk taligenkänning (ASR), som omvandlar användarens ord till text; en LLM som sätter ihop ett svar; och ett TTS-system som omvandlar svaret tillbaka till ljud. Om något av dessa system fallerar försämras hela upplevelsen.

Just den här komplexiteten är anledningen till att företag behöver utvärdera röstassistenter innan de väljer leverantör och driftsätter dem. Extra latens eller oprecisa svar kan få verkliga följder, som kunder som lämnar eller i värsta fall böter och skadat anseende.

Ett ramverk för att utvärdera röstassistenter använder benchmarking och mätbara data för att avgöra om en agent passar för specifika användningsfall. För företag gör möjligheten att utvärdera olika röstmodeller det lättare att välja den bästa för kunderna.

De sex pelarna du bör utvärdera för röstassistenter

Även om att skapa och driftsätta en AI-agent aldrig har varit enklare, är de aktiva processerna bakom kulisserna ganska komplexa. Flera komponenter samverkar för att lyssna på användaren, förstå vad hen vill, skicka informationen till en LLM och sedan skapa ett ljudsvar – vilket innebär många nästan samtidiga aktiviteter.

Företag som vill samarbeta med bästa möjliga röstassistent behöver ett rigoröst ramverk att benchmarka mot.

Om du hellre vill se testresultat erbjuder Artificial Analysis flera jämförelser av agenter baserat på olika komponenter. Nedan ser du resultaten av deras hastighetsjämförelse mellan modeller, där ElevenLabs Turbo v2.5 och Flash v2.5 leder med god marginal i antal bearbetade tecken per sekund.

Bar chart comparing various AI models for characters per second; ElevenLabs Turbo v2.5 scores highest at 504.8.

För utvecklare eller företag som vill genomföra egna tester är det här de sex pelarna i ett utvärderingsramverk för AI-agenter som du bör använda:

  • TTS-röstkvalitet: Hur naturligt, tydligt och uttrycksfullt det syntetiserade talet låter för slutanvändarna. Ledande modeller, som Eleven v3, ger mänskligt och känslofullt tal på över 70 språk.
  • Samtalskvalitet: Förstår modellen mänskligt tal, tolkar innebörden och svarar snabbt i rätt sammanhang under flera samtalsvändor?
  • Verktygsanvändning: I vilken grad en AI-agent slutför uppgifter med tillgängliga resurser utan mänsklig hjälp.
  • Intelligens: Hur väl en modell resonerar, hanterar nya indata och undviker att ge felaktiga eller hallucinerade svar.
  • Regelefterlevnad och säkerhet: Utöver alla funktioner måste AI-röstassistenter följa alla lag- och efterlevnadskrav, inklusive aktiva skyddsräcken.
  • Tillförlitlighet: Komponenter som total drifttid och jämn prestanda under belastning avgör om en Conversational AI-agent kan skala med efterfrågan.

Även om varje pelare är självständig hänger de ihop och skapar en högkvalitativ upplevelse för användaren. Om en modell till exempel förbättrar röstkvaliteten men fortfarande har hög latens, får kunden obekväma väntetider innan modellen börjar tala.

Låt oss titta närmare på var och en av dessa pelare för utvärdering av röst-AI.

TTS-röstkvalitet

Vi börjar med röstkvalitet, eftersom det sannolikt är det första en människa lägger märke till när hen interagerar med en AI-baserad samtalsagent. Om rösten låter robotaktig eller kuslig blir den subjektiva upplevelsen betydligt sämre.

Ett av de ursprungliga utvärderingsmåtten, definierat av International Telecommunication Union Telecommunication Standard Sector (ITU-T), är Mean Opinion Score (MOS). MOS använder en skala från 1 till 5, där 1 är oanvändbart och 5 är utmärkt. Eftersom det är ett subjektivt mått används mänskliga lyssnare och deras återkoppling samlas in efter ett samtal.


Allt under MOS 3,5 på den här skalan är ganska svagt, särskilt med dagens standarder, och påverkar sannolikt kundnöjdheten.

MOS är det människocentrerade måttet, men flera tekniska krav bidrar till resultatet:

  • Jämn tonhöjd och jitter: Tonhöjd och jitter är två språkliga element som människor naturligt uppfattar när de lyssnar. Tonhöjd syftar på hur intonationen förändras i talet, till exempel när du höjer rösten när du ställer en fråga. Jitter uppstår när en röstmodells tolkning av tonhöjd varierar, så att den inte kan behålla en sammanhängande prosodi genom en mening. Branschens riktvärde för jitter är 30 ms.
  • Känslomässig uttrycksfullhet: En tydlig och exakt röst låter ändå fel om tonen inte stämmer med meningens avsedda känsloläge. Utan korrekta tonala signaler får mänskliga lyssnare sämre kontakt med AI-samtalsagenter och ger dem lägre betyg. ElevenAgents erbjuder nästan mänsklig uttrycksfullhet så att varje svar får en tydlig känslomässig avsikt.
  • Bakgrundsljud: Bakgrundsljud i röstassistenter har två olika aspekter som är värda att utvärdera. På utgångssidan läggs omgivningsljud diskret till i svaren för att agenterna ska låta mer naturliga. På ingångssidan finns bakgrundsbrusfiltrering i STT-lagret som ett valbart alternativ för bättre precision. När du utvärderar en agent bör du testa båda: lyssna efter om omgivningsljudet låter naturligt och bedöm STT-precisionen med brusfiltret på och av.

När du beräknar MOS bör du sikta på 4,3–4,5, vilket visar höga resultat inom alla dessa perceptuella kategorier. För att förutsäga MOS i stor skala utan mänskliga paneler kan du använda verktyg som UTMOS och NISQA.

Samtalskvalitet

Samtalskvalitet är en sammansatt pelare mellan röstkvalitet och uppgiftsutförande. Den mäter hur effektivt en röstassistent förstår användarens behov, avbryter i rätt sammanhang och för samtalet genom flera vändor fram till ett slutförande.

Det främsta måttet här är precision i avsiktsklassificering. Vanliga resultat ligger mellan 85 % och 92 %, medan de bästa når över 96 %. Även om 85 % kan låta högt innebär det ändå att 15 % av all inkommande trafik felklassificeras och skickas till fel resurser.

De tekniska faktorer som bidrar till hög precision i avsiktsklassificering är:

  • Turtagning: Turtagning avgör hur väl en röstassistent hanterar samtalets naturliga flöde. Den bedömer när agenten ska lyssna, svara eller vänta på mer indata. Det omfattar också hantering av avbrott, där modellen avbryter ett pågående svar och skapar ett nytt utifrån den nya inmatningen. ElevenLabs använder en websocket med flera kontexter för att smidigt hantera dessa avbrott.
  • Latens: Latens beskriver fördröjningen från att en användare avslutar sin mening till att agenten börjar sitt ljudsvar. Röstassistenter för produktion bör sikta på tid till första ljud under 500 ms, där under 300 ms är ännu bättre. ElevenLabs Flash-modeller erbjuder branschledande modellinferens på cirka 75 ms, vilket ger dig bra förutsättningar i den här kategorin.
  • Reservsvarsfrekvens: Reservsvarsfrekvens mäter hur ofta en AI-agent inte förstår en användare och ber om ett förtydligande eller en upprepning. Den är till stor del en följd av STT-precisionen: om taligenkänningslagret missuppfattar eller återger fel vad kunden sa, får LLM:en felaktig indata. Reservsvarsfrekvens beräknas enkelt med formeln: Reservsvarsfrekvens (%) = (Antal reservsvar / Totalt antal interaktioner) * 100.

ElevenLabs Scribe V2 har lägst WER, 2,2 %, i Artificial Analysis utvärdering av tal-till-text-modeller

ElevenLabs Scribe V2 has the lowest WER at 2.2% on the Artificial Analysis speech to text model evaluation

Artificial Analysis utvärdering av tal-till-text-modeller

Ett sätt att mäta samtalskvalitet är att titta på branschens benchmarkstandarder för olika komponenter. Som du kan se har ElevenLabs Scribe v2 den lägsta Word Error Rate på 2,2 % i juni 2026, vilket innebär färre feltolkningar, färre reservsvar och mer korrekt avsiktsklassificering.

Företag kan också märka att samtalskvaliteten beror på workflowet som röstassistenten arbetar i. Inom kundtjänst kan till exempel kvaliteten på överlämning vid eskalering eller lösning av vanliga frågor vara ytterligare faktorer.

Verktygsanvändning och uppgiftsutförande

Kvalitet mäter hur ett samtal upplevdes, medan uppgiftsutförande mäter om det ledde till ett lyckat resultat. Företag bör ägna stor uppmärksamhet åt den här delen av ramverket för utvärdering av röstassistenter, eftersom den är direkt kopplad till verksamhetsresultat.

Ett mått på verktygsanvändning är precision i fältifyllning, som avgör hur väl AI-agenter kan utföra relativt rutinmässiga uppgifter, till exempel att fylla i ett formulär med kundinformation. Hög precision i fältifyllning visar att agenten smidigt kan gå från samtal till handling utan att tappa information på vägen.

Task Success Rate (TSR) är ett procentbaserat mått på hur många uppgifter från början till slut som en agent slutför. Slutförandet bygger både på agentens förmåga att förstå en förfrågan och att sedan använda rätt anslutna verktyg (API:er, databaser, Retrieval-Augmented Generation (RAG) och interna kunskapsbaser) för att få hjälp.

Formeln för TSR är:


TSR = (Fullständigt slutförda uppgifter / Totalt antal påbörjade uppgifter) x 100

Produktionsklara röstassistenter bör sikta på en TSR över 85 % och övervaka precision och tillförlitlighet i verktygsanrop. För att undvika försämringar i TSR bör du regressionstesta varje ändring av promptar eller anslutna modeller. Även en liten avvikelse kan få stora konsekvenser för TSR.

Intelligens

Intelligens omfattar en röstassistents resonemang och mer avancerade förmågor. Det är den här pelaren som tydligt skiljer en röststyrd IVR (Interactive Voice Response) från en AI-röstassistent.

Viktiga dimensioner att utvärdera här är:

  • Risk för hallucinationer: Hallucinationer, där en agent ger information som är felaktig eller inte stämmer överens med företagets dokument, är särskilt skadliga inom röst-AI eftersom de kan levereras självsäkert. Nyliga studier tyder på att vanliga hallucinationer kraftigt försämrar kundnöjdheten med röstassistenter.
  • Hantering utanför området: Intelligenta agenter förstår när en fråga ligger utanför deras kontextuella område och kan svara på lämpligt sätt. I stället för att hallucinera fram ett svar avböjer de eller styr tillbaka samtalet till ett område som täcks av kontexten.
  • Kontextminne: Kan agenten följa entiteter och åtaganden som nämnts tidigare över flera samtalsvändor? Utan den förmågan kan kunder behöva upprepa sig eller få motstridiga svar.
  • Resonemang och flerstegslogik: Kan agenten hantera villkorslogik korrekt eller dra slutsatser i kedjor över flera samtalsvändor? Särskilt i mer tekniska användningsfall, som finansiella tjänster, är förmågan att resonera inom en fördefinierad kontext avgörande för framgång.

Det finns flera benchmarktester från tredje part för dessa dimensioner och komponenter. Exempelvis benchmarkar Stanfords Holistic Evaluation of Language Models (HELM) LLM-prestanda i olika kategorier. För hallucinationer erbjuder TruthfulQA en robust analys av hur ofta falska svar smyger sig in i svaren.

En fördel med ElevenAgents är att du, till skillnad från vissa röstplattformar som låser dig till en enda underliggande modell, kan byta ut LLM-lagret helt. I praktiken innebär det att du kan koppla in den modell som leder i benchmarktester för resonemang inom just ditt användningsfall.

Regelefterlevnad och säkerhet

Företag behöver införa aktiva skyddsräcken för att förhindra skadliga resultat eller resultat som bryter mot policyer. Till skillnad från instruktioner i systempromptar, som kan kringgås eller åsidosättas, körs oberoende kontroller av skyddsräcken som ett separat lager utanför själva modellen. De utvärderar resultat innan de når användaren och avbryter samtalet om det hamnar på farlig mark.

Revisionsbarhet är ett närliggande krav: produktionsagenter måste ha detaljerade loggar över beslut och resultat i ett format som möjliggör granskning i efterhand. Särskilt i hårt reglerade branscher är det lika viktigt att kunna visa regelefterlevnad i efterhand som att uppnå den från början.

Vilka regelverk ditt företag måste följa beror på branschen. Några av de vanligaste är:

  • HIPAA: För skyddade hälsodata inom amerikansk sjukvård.
  • PCI-DSS: För agenter som hanterar betalkortsuppgifter.
  • GDPR: Dataskyddsskyldigheter för EU och företag med kunder i EU.

För företag som utvärderar sin efterlevnadsnivå har ElevenLabs AICPA SOC Type II- och GDPR-efterlevnad samt AIUC-1-certifiering. AIUC-1 är en säkerhetsstandard som utformats särskilt för AI-agenter.

Tillförlitlighet

Tillförlitlighet är den sista pelaren i vårt ramverk för utvärdering av röstassistenter och omfattar om en agent konsekvent kan leverera i realtid.

När du bedömer en röstassistent bör du leta efter följande egenskaper:

  • Drifttid: Alla kundnära driftsättningar förväntar sig 99,9 % drifttid för att undvika avbrott. Tillförlitlig drifttid är särskilt viktig i användningsfall som alltid är aktiva, exempelvis inkommande support.
  • Kontrollerad degradering: På grund av röstassistenternas underliggande komplexitet bör agenten hantera degradering på ett kontrollerat sätt om en komponent börjar fallera. I praktiken innebär det att koppla vidare till en människa i stället för att fortsätta under högre belastning eller ge felmeddelanden.
  • Prestanda under belastning: Belastningstester bör simulera minst dubbelt så hög samtidighet som din förväntade topp innan du går live. Tester under hög belastning kan identifiera ökningar i latens eller försämrad prestanda som bara visar sig i stor skala.

Även en högkvalitativ modell som uppfyller alla andra krav kan vara oanvändbar om den inte kan skala med kundernas efterfrågan. ElevenAgents används av 1 000 000 ledande kreatörer och företag, vilket visar plattformens förmåga att stödja driftsättning i företagsskala utan att kompromissa med prestandabenchmarks.

Så mäter du MOS för röstassistenter steg för steg

Om ditt företag vill mäta MOS manuellt behöver du en stor grupp mänskliga lyssnare och ett urval av ljudklipp från verkliga samtal. Det är en strukturerad process där du samlar in återkoppling, beräknar genomsnitt och sedan tolkar data.

Så här mäter du MOS för röstassistenter i praktiken:

  1. Förbered testuppsättningen: Välj ett representativt urval av ljudresultat från din agent, med minst 100 klipp från olika typer av samtal.
  2. Genomför betygssessionen: Be dina mänskliga lyssnare betygsätta varje klipp på en skala från 1 till 5 utifrån kvaliteten på kommunikationsupplevelsen.
  3. Sammanställ betyg och beräkna resultat: Beräkna genomsnittsbetyget för varje klipp och sedan för samtliga klipp i urvalet för att få ett övergripande MOS. Ett MOS på 4,3 eller högre visar att din röstassistent är redo för produktion.

Även om processen kräver mycket manuellt arbete ger den ett stabilt MOS för den röstassistent du valt. Vill du köra testet i stor skala kan du ersätta mänskliga lyssnare med automatiserade verktyg som NISQA, som förutsäger MOS-resultat programmatiskt. Du kan integrera dessa system i dina aktiva pipelines för att kontinuerligt övervaka MOS över tid.

Benchmark för AI- och människotester: FCR, AHT och CSAT

Att beräkna MOS upprepade gånger över tid visar om modellen förbättras eller försämras, men du får mer sammanhang genom att benchmarka mot mänsklig prestanda. Genom att se vad människor faktiskt uppnår i liknande roller kan du avgöra om din röstassistent presterar nära en ideal nivå.

Här är några mått att överväga för benchmarktester mellan AI och människor.

Benchmark för mänskliga agenter
Lösningsgrad vid första samtalet (FCR)
70 %
Genomsnittlig handläggningstid (AHT)
~6 minuter
Kundnöjdhetspoäng (CSAT)
70–85 %
AI-mål
Lösningsgrad vid första samtalet (FCR)
75 %
Genomsnittlig handläggningstid (AHT)
2–4 minuter
Kundnöjdhetspoäng (CSAT)
85 %

AI-agenter bör kunna matcha mänsklig FCR och CSAT samtidigt som de förbättrar AHT avsevärt. Den senare förbättringen beror på att AI-agenter vanligtvis hanterar mer allmänna samtal än mänskliga agenter. Många företag använder ett workflow där AI-agenter är första kontaktpunkt och bara lämnar över samtal till mänskliga agenter när de är för komplexa för att hanteras autonomt.

Data från 2025 från Poe, en tjänst som jämför AI, visar att ElevenLabs hade den starkaste övergripande förmågan att uppfylla förfrågningar, och slutförde 74,4 % av alla inkommande förfrågningar. Framgången har lett till snabbt växande användning, där Eleven v3 och v2.5-Turbo står för över 60 % av meddelandena som skickas till AI-modeller över tid.

Meddelanden som skickats till AI-modeller över tid, där ElevenLabs leder Poes ramverk för utvärdering av röstassistenter

Messages sent to AI models over time, ElevenLabs leading the poe voice agent evaluation framework

Meddelanden som skickats till AI-modeller över tid, benchmarkade av Poe

Vanliga misstag vid testning av röstassistenter

När du följer ett ramverk för utvärdering av röstassistenter är det frestande att testa bästa möjliga scenarier. I verkligheten sker kundernas vardagliga interaktioner med dina röst-AI-system inte under perfekta förhållanden.

Här är tre vanliga misstag vid testning av röstassistenter och hur du undviker dem:

  • Testa den enklaste vägen: Se särskilt till att inkludera gränsfall när du väljer ljudklipp för MOS. Klipp med bakgrundsljud eller tal med accent är mycket vanliga i verkligheten, så tester enbart med ”rena” ljudfiler leder till felkalibrerade MOS-resultat.
  • Prioritera inneslutning framför lösning: Att optimera modellerna för att hålla kvar användare i agentsystemet höjer inneslutningsgraden utan att förbättra resultaten. Om din FCR är låg trots en hög inneslutningsgrad skickar agenten användarna runt i en frustrerande loop. Ha rutiner som låter användare prata med mänskliga agenter om de vill.
  • Ignorera latenspercentiler: SLA:er anger ofta latens på P95-nivå. Måttet är viktigt för att ge en konsekvent upplevelse för majoriteten av dina kunder, men glöm inte att de sista 5 % också är riktiga kunder. I stor skala innebär 5 % av ett system som hanterar 10 000 dagliga samtal fortfarande 500 personer som upplever ett långsamt samtal. Fokusera på P99 som ditt främsta SLA-mål, inte bara medianen eller P95.

Med detta i åtanke kan du skapa rättvisa och representativa baslinjer i stället för att utgå från idealiserade genomsnitt.

Varför utvärderingar bör anpassas efter användningsfall

De sex pelarna i det här ramverket visar vilka områden du bör undersöka, men hur tungt varje pelare väger beror på din bransch. Ett företag inom finansiella tjänster kan till exempel prioritera regelefterlevnad och verktygsanvändning, medan ett konsumentvarumärke kan låta TTS-röstkvalitet styra.

Här är två exempel på användningsfallsspecifika utvärderingar och hur de kan förändra balansen mellan pelarna.

Kundtjänst

I vissa branscher, exempelvis callcenter, är andra mått på uppgiftsutförande som lösningsgrad vid första samtalet (FCR) en viktig del av bedömningen. Att kunna hantera ett inkommande samtal utan mänsklig hjälp minskar belastningen på mänskliga kundtjänstmedarbetare avsevärt. McKinsey uppskattar att callcenter som använder röstassistenter kan minska interaktionsvolymen med upp till 50 %.

Även om den inte är lika viktig som graden av lyckade uppgifter är inneslutningsgrad en annan dimension att ta hänsyn till. Inneslutningsgrad är ett mått som undersöker ett samtals totala längd. Om din inneslutningsgrad är mycket hög men FCR är låg håller dina agenter kvar människor i samtalet utan att lösa kundens problem. I praktiken kan det innebära en frustrerande upplevelse där kunden bara går runt i cirklar.

Andra mått att följa är AHT, där AI-agenter ska lösa rutinproblem snabbt. Därför bör kundtjänst prioritera samtalskvalitet, särskilt turtagning och reservsvarsfrekvens, framför andra områden.

Sjukvård

Sjukvård är ett hårt reglerat område med strikta efterlevnadskrav som gör drift av röstassistenter särskilt känslig. Regelefterlevnad är centralt, vilket innebär att säkerhetspelaren i ramverket väger betydligt tyngre, tillsammans med intelligens, än övriga pelare.

Chattbotar för sjukvården måste kunna hantera tidsbokning, vägar till distansvård, symtomtriage och försäkringsfrågor. Allt detta kräver hög intelligens och effektiv verktygsanvändning, vilket återigen visar hur krav som är specifika för bransch eller roll påverkar vilken pelare som är viktigast.

Oavsett vilken bransch ditt företag verkar i hjälper en förståelse för de centrala pelarna i utvärdering av röstassistenter – och en balanserad tillämpning av dem – dig att hitta de bästa agenterna för dina behov.

Bygg med ElevenAgents för hög prestanda och låg latens

Plattformen du väljer att bygga på påverkar direkt hur dina röstassistenter fungerar i verkliga workflows. Särskilt när de interagerar med dina kunder behöver du känna dig trygg med att agenten presterar i varje kategori.

ElevenAgents är byggt för röstdriftsättningar i produktion och kombinerar branschledande TTS via Eleven v3, STT i realtid genom Scribe v2 och ett orkestreringslager för agenter som utformats för företagsskala. Varje komponent är byggd för att prestera enligt benchmarkerna i det här ramverket, så att du kan ge dina kunder upplevelser av hög kvalitet.

Oavsett om du utvärderar alternativen eller är redo att börja bygga har ElevenLabs en väg för dig. Utforska ElevenAgents-plattformen för att se hur den passar ditt användningsfall, eller registrera dig och börja bygga i dag.

Vanliga frågor om utvärdering av röstassistenter

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet