Hoppa till innehållet

Ramverk för utvärdering av voice agents: 6 pelare förklarade

Skriven av
Jack Limebear
Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

Röstagenter behöver samordna en symfoni av verktyg som arbetar nästan samtidigt. Det är en finstämd process där kundens kommentarer spelas in med tal till text (STT) i realtid, sammanhanget tolkas och ett svar skapas med en stor språkmodell (LLM), och därefter genereras en ljudfil med text till tal-programvara (TTS).

Hur utvärderar du röstagenters prestanda korrekt när så många delar samverkar? 

I den här artikeln presenterar vi ett ramverk med sex pelare för att utvärdera röstagenter. Det beskriver exakt vad du ska mäta för att bedöma en agents framgång. Vi går också igenom varför olika branscher bör väga pelarna olika och vanliga misstag att se upp för vid utvärdering. 

Sammanfattning

  • De sex viktigaste pelarna för att utvärdera röstagenter är TTS-röstkvalitet, samtalskvalitet, verktygsanvändning och uppgiftsutförande, intelligens, regelefterlevnad och säkerhet samt tillförlitlighet.
  • De viktigaste målen för produktionsmiljöer är ett MOS på 4,3, ett TSR över 85 % och tid till första ljud under 500 ms.
  • Olika branscher väger varje pelare olika, och vissa driftsättningar prioriterar en framför de andra.
  • Vanliga testmisstag är att bara utvärdera rent ljud och att ignorera P99-toppar i latens.
  • ElevenLabs leder i de viktigaste mätvärdena: Scribe v2 har branschens lägsta WER på 2,2 % (Artificial Analysis, juni 2026), Flash v2.5 och Turbo v2.5 är toppmodeller för hastighet (Artificial Analysis, juni 2026), och ElevenAgents ger cirka 75 ms modellinferenslatens.

Vad är ett ramverk för utvärdering av röstagenter?

Ett ramverk för utvärdering av AI-röstagenter är ett strukturerat system som låter dig testa prestanda i flera dimensioner. Ett omfattande ramverk innehåller mätvärden för allt från ljudåtergivning till samtalsflöde och regelefterlevnad. 

Till skillnad från en textchattbot skickar en röstagent varje interaktion genom minst tre tekniker i följd: automatisk taligenkänning (ASR), som omvandlar användarens ord till text, en LLM som formulerar ett svar och ett TTS-system som omvandlar svaret tillbaka till ljud. Om något av systemen misslyckas försämras hela upplevelsen. 

Det är just denna komplexitet som gör att företag behöver utvärdera röstagenter innan de väljer leverantör och driftsätter. Extra latens eller oprecisa svar kan få verkliga konsekvenser, som att kunder lämnar eller, i värsta fall, böter från tillsynsmyndigheter och skadat anseende.

Ett ramverk för att utvärdera röstagenter använder benchmarking och mätbara data för att avgöra om en agent passar vissa användningsfall. För företag gör möjligheten att utvärdera olika röstmodeller att du kan välja den bästa för dina kunder. 

De sex pelarna du bör utvärdera för röstagenter

Även om att skapa och driftsätta en AI-agent aldrig har varit enklare, är processerna som pågår bakom kulisserna ganska komplexa. Flera komponenter samverkar för att lyssna på en användare, förstå vad personen vill, mata informationen till en LLM och sedan skapa ett ljudsvar – vilket innebär många nästan samtidiga aktiviteter.

Företag som vill samarbeta med bästa möjliga röstagent behöver ett rigoröst ramverk att jämföra mot.

Om du främst vill se testresultat erbjuder Artificial Analysis flera agentjämförelser baserade på olika komponenter. Nedan ser du resultatet av deras jämförelse av modellers hastighet, där ElevenLabs Turbo v2.5 och Flash v2.5 leder med god marginal i antal bearbetade tecken per sekund.

Bar chart comparing various AI models for characters per second; ElevenLabs Turbo v2.5 scores highest at 504.8.

För utvecklare eller företag som vill genomföra egna experiment kommer här de sex pelarna i ett ramverk för utvärdering av AI-agenter:

  • TTS-röstkvalitet: Hur naturligt, tydligt och uttrycksfullt det syntetiserade talet låter för slutanvändare. Ledande modeller, som Eleven v3, ger mänskligt och känslomässigt tal på över 70 språk.
  • Samtalskvalitet: Förstår modellen mänskligt tal, tolkar innebörden och svarar snabbt i sitt sammanhang över flera samtalsrundor? 
  • Verktygsanvändning: I vilken grad en AI-agent slutför uppgifter med tillgängliga resurser utan mänsklig hjälp.
  • Intelligens: Hur väl en modell resonerar, hanterar nya indata och undviker felaktiga eller hallucinerade svar.
  • Regelefterlevnad och säkerhet: Utöver alla funktioner måste AI-röstagenter följa alla regler och krav på regelefterlevnad, inklusive aktiva skyddsräcken.
  • Tillförlitlighet: Komponenter som total upptid och konsekvent prestanda under belastning avgör om en Conversational AI-agent kan skalas i takt med efterfrågan.

Varje pelare är självständig, men de samverkar för att ge användaren en högkvalitativ helhetsupplevelse. Om en modell till exempel förbättrar röstkvaliteten men fortfarande har hög latens får kunden obekväma väntetider innan modellen börjar tala.

Låt oss utforska var och en av dessa pelare för utvärdering av röst-AI närmare. 

TTS-röstkvalitet

Vi börjar med röstkvalitet, eftersom det sannolikt är det första en människa märker vid interaktion med en AI-baserad samtalsagent. Låter den robotaktig eller kuslig blir den subjektiva upplevelsen av agenten betydligt sämre.

Ett av de ursprungliga utvärderingsmåtten, definierat av International Telecommunication Union Telecommunication Standard Sector (ITU-T), är Mean Opinion Score (MOS). MOS använder en skala från 1 till 5, där 1 är oanvändbart och 5 är utmärkt. Det är ett subjektivt mått som bygger på mänskliga lyssnare och feedback efter ett samtal. 


Allt under MOS 3,5 på den här skalan är ganska svagt, särskilt med dagens mått, och kommer sannolikt att påverka kundnöjdheten. 

MOS är ett människocentrerat mått, men flera tekniska krav bidrar till resultatet:

  • Konsekvent tonhöjd och jitter: Tonhöjd och jitter är två språkliga element som människor naturligt uppfattar när de lyssnar. ”Tonhöjd” syftar på hur intonationen ändras i talet, som när du naturligt höjer rösten när du ställer en fråga. Jitter innebär att en röstmodells tolkning av tonhöjd varierar, vilket gör att den inte kan upprätthålla sammanhängande prosodi genom en mening. Branschens riktvärde för jitter är 30 ms. 
  • Känslomässig uttrycksfullhet: En röst som är tydlig och exakt låter ändå fel om tonen inte matchar meningens avsedda känsloläge. Utan korrekta tonala signaler får mänskliga lyssnare svårare att skapa kontakt med AI-samtalsagenter och betygsätter dem lägre. ElevenAgents erbjuder nästan mänsklig uttrycksfullhet så att varje svar matchas med en tydlig känslomässig avsikt.
  • Bakgrundsljud: Bakgrundsljud i röstagenter har två separata dimensioner som är värda att utvärdera. På utgångssidan läggs omgivande bakgrundsljud subtilt till i svar för att få agenter att låta mer naturliga. På ingångssidan finns bakgrundsbrusfiltrering i STT-lagret som ett valbart alternativ för bättre precision. När du utvärderar en agent ska du testa båda: lyssna efter om omgivningsljudet låter naturligt och bedöm STT-precisionen med brusfiltret på och av.

När du beräknar MOS bör du sikta på 4,3–4,5, vilket visar höga resultat inom alla dessa perceptuella kategorier. För att förutsäga MOS i stor skala utan paneler av mänskliga lyssnare kan du använda verktyg som UTMOS och NISQA.

Samtalskvalitet

Samtalskvalitet är en sammansatt pelare mellan röstkvalitet och uppgiftsutförande. Den mäter hur effektivt en röstagent förstår användarens behov, avbryter i rätt sammanhang och tar det vidare genom en dialog med flera samtalsrundor till ett avslut.

Det främsta måttet här är precisionen i avsiktsklassificering. Vanliga resultat ligger mellan 85 % och 92 %, medan toppresterande når över 96 %. Även om 85 % kan verka högt innebär det fortfarande att 15 % av all inkommande trafik kategoriseras fel och dirigeras till fel resurser. 

De tekniska elementen som bidrar till hög precision i avsiktsklassificering är:

  • Turtagning: Turtagning avgör hur väl en röstagent hanterar samtalets naturliga flöde. Den bedömer när agenten ska lyssna, svara eller vänta på mer indata. Det omfattar även hantering av avbrott, där modellen avbryter ett pågående svar och skapar ett nytt utifrån den nya informationen. ElevenLabs använder en websocket med flera kontexter för att hantera dessa smidiga avbrott utan friktion.
  • Latens: Latens beskriver fördröjningen från det att användaren avslutar sin mening tills agenten börjar ge ett ljudsvar. Röstagenter för produktionsmiljöer bör sikta på tid till första ljud under 500 ms, där under 300 ms är ännu bättre. ElevenLabs Flash-modeller erbjuder branschledande modellinferens på cirka 75 ms, vilket ger dig goda förutsättningar i denna kategori.
  • Reservfrekvens: Reservfrekvens mäter hur ofta en AI-agent inte förstår en användare och ber om ett förtydligande eller en upprepning. Det är till stor del en följd av STT-precisionen: om taligenkänningslagret hör fel eller feltolkar vad kunden sa, får LLM:en felaktiga indata. Reservfrekvens är en enkel beräkning enligt formeln: Reservfrekvens (%) = (Antal reserver / Totalt antal interaktioner) * 100.

ElevenLabs Scribe V2 har lägst WER, 2,2 %, i Artificial Analysis utvärdering av tal-till-text-modeller

ElevenLabs Scribe V2 has the lowest WER at 2.2% on the Artificial Analysis speech to text model evaluation

Artificial Analysis utvärdering av tal-till-text-modeller

Ett sätt att mäta samtalskvalitet är att titta på branschens benchmarkstandarder för olika komponenter. Som du kan se har ElevenLabs Scribe v2 den lägsta Word Error Rate på 2,2 % i juni 2026, vilket innebär färre felhörningar, färre reservsvar och mer korrekt avsiktsklassificering.

Företag kan också upptäcka att samtalskvaliteten beror på det workflow som röstagenten arbetar i. Inom kundservice kan till exempel kvaliteten på överlämning vid eskalering eller lösning av vanliga frågor vara viktiga faktorer.

Verktygsanvändning och uppgiftsutförande

Kvalitet mäter hur ett samtal upplevdes, medan uppgiftsutförande mäter om det ledde till ett lyckat resultat. Företag bör ägna den här delen av ramverket för utvärdering av röstagenter stor uppmärksamhet, eftersom den är direkt kopplad till affärsresultat.

Ett mått på verktygsanvändning är precision i fältifyllnad, som avgör hur väl AI-agenter kan slutföra rutinuppgifter, som att fylla i ett formulär med kunduppgifter. Hög precision i fältifyllnad visar att agenten kan gå smidigt från samtal till handling utan att förlora information på vägen.

Task Success Rate (TSR) är ett procentbaserat mått på hur många kompletta uppgifter som en agent slutför från början till slut. Slutförandet bygger på agentens förmåga att både förstå en begäran och sedan använda rätt anslutna verktyg – API:er, databaser, Retrieval-Augmented Generation (RAG) och interna kunskapsbaser – för att få hjälp. 

Formeln för TSR är:


TSR = (Fullständigt slutförda uppgifter / Totalt antal påbörjade uppgifter) x 100

Röstagenter som är redo för produktion bör sikta på ett TSR över 85 % och övervaka precision och tillförlitlighet för verktygsanrop. För att undvika försämringar i TSR bör du regressionstesta alla ändringar i promptar eller anslutna modeller. Även en liten avvikelse kan få stora konsekvenser för TSR.

Intelligens 

Intelligens omfattar en röstagents resonemang och mer avancerade förmågor. Det är denna pelare som tydligt skiljer en röststyrd IVR (Interactive Voice Response) från en AI-röstagent. 

Viktiga dimensioner att utvärdera här är:

  • Risk för hallucinationer: Hallucinationer, där en agent producerar information som är felaktig eller inte stämmer överens med företagets dokument, är särskilt skadliga inom röst-AI eftersom de kan framföras självsäkert. Nya studier tyder på att frekventa hallucinationer skadar kundnöjdheten med röstagenter avsevärt.
  • Hantering utanför området: Intelligenta agenter förstår när en fråga ligger utanför deras kontextuella område och kan svara på lämpligt sätt. I stället för att hallucinera ett svar avböjer de eller leder tillbaka samtalet till ett område som omfattas av sammanhanget.
  • Bibehållen kontext: Kan agenten följa entiteter och åtaganden som gjorts tidigare under flera samtalsrundor? Utan denna förmåga kan kunder behöva upprepa sig eller få motsägelsefulla svar.
  • Resonemang och logik i flera steg: Kan agenten korrekt hantera villkorslogik eller kedja slutsatser över flera samtalsrundor? Särskilt i mer tekniska användningsfall, som finansiella tjänster, är förmågan att resonera inom en fördefinierad kontext avgörande för att lyckas.

Det finns flera tredjepartsbenchmarks för dessa dimensioner och komponenter. Exempelvis mäter Stanfords benchmark Holistic Evaluation of Language Models (HELM) LLM-prestanda i olika kategorier. För hallucinationer erbjuder TruthfulQA en robust analys av hur ofta falska svar smyger sig in i svaren. 

En fördel med ElevenAgents är att du, till skillnad från vissa röstplattformar som låser dig till en enskild underliggande modell, kan byta ut LLM-lagret helt. I praktiken innebär det att du kan koppla in den modell som leder resonemangsbenchmarks för just ditt användningsfall.

Regelefterlevnad och säkerhet

Företag behöver införa aktiva skyddsräcken för att förhindra skadliga utdata eller utdata som bryter mot policyer. Till skillnad från instruktioner i systemprompten, som kan kringgås eller åsidosättas, körs oberoende kontroller av skyddsräcken som ett separat lager utanför själva modellen. De utvärderar utdata innan de når användaren och stoppar samtalet om det hamnar på farlig mark.

Revisionsbarhet är ett relaterat krav: produktionsagenter behöver föra detaljerade loggar över beslut och utdata i ett format som stödjer granskning i efterhand. Särskilt i hårt reglerade branscher är det lika viktigt att kunna visa regelefterlevnad i efterhand som att uppnå den från början.

Vilka regler ditt företag måste följa varierar mellan branscher. Några av de vanligaste regelverken är:

  • HIPAA: För skyddade hälsouppgifter i amerikanska vårdsammanhang.
  • PCI-DSS: För alla agenter som hanterar betalkortsuppgifter.
  • GDPR: Skyldigheter kring dataskydd för EU och företag med kunder i EU.

För företag som utvärderar sin regelefterlevnad har ElevenLabs AICPA SOC Type II- och GDPR-efterlevnad samt AIUC-1-certifiering. AIUC-1 är en säkerhetsstandard som utformats specifikt för AI-agenter.

Tillförlitlighet

Tillförlitlighet är den sista pelaren i vårt ramverk för utvärdering av röstagenter och omfattar om en agent konsekvent kan leverera i realtid. 

När du bedömer en röstagent bör du titta efter följande egenskaper:

  • Upptid: Alla kundinriktade driftsättningar förväntar sig 99,9 % upptid för att undvika avbrott. Tillförlitlig upptid är särskilt viktig för användningsfall som alltid är aktiva, till exempel inkommande support.
  • Kontrollerad degradering: På grund av röstagenternas underliggande komplexitet bör agenten hantera det på ett kontrollerat sätt om en komponent börjar fallera. I praktiken innebär det att samtalet kopplas till en människa, i stället för att agenten fortsätter fungera under ökad belastning eller ger fel.
  • Prestanda under belastning: Belastningstestning bör simulera minst dubbelt så hög samtidig användning som din förväntade topp innan du går live. Tester under hög belastning kan identifiera ökad latens eller sämre prestanda som bara visar sig i stor skala. 

Även en högkvalitativ modell som uppfyller alla andra krav kan vara oanvändbar om den inte skalar med kundernas efterfrågan. ElevenAgents används av 1 000 000 ledande kreatörer och företag, vilket visar plattformens förmåga att stödja driftsättning i företagsskala utan att kompromissa med prestandabenchmarks.

Så mäter du MOS för röstagenter – steg för steg

Om ditt företag vill mäta MOS manuellt behöver du en stor grupp mänskliga lyssnare och ett urval av ljudklipp från riktiga samtal. Det är en strukturerad process som omfattar att samla in feedback, beräkna medelvärden och sedan tolka data.

Så här mäter du MOS för röstagenter i praktiken:

  1. Förbered testuppsättningen: Välj ett representativt urval av ljudutdata från agenten, med minst 100 klipp från olika typer av samtal. 
  2. Genomför betygssessionen: Be dina mänskliga lyssnare att betygsätta varje klipp på en skala från 1 till 5 baserat på kommunikationsupplevelsens kvalitet. 
  3. Sammanställ betyg och beräkna resultat: Beräkna medelbetyget för varje klipp och sedan medelvärdet för alla klipp i urvalet för att få ett övergripande MOS. Ett MOS på 4,3 eller högre visar att röstagenten är redo för produktion. 

Även om processen är arbetsintensiv manuellt ger den dig ett stabilt MOS för den valda röstagenten. Om du vill köra testet i stor skala kan du ersätta mänskliga lyssnare med automatiserade verktyg som NISQA, som förutsäger MOS-resultat programmatiskt. Du kan integrera dessa system i dina aktiva pipelines för att kontinuerligt övervaka MOS över tid.

Benchmarks för testning av AI och människor: FCR, AHT och CSAT

Att beräkna MOS upprepade gånger över tid visar om modellen förbättras eller försämras, men du kan få mer sammanhang genom att jämföra med mänsklig prestanda. Genom att se vad människor faktiskt åstadkommer i liknande roller kan du avgöra om röstagenten presterar nära en idealnivå.

Här är några mått att överväga för benchmarks mellan AI och människor.

Benchmark för mänsklig agent
Lösning vid första samtalet (FCR)
70 %
Genomsnittlig handläggningstid (AHT)
~6 minuter
Kundnöjdhetspoäng (CSAT)
70–85 %
AI-mål
Lösning vid första samtalet (FCR)
75 %
Genomsnittlig handläggningstid (AHT)
2–4 minuter
Kundnöjdhetspoäng (CSAT)
85 %

AI-agenter bör kunna matcha människors FCR och CSAT samtidigt som de förbättrar AHT avsevärt. Den senare förbättringen beror på att AI-agenter vanligtvis hanterar mer generella samtal än mänskliga agenter. Många företag använder ett workflow där AI-agenter är första kontaktpunkt och bara vidarebefordrar samtal till mänskliga agenter om de är för komplexa att hantera självständigt. 

Data från 2025 från Poe, en jämförelsetjänst för AI, visar att ElevenLabs behöll den starkaste övergripande förmågan att uppfylla förfrågningar, och slutförde 74,4 % av alla inkommande förfrågningar. Framgången har lett till snabbt ökande användning, där Eleven v3 och v2.5-Turbo över tid står för över 60 % av meddelandena som skickas till AI-modeller.

Meddelanden som skickats till AI-modeller över tid, där ElevenLabs leder Poes ramverk för utvärdering av röstagenter

Messages sent to AI models over time, ElevenLabs leading the poe voice agent evaluation framework

Meddelanden som skickats till AI-modeller över tid, benchmarkade av Poe

Vanliga misstag vid testning av röstagenter

När du följer ett ramverk för utvärdering av röstagenter kan det vara lockande att testa i bästa möjliga scenarier. Men kundernas vardagliga upplevelse av dina röst-AI-system kommer inte från idealiska förhållanden. 

Här är tre vanliga misstag vid testning av röstagenter och hur du löser dem:

  • Testa den enklaste vägen: Se särskilt till att inkludera gränsfall när du väljer ljudklipp för MOS. Klipp med bakgrundsljud eller tal med accent är mycket vanliga i verkligheten, så testning enbart med ”rena” ljudfiler leder till felkalibrerat MOS.
  • Prioritera kvarhållning framför lösning: Att optimera modellerna för att hålla användare kvar i agentsystemet blåser upp kvarhållningsgraden utan att förbättra resultaten. Om FCR är låg trots en hög kvarhållningsgrad skickar agenten runt användare i en frustrerande loop. Ha rutiner som gör att användare kan prata med mänskliga agenter om de vill.
  • Ignorera latenspercentiler: SLA:er anger ofta latens på P95-nivå. Det måttet är viktigt för att ge en konsekvent upplevelse för de flesta kunder, men glöm inte att de sista 5 % också är riktiga kunder. I stor skala innebär 5 % av ett system som hanterar 10 000 samtal per dag fortfarande 500 personer som upplever ett långsamt samtal. Fokusera på P99 som det främsta SLA-målet, inte bara median eller P95.

Genom att ha detta i åtanke kan du fastställa rättvisa och representativa utgångsnivåer i stället för att utgå från idealiserade genomsnitt.

Argumentet för användningsfallsspecifika utvärderingar

De sex pelarna i ramverket ger vägledning om vilka områden du bör utforska, men hur tungt varje pelare väger beror på din bransch. Ett företag inom finansiella tjänster kan till exempel prioritera regelefterlevnad och verktygsanvändning, medan ett konsumentvarumärke kan låta TTS-röstkvalitet vara vägledande.

Här är två exempel på användningsfallsspecifika utvärderingar och hur de kan ändra balansen mellan pelarna.

Kundsupport

I vissa branscher, som kontaktcenter, är andra mått på uppgiftsutförande, exempelvis lösning vid första samtalet (FCR), en viktig del av diskussionen. Att kunna hantera ett inkommande samtal utan mänsklig hjälp minskar efterfrågan på mänskliga kundtjänstagenter avsevärt. McKinsey uppskattar att kontaktcenter som använder röstagenter kan minska interaktionsvolymen med upp till 50 %.

Även om det inte är lika viktigt som uppgiftens framgångsgrad är kvarhållningsgrad en annan dimension att överväga. Kvarhållningsgrad är ett mått som undersöker ett samtals totala längd. Om kvarhållningsgraden är mycket hög men FCR är låg håller agenterna kvar människor i samtal utan att ge kunden en lösning. I praktiken kan det innebära en frustrerande upplevelse där kunden fastnar i cirklar.

Andra mått att följa är AHT, där AI-agenter bör lösa rutinproblem snabbt. Därför skulle området kundsupport prioritera samtalskvalitet – särskilt turtagning och reservfrekvens – framför andra områden.

Hälso- och sjukvård

Hälso- och sjukvård är ett hårt reglerat område med strikta krav på regelefterlevnad som gör röstagenters drift mycket känslig. Regelefterlevnad är en central fråga och gör att säkerhetspelaren väger betydligt tyngre än övriga, tillsammans med intelligens. 

Chattbotar för hälso- och sjukvård behöver hantera tidsbokning, åtkomstvägar till distansvård, symtomtriage och försäkringsfrågor. Allt detta kräver hög intelligens och omfattande verktygsanvändning, vilket återigen visar att bransch- eller rollspecifika krav påverkar vilken pelare som är viktigast. 

Oavsett vilken bransch ditt företag arbetar i hjälper en förståelse för kärnpelarna i utvärdering av röstagenter och en balanserad tillämpning av dem dig att hitta de bästa agenterna för er.

Bygg med ElevenAgents för hög prestanda och låg latens

Plattformen du väljer att bygga på påverkar direkt hur dina röstagenter fungerar i verkliga workflows. Särskilt vid interaktion med kunder behöver du vara säker på att agenten presterar väl i varje kategori.

ElevenAgents är byggt för röstdriftsättningar i produktion och kombinerar branschledande TTS via Eleven v3, STT i realtid genom Scribe v2 och ett lager för agentorkestrering utformat för företagsskala. Varje komponent är byggd för att prestera enligt de benchmarks som beskrivs i ramverket, så att du kan ge dina kunder högkvalitativa upplevelser.

Oavsett om du utvärderar alternativen eller är redo att börja bygga har ElevenLabs en väg för dig. Utforska ElevenAgents-plattformen för att se hur den passar ditt användningsfall, eller registrera dig och börja bygga i dag.

Vanliga frågor om utvärdering av röstagenter

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet