Hoppa till innehållet

Apna skalar 7,5 miljoner AI-intervjumöten med ElevenLabs

Publicerad

LyssnaLyssna på den här artikeln

Intervjuförberedelser i Indien har länge varit bristfälliga – generiska, osammanhängande och otillgängliga för de flesta arbetssökande.

Apna, Indiens ledande plattform för jobbsökning och karriär, ville ändra på det genom att få varje övningsintervju att kännas som en riktig intervju – anpassad efter varje roll, företag och kandidat.

Med över 60 miljoner användare och fler än 10 000 företag inom över 30 000 roller krävde Apnas vision mer än utbildningsmoduler. Den krävde samtal – verklighetstrogen tajming, empati och djup branschkunskap – i enorm skala.

För att uppnå detta utvecklade Apna ett av de mest avancerade ekosystemen för AI-intervjuer, drivet av ElevenLabs Text to Speech och Blue Machines röstorkestreringsplattform. Tillsammans har systemen genomfört över 1,5 miljoner AI-intervjuer, totalt 7,5 miljoner röstminuter, med en latens på under 300 ms.

Därför valde Apna ElevenLabs

För att intervjusimuleringar ska kännas naturliga går röstkvalitet och snabb respons hand i hand. Varje hörbar fördröjning eller robotliknande ton bryter inlevelsen och förtroendet.

Apna valde ElevenLabs av tre huvudsakliga skäl:

  • Streaming med låg latens – uppspelningen av svar börjar inom 150–180 ms.
  • Flerspråkighet – sömlös talsyntes på indisk engelska, hindi och språkblandat tal.
  • Känslomässiga nyanser – tonmodulering som återspeglar mänsklig empati och utmanar kandidaten.

Dessa egenskaper gör att Apna kan bevara rytmen i verkliga samtal och samtidigt behålla känslomässig trovärdighet i stor skala.

Att orkestrera mänsklig realism i realtid i stor skala 

För att möjliggöra dessa verklighetstrogna intervjuer behövde Apna lösa en komplex orkestreringsutmaning. Att genomföra en övningsintervju som känns verklig kräver mer än manusstyrd dialog; det kräver synkroniserad precision i röst, latens, empati och kontext – allt i samspel i maskinhastighet.

Alla företag intervjuar på olika sätt. En produktchefsroll kan testas i resonemang kring nyckeltal, en kreditrådgivare på bank i regelefterlevnad och en ansvarig för en e-handelsplattform i ruttoptimering.

Bakom kulisserna byggde Apnas orkestreringsplattform, Blue Machines, en graf för Retrieval-Augmented Generation (RAG) för varje skärningspunkt mellan roll och företag: 

● Fler än 10 000 företag × 50–100 roller = cirka 500 miljoner mikromodeller. 
● Varje modell är förankrad i företagsspecifika bedömningskriterier, ton och vokabulär.

De integrerade ElevenLabs strömmande Text to Speech direkt i sitt konversationsflöde. Varje tur börjar med kandidatens tal, som bearbetas av flerspråkiga ASR- och NLU-modeller. Workflow-logiken utvärderar sedan avsikt, känsla och kontext, hämtar de mest relevanta branschdata, formulerar nästa fråga och spelar upp den via ElevenLabs – allt på ungefär 300 millisekunder från början till slut.

”Uppspelningen av varje syntetiserat svar börjar inom cirka 150–180 ms, tack vare ElevenLabs API:er med låg latens som är direkt integrerade i Apnas och Blue Machines orkestreringslager”, säger Abhishek Ranjan, CTO på Apna.

Vid omkring 300 ms uppfattar den mänskliga hjärnan tal som sammanhängande snarare än fördröjt – gränsen där verklighetskänslan verkligen börjar. 

Funktion
Inmatning vid nätverkets kant
Regionala gateways + smart dirigering
ASR + NLU
Strömmande flerspråkig igenkänning
Workflow-logik + persona
Rollogik + empatimodulering
Kontexthämtning + utvärdering
Hämtning + validering av branschdata
TTS-uppspelning
Start av ElevenLabs röstsyntes
Totalt
Tid (ms)
Inmatning vid nätverkets kant
30
ASR + NLU
90
Workflow-logik + persona
40
Kontexthämtning + utvärdering
40
TTS-uppspelning
100
Totalt
≈300 ms

Resultatet är ett system som balanserar teknisk precision med känslomässigt djup. Tusentals intervjuer genomförs samtidigt på indisk engelska, hindi och språkblandat tal, och var och en behåller rytmen, empatin och trovärdigheten i ett verkligt mänskligt samtal.

Effekt i stor skala

Resultat
Genomförda AI-övningsintervjuer
1,5 miljoner+
Röstminuter
7,5 miljoner+
Genomsnittlig latens
<300 ms
Modeller för roller och företag
500 miljoner+

Lika tillgång till möjligheter

En 24-årig kandidat från Pune i Indien berättade:

AI-intervjuaren kände till mitt cv, växlade mellan hindi och engelska och utmanade mig som en riktig intervjupanel från HDFC Bank. Jag fick jobbet vid nästa försök.

För första gången kan kandidater öva på intervjuer som känns helt verkliga –  anpassade efter deras cv, företag och drömroll.

Apnas AI Interview Prep visar hur röstteknik kan demokratisera möjligheter – och ge miljontals arbetssökande samma nivå av förberedelse som tidigare var förbehållen ett privilegierat fåtal.

För många ger övning med en verklighetstrogen intervjuare ett genuint självförtroende inför den första intervjun med en människa.

Genom att kombinera röst i realtid med anpassningsbar kontext och empati har Apna förvandlat förberedelse till deltagande – och gett alla, oavsett bakgrund eller språk, samma chans att lyckas.

Nästa gräns för lärande

Apnas AI Interview Prep definierar nästa generation av AI-drivet lärande och intervjuer.

Realistiska, responsiva röster drivna av ElevenLabs Text to Speech API låter kandidater få personligt anpassad återkoppling, naturlig tajming och tvåspråkig flyt som textbaserad övning aldrig kan erbjuda.

Genom samarbetet har Apna omdefinierat hur skalbart lärande låter – och visat att röstbaserad AI kan utöka människors möjligheter, inte ersätta dem.

Apnas framgång visar hur röster med hög återgivningstrohet kan förändra utbildning, anställningsbarhet och tillgång till möjligheter i nationell skala.

Om du bygger konversationsbaserade lärverktyg, AI-intervjuare eller system där realism och empati är viktiga kan du upptäcka möjligheterna med ElevenLabs Conversational Agents Platform.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet