Ir al contenido

Apna escala 7.5 millones de minutos de entrevistas con IA usando ElevenLabs

Publicado

EscucharEscucha este artículo

La preparación para entrevistas en India lleva mucho tiempo fallando: es genérica, está desconectada y resulta inaccesible para la mayoría de quienes buscan empleo.

Apna, la principal plataforma de búsqueda de empleo y desarrollo profesional de India, se propuso cambiar esta situación haciendo que cada entrevista simulada se sintiera como una real, personalizada para cada puesto, empresa y candidato.

Con más de 60 millones de usuarios y más de 10.000 empresas que ofrecen más de 30.000 puestos, la visión de Apna requería más que módulos de formación. Exigía conversación: un ritmo natural, empatía y profundidad de conocimiento, a gran escala.

Para lograrlo, Apna desarrolló uno de los ecosistemas de entrevistas con IA más avanzados, impulsado por Texto a Voz de ElevenLabs y la plataforma de orquestación de voz de Blue Machines. Juntos, estos sistemas han realizado más de 1,5 millones de entrevistas con IA, que suman 7,5 millones de minutos de voz, con una latencia inferior a 300 ms.

Por qué Apna eligió ElevenLabs

Para que las simulaciones de entrevistas resulten naturales, la calidad de voz y la capacidad de respuesta son inseparables. Cualquier retraso perceptible o tono robótico rompe la inmersión y la confianza.

Apna eligió ElevenLabs por tres motivos principales:

  • Rendimiento de streaming con baja latencia - las respuestas empiezan a reproducirse en 150–180 ms.
  • Capacidad multilingüe - síntesis fluida en inglés de India, hindi y habla con mezcla de idiomas.
  • Matiz emocional - modulación del tono que refleja la empatía y el desafío humanos.

Estas cualidades permiten a Apna conservar el ritmo de una conversación real y mantener la credibilidad emocional a gran escala.

Orquestar realismo humano en tiempo real a gran escala 

Para hacer posibles estas entrevistas realistas, Apna tuvo que resolver un complejo reto de orquestación. Crear una entrevista simulada que se sienta real requiere más que diálogos predefinidos: exige precisión sincronizada en voz, latencia, empatía y contexto, todo funcionando en armonía a velocidad de máquina.

Cada empresa entrevista de forma distinta. Para un puesto de responsable de producto pueden evaluarse las capacidades de razonamiento sobre métricas; para uno de responsable de crédito bancario, la lógica de cumplimiento normativo; y para uno de responsable de plataforma de comercio electrónico, la optimización de rutas.

Entre bastidores, la plataforma de orquestación de Apna, Blue Machines, creó un grafo de generación aumentada por recuperación (RAG) para cada combinación de puesto × empresa: 

● Más de 10.000 empresas × 50–100 puestos = ~500 millones de micromodelos. 
● Cada modelo se basa en rúbricas, tono y vocabulario específicos de la empresa.

Integraron el Texto a Voz en streaming de ElevenLabs directamente en su ciclo conversacional. Cada turno comienza con el habla del candidato, que procesan modelos multilingües de ASR y NLU. A continuación, la lógica del workflow evalúa la intención, la emoción y el contexto, recupera los datos de dominio más relevantes, formula la siguiente pregunta y la reproduce mediante ElevenLabs, todo en aproximadamente 300 milisegundos de principio a fin.

«Cada respuesta sintetizada empieza a reproducirse en unos 150–180 ms, gracias a las API de baja latencia de ElevenLabs integradas directamente en la capa de orquestación de Apna y Blue Machines», afirma Abhishek Ranjan, CTO de Apna.

En torno a los 300 ms, el cerebro humano percibe el habla como continua en lugar de retrasada: es el umbral a partir del cual empieza de verdad el realismo. 

Función
Entrada perimetral
Pasarelas regionales + enrutamiento inteligente
ASR + NLU
Reconocimiento multilingüe en streaming
Lógica del workflow + personalidad
Lógica del puesto + modulación de la empatía
Recuperación y evaluación del contexto
Obtención y validación de datos de dominio
Reproducción de TTS
Inicio de la síntesis de voz de ElevenLabs
Total
Tiempo (ms)
Entrada perimetral
30
ASR + NLU
90
Lógica del workflow + personalidad
40
Recuperación y evaluación del contexto
40
Reproducción de TTS
100
Total
≈300 ms

El resultado es un sistema que equilibra la precisión técnica con la profundidad emocional. Miles de entrevistas se realizan simultáneamente en inglés de India, hindi y habla con mezcla de idiomas, y todas mantienen el ritmo, la empatía y la credibilidad de un intercambio humano real.

Impacto a gran escala

Resultado
Entrevistas simuladas con IA realizadas
Más de 1,5 millones
Minutos de voz
Más de 7,5 millones
Latencia media
<300 ms
Modelos de puesto–empresa
Más de 500 millones

Igualar el acceso a las oportunidades

Un candidato de 24 años de Pune, India, compartió:

La persona entrevistadora con IA conocía mi currículum, cambiaba entre hindi e inglés y me planteaba retos como un panel real del banco HDFC. Conseguí el puesto en mi siguiente intento.

Por primera vez, candidatos pueden practicar con entrevistas que se sienten realmente reales, adaptadas a su currículum, empresa y puesto ideal.

AI Interview Prep de Apna muestra cómo la tecnología de voz puede democratizar las oportunidades y ofrecer a millones de personas que buscan empleo el mismo nivel de preparación que antes se reservaba para unas pocas privilegiadas.

Para muchas personas, practicar con alguien que entrevista de forma realista genera confianza de verdad antes de su primera entrevista con una persona.

Al combinar la voz en tiempo real con contexto adaptativo y empatía, Apna ha transformado la preparación en participación, dando a todo el mundo, sin importar su origen o idioma, las mismas oportunidades de tener éxito.

Abrir la próxima frontera del aprendizaje

AI Interview Prep de Apna define la próxima generación de aprendizaje y entrevistas impulsados por IA.

Las voces realistas y receptivas impulsadas por la API de Texto a Voz de ElevenLabs permiten a candidatos experimentar comentarios personalizados, un ritmo natural y una fluidez bilingüe que la práctica basada en texto jamás podría ofrecer.

Con esta colaboración, Apna ha redefinido cómo suena el aprendizaje escalable y demuestra que la IA basada en voz puede ampliar las oportunidades humanas, no sustituirlas.

El éxito de Apna demuestra cómo una voz de alta fidelidad puede transformar la educación, la empleabilidad y el acceso a oportunidades a escala nacional.

Si estás creando herramientas de aprendizaje conversacional, entrevistadores con IA o cualquier sistema en el que el realismo y la empatía importen, descubre lo que es posible con Plataforma de agentes conversacionales de ElevenLabs.

Artículos relacionados

Crea con el audio IA de la más alta calidad