Capacidades de los agentes de voz: memoria, escalado y más
- Escrito por
- Jack Limebear
- Publicado
EscucharEscucha este artículo
Los sistemas telefónicos tradicionales dependían de respuestas guionizadas y basadas en menús. Esto limitaba su capacidad para adaptarse al habla natural o gestionar solicitudes complejas de workflow. Las capacidades actuales de los agentes de voz han ido mucho más allá al combinar reconocimiento de voz en tiempo real, razonamiento y contexto en sistemas de voz más ágiles.
Los agentes de voz modernos pueden autenticar a un cliente, obtener su información dentro del sistema, ofrecer respuestas razonables con datos en tiempo real, reconocer cuándo hay que transferir la situación y mucho más. Todo ello ocurre durante una llamada en directo, sin enviar al usuario a una cola telefónica para esperar a un agente humano.
Esta guía responde a seis preguntas sobre las capacidades de los agentes de voz con IA: cómo recuerdan a quienes llaman, cómo gestionan la frustración, qué datos los entrenan, cómo personalizan, cómo protegen datos sensibles y qué impacto tienen en la satisfacción del cliente. Cada respuesta explica cómo lo hace ElevenAgents en la práctica.

Resumen:
- Los agentes de voz combinan reconocimiento de voz en tiempo real con razonamiento sobre datos en directo, lo que les permite autenticar a quienes llaman, responder con información actualizada y completar tareas durante una llamada sin enviar a nadie a una cola telefónica.
- La memoria del agente funciona tanto dentro de una sola llamada como entre interacciones repetidas: obtiene el historial del cliente de un CRM al inicio mediante variables dinámicas y registra los resultados mediante webhooks posteriores a la llamada.
- Las llamadas de personas frustradas se gestionan con detección de sentimiento y desescalada en tiempo real, con una vía de transferencia a una persona o agente especializado cuando la frustración supera un umbral o quien llama pide hablar con alguien.
- Los agentes construyen conocimiento a partir de contenido subido en formatos como PDF, Word, texto, Markdown, HTML y EPUB, y utilizan RAG para recuperar pasajes relevantes, mientras que los documentos más pequeños permanecen en contexto completo.
- Las recomendaciones personalizadas combinan datos del CRM, la solicitud en directo y consultas de productos durante la llamada mediante llamadas a herramientas, para que el agente contraste la disponibilidad real con el historial de quien llama.
- Los ajustes de privacidad configurables regulan la retención de datos, el almacenamiento de audio, la redacción de transcripciones y el modo de retención cero, con elegibilidad para HIPAA en implementaciones sanitarias empresariales.
¿Qué son las capacidades de los agentes de voz?
Un agente de voz es un sistema de inteligencia artificial (IA) que puede mantener conversaciones habladas en tiempo real con clientes. Va más allá de las capacidades de voz tradicionales al comprender la intención, el contexto de la situación y completar tareas en nombre del cliente. Estos agentes escuchan al cliente, razonan sobre lo que oyen, consultan los sistemas que necesitan para completar la solicitud y después hablan con el cliente con un tono natural, similar al de un agente humano de atención al cliente.
Al definir las capacidades de los agentes de voz, nos referimos a las funciones específicas que hacen útiles las conversaciones entre el agente y el cliente. Estas funciones pueden dividirse en varias categorías para determinar cómo rendirá en ese papel:
- Memoria y contexto: La capacidad de conservar información sobre un cliente durante una sola llamada o varias interacciones con el mismo cliente.
- Gestión de situaciones y conversaciones difíciles: Los agentes mantienen el tema y siguen las políticas cuando quien llama está frustrado, confundido o no acepta el resultado.
- Capacidad de entrenarse con tu contenido: Los agentes se entrenan con documentación y políticas internas existentes de la empresa para obtener respuestas para la interacción, en lugar de usar un guion genérico.
- Personalización para el cliente: Los agentes adaptan el tono, el ritmo o las recomendaciones según quién llama, en lugar de ofrecer un menú genérico de opciones.
- Gestión de datos: La información compartida con los agentes se gestiona según qué datos se almacenan, cuánto tiempo los conserva la empresa y quién puede acceder a ellos.
- Resultados medibles para evaluar el éxito: Disponer de un sistema de seguimiento interno para determinar mejor si un agente de voz resuelve incidencias y si lo hace con precisión en comparación con un agente humano.
En última instancia, estas capacidades de los agentes de voz pueden ayudar a las empresas a adaptar mejor sus agentes a las necesidades de los clientes.
¿Cómo recuerdan los agentes de voz las conversaciones anteriores con clientes?
Los agentes de voz no tienen memoria integrada entre llamadas. La memoria entre llamadas se compone de tres elementos: variables dinámicas que insertan datos del CRM al inicio de la llamada, un webhook de inicio de conversación que los obtiene y un webhook posterior a la llamada que registra los resultados. Dentro de una misma llamada, el agente conserva automáticamente todo el contexto conversacional.
Según tu arquitectura específica, los agentes de voz pueden gestionar la memoria del cliente en dos niveles:
- Dentro de una sola llamada: El agente mantiene el contexto conversacional y registra todo lo que se dice durante la sesión, lo que minimiza la necesidad de que el cliente repita información durante la llamada.
- Entre varias interacciones: Esta memoria se consigue mediante integración multicanal. Al comienzo de la llamada, el agente recupera el historial del cliente del CRM o la base de datos de la empresa y, después, documenta los resultados de la interacción para que la siguiente conversación comience con conocimiento del historial.
El contexto se incorpora al inicio de la conversación mediante variables dinámicas con ElevenAgents. Estas variables insertan valores de ejecución en los prompts, mensajes y herramientas del agente. Esto permite personalizar cada conversación con información específica del usuario sin crear un agente distinto para cada cliente. Al comenzar la conversación, se pueden enviar al agente de voz el nombre de quien llama, el estado de su cuenta, información identificable y el historial de interacciones anteriores.
Para llamadas telefónicas entrantes, ElevenAgents puede obtener datos iniciales de los servidores de la empresa mediante un webhook de inicio de conversación y aplicar el JSON que devuelve la ruta de API mientras el agente carga el contexto. En un entorno real, la plataforma obtiene los datos necesarios durante el periodo inicial de conexión con el cliente. Este proceso suele percibirse como el tono normal de llamada o música de espera mientras el agente revisa el contexto en paralelo.
Cuando termina la llamada, el flujo funciona a la inversa. El agente envía los resultados de la llamada al CRM o sistema de soporte mediante webhooks posteriores a la llamada u otras herramientas de llamadas. Registra lo que ocurrió durante la llamada y lo que quizá aún deba tratarse con el cliente. La documentación de la interacción con el cliente es lo que mantiene persistente la memoria del agente de voz. Así, el siguiente agente o persona con quien interactúe el cliente tendrá todos los antecedentes antes de que comience la conversación.

¿Cómo gestionan los agentes de voz a clientes frustrados o enfadados?
Es inevitable que haya clientes frustrados o enfadados en cualquier nivel y entorno de atención al cliente. Los agentes de voz saben gestionar este tipo de situaciones detectándolas, adaptándose y escalando cuando es necesario.
Así es como los agentes de voz pueden afrontar situaciones difíciles con clientes:
- Detección de frustración: La detección de las respuestas de los clientes funciona con mayor eficacia mediante análisis de sentimiento. Este análisis clasifica las conversaciones como positivas, negativas o neutras. En conversaciones individuales, el análisis de sentimiento sitúa cada respuesta del usuario en una trayectoria puntuada de negativa a positiva, para que puedas ver en qué punto se torció una conversación. Cuando la detección se agrega por temas, puede revelar qué áreas frustran más a quienes llaman y aportar datos sobre dónde mejorar. Con modelos avanzados de agentes de voz, como los disponibles en ElevenLabs, los agentes incluso pueden entender el tono a partir de transcripciones en directo y adaptarse en consecuencia.
- Adaptación en tiempo real: El comportamiento de desescalada puede definirse directamente en el prompt del sistema de un agente, lo que le permite reconocer la frustración de quien llama, evitar discutir con esa persona, mantener respuestas tranquilas y alineadas con la conversación, y ofrecer una vía de resolución.
- Escalado a una persona: La herramienta de transferencia a un número deriva la llamada a una persona cuando se cumplen condiciones definidas; normalmente, cuando quien llama pide hablar con alguien, repite la misma queja dos veces o el sentimiento se mantiene negativo durante varios turnos consecutivos. Incluye estas condiciones en el prompt del sistema. El agente puede reproducir un mensaje para quien llama mientras espera y transmitir un resumen independiente al operador que recibe la llamada, para que la persona atienda con contexto en lugar de empezar de cero. ElevenAgents también admite transferencia de agente a agente, que dirige la conversación a un agente especializado cuando quien llama necesita una experiencia distinta, en lugar de una persona.
El aspecto más importante de las capacidades de los agentes de voz para gestionar a clientes frustrados es la vía de transferencia.

¿Qué formatos de archivo se pueden utilizar para entrenar un agente de voz?
Los agentes de voz modernos no se entrenan en el sentido tradicional de la IA o los LLM. A estos agentes se les proporciona conocimiento sobre el que apoyarse. Reciben documentación, páginas web o recursos de texto plano que remiten a una base de conocimiento, de la que el agente recupera pasajes relevantes durante las llamadas. Este enfoque se denomina generación aumentada por recuperación (RAG). Este proceso permite al agente recurrir a mucha más información de la que proporcionaría un único prompt.
Hay varias formas de añadir información a una base de conocimiento. Puedes subir un archivo, dirigir el agente a una URL o pegar el texto directamente. En ElevenAgents, los archivos subidos pueden tener hasta 20 MB cada uno y estar en los siguientes formatos:
- .docx
- .txt
- .md
- .html
- .epub
El formato afecta a la calidad de recuperación. Markdown, el texto plano y DOCX se extraen limpiamente y se dividen de forma predecible para RAG. Los PDF con diseños de varias columnas, tablas o páginas escaneadas se extraen mal y deberían convertirse antes de subirlos.
Una vez adjuntado el documento, el agente lo utiliza de una de dos formas. Los documentos pequeños pueden mantenerse en contexto completo, donde todo el texto del documento permanece en el prompt en cada turno. La segunda opción es indexar documentos más grandes para RAG.
En este proceso, solo se recuperan los pasajes más relevantes para cada pregunta en el momento de la conversación. Por ejemplo, un documento solo puede usarse en contexto completo si su texto extraído cabe dentro de 250.000 caracteres. Todo lo que supere ese tamaño pasa por RAG. Esto permite al sistema seleccionar automáticamente la vía adecuada una vez activado RAG.

¿Cómo ofrecen los agentes de voz recomendaciones personalizadas de productos?
Las recomendaciones personalizadas de productos proceden de combinar varias fuentes de información sobre quien llama en el momento de su interacción con el agente de voz. Estas incluyen quién es la persona, qué solicita y qué hay disponible. El agente conoce información sobre quien llama a partir de los datos del CRM transmitidos mediante variables dinámicas.
También conoce la solicitud a partir de la conversación en directo y la disponibilidad al consultar datos de productos mediante llamadas a herramientas. Después, el agente razona sobre toda esta información para recomendar opciones personalizadas a quien llama, igual que lo haría un representante humano bien informado.
Para entender mejor cómo funciona en un contexto realista de agente de voz, así sería una llamada real.
Un cliente recurrente llama a la línea de soporte técnico de un comercio porque no puede acceder a su cuenta de usuario y quiere realizar una compra. Así es como el agente de voz convierte esa llamada en una recomendación personalizada:
- Obtiene el contexto al inicio: El agente ya conoce el historial de compras de quien llama y otra información relacionada porque se recuperó al inicio de la llamada.
- Incorpora la solicitud a la recomendación: Quien llama describe lo que necesita y el agente incorpora esa descripción a su recomendación, en lugar de empezar desde cero.
- Consulta datos de productos en directo durante la llamada: El agente llama a la API de productos durante la conversación para comprobar los niveles de existencias y los precios actuales, en lugar de basarse en información de entrenamiento.
- Relaciona la disponibilidad con quien llama: Compara las existencias disponibles con la descripción y el historial de compras de quien llama.
- Recomienda y completa el pedido: El agente sugiere un producto y finaliza el pedido si se le solicita, sin necesidad de transferir a quien llama a otro lugar.
Toda esa conversación funciona gracias a las llamadas a herramientas. Así es como un bot de voz puede acceder a sistemas externos, como un catálogo de productos o una API de pedidos, e incorporar esa información a sus respuestas. La documentación de ElevenLabs sobre herramientas explica cómo se configura esa conexión.

¿Pueden los agentes de voz gestionar datos sensibles de clientes?
Los agentes de voz ofrecen controles configurables para los periodos de retención, la opción de no almacenar el audio de las llamadas, la redacción del historial de conversaciones y políticas de retención estrictas para sectores muy regulados, como la sanidad.
Con ElevenAgents, cada uno de estos controles se configura mediante los ajustes de privacidad. Así funciona:
- Retención: Las transcripciones de conversaciones y grabaciones de audio solo se almacenan durante un periodo específico. De forma predeterminada, ElevenAgents conserva transcripciones y grabaciones durante dos años, aunque se puede configurar desde cero días hasta un periodo ilimitado; para cumplir con HIPAA, se recomienda una retención mínima de seis años. Para garantizar una alineación total con HIPAA, ten en cuenta que procesar Información de Salud Protegida en nuestra plataforma requiere activar el modo de retención cero, lo que significa que almacenarías de forma segura esos seis años de registros en tu propia infraestructura mediante webhooks.
- Retención de audio:Las grabaciones de audio de llamadas pueden conservarse para fines de retención de clientes o desactivarse por completo para garantizar que no se conserve el audio de los clientes. Desactivar el guardado de grabaciones de audio y establecer una política de retención de cero días implica que los datos se eliminan inmediatamente después de la llamada.
- Redacción del historial de conversaciones: Cuando termina la conversación, un paso de posprocesamiento que analiza la transcripción y el audio después de cada llamada ayuda a proteger los datos sensibles de clientes mediante redacción. Este paso analiza el audio y la transcripción para detectar información sensible, muestra un marcador de posición en las transcripciones y un pitido en los fragmentos de audio. Así, el historial de conversaciones sigue disponible para su revisión mientras se reduce la exposición a información sensible.
- Modo de retención cero: Esta configuración es la más adecuada para requisitos estrictos de retención. La mayoría de los datos de solicitudes y respuestas se eliminan inmediatamente tras completarse la solicitud. Esta configuración se aplica al tráfico de la API y está disponible para clientes empresariales.
Para implementaciones relacionadas con la sanidad, ElevenAgents es elegible para HIPAA cuando se combina con Acuerdos de Asociado Comercial (BAA) disponibles para clientes empresariales. Combinado con un BAA firmado, nuestro modo de retención cero está diseñado para respaldar el cumplimiento de HIPAA, siempre que el cliente configure y utilice la plataforma de acuerdo con sus requisitos de cumplimiento normativo. Todos los detalles de configuración de estos controles se encuentran en nuestra documentación de privacidad de ElevenLabs.

¿Qué mejoras en la satisfacción del cliente ofrecen los agentes de voz?
Entre los factores que suelen mejorar la satisfacción del cliente están eliminar o reducir el tiempo de espera, la consistencia y una resolución más rápida. Como los agentes de voz pueden responder a las llamadas sin demora, quienes llaman suelen recibir una calidad de respuesta constante independientemente de la hora del día. Esto reduce el tiempo de resolución de solicitudes rutinarias que antes permanecían en cola esperando a un agente humano.
La salvedad es que, cuando una interacción con un cliente sale mal, dejar a un cliente frustrado atrapado en un bucle de agente perjudica la experiencia del cliente más rápido que la música de espera. Muchas organizaciones no suelen medir la satisfacción del cliente de forma aislada. Entre las métricas que se comunican junto a ella están la tasa de contención (la proporción de solicitudes que el agente resuelve sin intervención humana), el tiempo medio de gestión y la resolución en la primera llamada.
Cuando se combinan en un informe para su revisión, suelen contar una historia distinta a la de una métrica aislada. Por ejemplo, una alta tasa de contención que coincide con una caída en la satisfacción del cliente suele indicar que las llamadas se resuelven rápidamente sin necesidad de intervención humana.
Admiral es un buen ejemplo de priorizar la resolución en el primer contacto frente a la contención. Como se explicó en este webinar, buscaban alcanzar una tasa de resolución del 90 %, ofrecer disponibilidad 24/7 y lograr una mejora real del NPS. Una transferencia a una persona nunca penalizaba al agente, ya que resolver el problema importaba más que mantener la llamada contenida.
Más información sobre cómo esta capacidad del agente de voz se integra con su CRM y su configuración de voz.
Descubre todas las capacidades de los agentes de voz con ElevenAgents
Las capacidades de los agentes de voz que se han tratado en esta guía no son productos independientes ni separados. Estas capacidades deben integrarse en el mismo agente y configuración, con las variables dinámicas, herramientas y ajustes de privacidad adecuados para las necesidades empresariales de la organización.
Empezar puede ser tan sencillo como comenzar con un tipo de llamada y conectarlo solo a los sistemas que necesitará. A partir de ahí, el agente puede ampliarse cuando las métricas demuestren que funciona.
Más información sobre ElevenAgents o contacta con ventas para empezar hoy.




