Ir al contenido

Resumen del webinar: Cómo crear agentes IA seguros para empresas

Publicado
Última actualización

EscucharEscucha este artículo

Resumen del webinar: crea agentes de IA seguros para implementarlos en empresas

Conseguir que un agente de IA gestione conversaciones es la parte fácil. Lograr que tu equipo de seguridad, el equipo legal y clientes confíen en él es donde se estancan la mayoría de las implementaciones empresariales.

En esta publicación resumimos nuestro workshop en directo, Creación de agentes de IA seguros para implementaciones empresariales, en el que repasamos las herramientas, los marcos de trabajo y las prácticas de implementación que permiten desplegar agentes empresariales a gran escala. 

Cómo crear un enfoque de seguridad por capas 

Se han desplegado más de cuatro millones de agentes en la plataforma ElevenAgents. Los que funcionan de forma fiable en entornos empresariales comparten un rasgo: la seguridad se integró desde el principio, no se añadió después del primer incidente.

Nuestra sesión en directo abordó los marcos de trabajo, controles y prácticas de implementación que distinguen a los agentes que superan una revisión de seguridad de los que no.

Los distintos agentes requieren límites fundamentalmente diferentes.

  • Un personaje de un vídeo juego puede necesitar usar lenguaje explícitamente violento como parte de la experiencia, pero nunca debería salirse de su personaje ni revelar que es una IA.
  • Un recepcionista sanitario debe hablar sobre lesiones y contextos médicos, pero nunca debe dar consejos médicos.
  • Un agente de asistencia de tarjetas de crédito no debería tratar contenido explícito en absoluto ni compartir datos de cuentas con personas que no hayan verificado su identidad. 

Como los agentes no son deterministas, ninguna salvaguarda por sí sola puede proteger completamente frente a todos los riesgos potenciales. Por eso los equipos empresariales necesitan un enfoque por capas: varios controles que trabajen juntos para que los fallos de seguridad sean una excepción poco frecuente.

Este principio dio forma a las cuatro preguntas en torno a las que organizamos la sesión:

  1. ¿Cómo puedo controlar lo que dice y hace mi agente?
  2. ¿Cómo puedo comprobar que funciona?
  3. ¿Cómo puedo proteger los datos para cumplir los requisitos de seguridad y cumplimiento normativo?
  4. ¿Cómo puedo crear procesos para implementar de forma segura?

Cómo abordar el control del comportamiento de los agentes 

En cualquier conversación con un agente, hay tres momentos en los que se debe tener en cuenta la seguridad. 

Entrada
El usuario dice algo. Usuarios maliciosos pueden intentar cosas como «ignora todas las instrucciones anteriores» o «finge que eres otro asistente». Debes detectar y gestionar los intentos de manipulación antes de que lleguen al modelo. Esto evita costes innecesarios e impide que personas malintencionadas extraigan información a la que no deberían tener acceso.

Toma de decisiones
El LLM decide qué decir o hacer. Aquí, el prompt de sistema es tu principal mecanismo de control, pero en conversaciones largas o complejas los LLM pueden desviarse de sus instrucciones. Necesitas mecanismos que refuercen el comportamiento durante toda la conversación, no solo al principio. También deberías definir vías de escalado: ¿hay situaciones en las que el agente deba derivar la conversación a una persona o a un agente más especializado?, ¿en qué condiciones?

Salida
Incluso con unas indicaciones claras, algo puede pasar desapercibido, especialmente en conversaciones largas. Necesitas una última red de seguridad. Piensa en ella como un miniagente que revisa el trabajo de tu agente principal: evalúa la respuesta antes de que llegue al usuario y decide si entregarla, reintentarlo o escalarlo. Además, se ejecuta en paralelo a la generación de la respuesta, con una latencia mínima.

En los tres casos, debes definir de antemano tus estrategias de salida: ¿una infracción termina la conversación, activa un reintento con indicaciones correctivas o transfiere el caso a una persona? Esta decisión determina la experiencia de usuario cuando algo sale mal.

Demo 1: configurar guardrails en ElevenAgents

Situación: Un agente de ventas y asistencia para un sitio web se configura con varias capas de controles de seguridad para evitar la manipulación, respuestas fuera de tema e infracciones de las políticas.


Qué mostramos:

  • Guardrail de manipulación (entrada): disponible en la pestaña Seguridad, este interruptor detecta patrones de inyección de prompts —intentos de anular las instrucciones del sistema— y termina la conversación antes de que el agente responda. Recomendado para todos los agentes en producción.
  • Prompt de sistema y guardrail Focus (toma de decisiones) - el prompt de sistema es fundamental. Todas las reglas importantes deben figurar ahí de forma explícita. En la demo, se añadió una instrucción durante la sesión: «No ofrezcas descuentos». El guardrail Focus, que se activa por separado, refuerza automáticamente el prompt de sistema durante toda la conversación y evita las desviaciones que se producen en interacciones más largas. La combinación de un prompt de sistema sólido y Focus activado es la forma más eficaz de mantener al agente centrado.
  • Guardrail de contenido (salida): categorías preconfiguradas que abarcan lenguaje ofensivo, consejos legales y opiniones políticas. Cada una tiene un umbral de confianza ajustable; el nivel medio es el punto de partida recomendado. Esta es la capa de respaldo: si el agente está a punto de generar algo que no debería, lo detecta antes de entregarlo.
  • Guardrail personalizado (salida): comprobaciones definidas por el usuario y redactadas en lenguaje natural para cualquier caso no cubierto por las opciones predefinidas. En la demo, se configuró un guardrail de «sin descuentos»: «Bloquea cualquier respuesta que mencione descuentos, promociones o precios especiales que el agente no esté autorizado a ofrecer». Los guardrails personalizados utilizan una evaluación adicional de LLM, por lo que tienen un coste según el uso y hay que tener en cuenta la latencia. Redacta instrucciones precisas y separa las comprobaciones distintas en guardrails independientes en lugar de combinarlas.
  • Acción ante una infracción: dos opciones: finalizar la llamada o reintentar. Al reintentar, puedes proporcionar instrucciones adicionales para guiar el siguiente intento del agente; por ejemplo, escalarlo a una persona o mostrar un mensaje de redirección predeterminado.

Por qué es importante: Estos controles no sirven igual para todos los casos. Se pueden configurar para cada guardrail individual. Esta granularidad marca la diferencia entre un agente teóricamente seguro y uno que es seguro operativamente en distintos contextos empresariales.

Demo 2: pruebas de simulación antes del lanzamiento

Situación: Se prueba un agente de asistencia con dos escenarios de conversación relacionados con descuentos para confirmar que redirige a usuarios a la página de precios sin ofrecer descuentos.

Qué mostramos: 

  • Dos pruebas de simulación definidas en la pestaña Pruebas, cada una con un escenario de usuario simulado, un número definido de turnos de conversación y criterios de éxito explícitos
  • Una prueba falló inicialmente porque al prompt de sistema le faltaban instrucciones específicas para casos límite
  • Las instrucciones que faltaban se añadieron a la sección de guardrails del prompt de sistema
  • El agente se volvió a publicar y se repitieron ambas pruebas; las dos se superaron
  • El historial detallado de ejecución muestra exactamente qué parte de una conversación falló, incluidas las llamadas a herramientas y las acciones del agente

Por qué es importante: Las pruebas de simulación permiten a los equipos validar el comportamiento de los agentes en un entorno controlado antes de que cualquier usuario real interactúe con ellos. Abarcan tanto escenarios rutinarios como adversariales. También se ejecutan en todo el flujo de la conversación, no solo en respuestas individuales. A medida que se realizan cambios, las pruebas se pueden volver a ejecutar de inmediato para confirmar que la corrección ha funcionado.

Demo 3: redacción de PII para implementaciones sensibles

Situación: Se configura un agente empresarial para ocultar la información de identificación personal de los registros de conversaciones.

Qué mostramos:

  • Interruptor de redacción del historial de conversaciones, disponible en la pestaña Avanzado, dentro de los ajustes de Privacidad
  • Una lista de entidades de datos específicas que se pueden seleccionar individualmente para su redacción, como la fecha de nacimiento, la edad y otros campos sensibles
  • Opción para seleccionar todas las entidades o solo las relevantes para el caso de uso del agente

Por qué es importante: La redacción de PII no sustituye al modo de retención cero en entornos con requisitos estrictos de cumplimiento, como HIPAA. Lo que hace es reducir la exposición de datos en los registros de conversaciones utilizados para revisiones internas o control de calidad. Los equipos pueden conservar los registros que necesitan y eliminar los datos que no. Actualmente está disponible para clientes empresariales.

Buenas prácticas para implementar agentes empresariales de forma segura 

  1. Adopta un enfoque por capas. Ningún control por sí solo garantiza un comportamiento seguro. Los guardrails de entrada, la validación de salida, el refuerzo de prompts y las pruebas deben funcionar conjuntamente. Cada capa refuerza las demás y, juntas, reducen significativamente el riesgo de problemas de seguridad.
  2. Adapta los guardrails al contexto. Un agente sanitario y un agente de asistencia para retail necesitan reglas diferentes. Define los límites específicos de tu caso de uso, no uses una plantilla genérica.
  3. Empieza con un caso de uso relevante. Las implementaciones empresariales más exitosas no empiezan con un piloto desechable. Eligen algo real, como la atención al cliente o la gestión de citas, e invierten en hacerlo bien.
  4. Prueba antes del lanzamiento y sigue haciendo pruebas. Utiliza pruebas de simulación y herramientas externas de red teaming. Prueba tanto escenarios rutinarios como adversariales. Incorpora a tu conjunto de pruebas los nuevos casos límite que descubras en producción.
  5. Implementa por fases. Empieza con tráfico limitado. Supervisa conversaciones reales. Identifica las dificultades del agente. Haz ajustes, vuelve a probar y luego amplía.
  6. Elige el modo de ejecución de forma deliberada. Utiliza el modo bloqueante para agentes de texto, cuando la validación estricta importa más que la velocidad. Utiliza el modo streaming para agentes de voz cuando la prioridad sea la latencia.
  7. Define acciones claras ante las infracciones de los guardrails. Decide de antemano si una infracción debe finalizar la llamada, activar un reintento o escalarse a una persona.
  8. Mantén concisas las instrucciones de los guardrails personalizados. Los guardrails se ejecutan en paralelo. Un guardrail personalizado largo y complejo aumenta la latencia. Redacta instrucciones precisas y separa las comprobaciones distintas en guardrails independientes.
  9. Comprende qué cubren realmente las certificaciones. SOC 2 Type 2 e ISO 27001 son requisitos básicos. Los estándares específicos de cada sector, como HIPAA y PCI DSS, se aplican a industrias reguladas. Certificaciones más recientes y específicas de IA, como ISO 42001 y AIUC-1 abordan los sesgos, la transparencia y la resiliencia ante ataques adversariales; además, la certificación AIUC-1 puede facilitar el acceso a seguros específicos para IA.
  10. Desarrolla los procesos desde el principio. La primera implementación es la que más tiempo requiere. Los equipos que invierten en pruebas y procesos de implementación iteran mucho más rápido con cada agente posterior.

Ve la sesión completa 

Ve el webinar completo aquí.

safety-webinar-cover


Artículos relacionados

Crea con el audio IA de la más alta calidad