Guardrails 2.0: Una capa de control rediseñada en ElevenAgents
- Publicado
- Última actualización
EscucharEscucha este artículo
A medida que agentes de voz asumen tareas de alto impacto en atención al cliente, ventas, marketing, flujos de trabajo internos y mucho más, los equipos necesitan la confianza de que se mantendrán seguros, alineados con la marca y conformes con la normativa a escala empresarial.
Guardrails 2.0 en ElevenAgents es una capa de control rediseñada que ayuda a orientar a los agentes hacia las respuestas adecuadas y a evitar las incorrectas antes de que lleguen al usuario final.

Protecciones por capas en tiempo real
Un prompt de sistema bien diseñado permite un comportamiento predecible en la mayoría de las interacciones. Sin embargo, dado que los agentes son sistemas no deterministas, pueden desviarse en conversaciones largas, usuarios pueden encontrar formas creativas de superar los límites e incluso las políticas bien definidas no siempre se mantienen cuando el modelo está bajo presión.
Por eso los equipos que implementan agentes en producción necesitan defensas por capas: un prompt de sistema reforzado como base, además de comprobaciones independientes de lo que dicen usuarios y de cómo responden los agentes.
Guardrails 2.0 protege las conversaciones en tres niveles, que se refuerzan entre sí:
Protecciones predefinidas
Las medidas de seguridad predefinidas cubren las áreas de riesgo más habituales.
El Guardrail Focus refuerza el prompt de sistema de tu agente, para ayudar a que las respuestas sean directas, relevantes y coherentes con los objetivos e instrucciones que has definido. Resulta especialmente útil en conversaciones largas o complejas, en las que es más probable que el agente se desvíe de sus objetivos previstos.
Los Guardrails Manipulation detectan y bloquean los intentos de usuarios de eludir las instrucciones del sistema. Cuando están activados, el sistema analiza las entradas de usuarios en busca de patrones que indiquen intentos de inyección de prompts o de anulación de instrucciones, y puede finalizar las conversaciones que supongan un riesgo de seguridad.
Los Guardrails Content ayudan a garantizar respuestas adecuadas del agente al detectar varias categorías de contenido potencialmente sensible o inseguro, cada una con umbrales ajustables para un control preciso.
Custom Guardrails: tus reglas, aplicadas automáticamente
Custom Guardrails te permite definir políticas específicas de tu ámbito en lenguaje natural y aplicarlas automáticamente en cada llamada. Esto ayuda a reducir incidencias, escalaciones y los ciclos de revisión de cumplimiento normativo que pueden ralentizar la implementación.
.webp&w=3840&q=80)
Un modelo ligero evalúa cada respuesta del agente según tus reglas y devuelve una decisión de bloquear o permitir; funciona de forma independiente y en paralelo a la generación de respuestas.
Control total sobre cómo funcionan los guardrails
Puedes controlar cómo se detectan las infracciones de políticas y qué ocurre después.
Modos de ejecución. Configura el equilibrio entre velocidad y rigor, algo fundamental para la voz, donde la latencia es lo más importante. Puedes ejecutar los guardrails junto con la respuesta para lograr un retraso casi nulo, aunque podría reproducirse una fracción de segundo de audio antes de la interceptación. También puedes retener las respuestas hasta que se aprueben por completo: será algo más lento, pero nada llegará al usuario sin comprobarse.
Estrategias de salida. Cuando se activa un guardrail, defines qué ocurre después: finalizar la conversación, transferirla a otro agente, escalarla a una persona o volver a intentar la respuesta con instrucciones de corrección.
Niveles de sensibilidad del contenido. Ajusta la sensibilidad de cada categoría de contenido: refuerza la aplicación para casos de uso de mayor riesgo y redúcela cuando un bloqueo excesivo pueda perjudicar la experiencia de usuario.
Configuración granular. Puedes activar o desactivar cada guardrail de forma individual, y distintos agentes pueden usar configuraciones diferentes.
Visibilidad completa. Cada activación queda registrada en tus análisis de conversaciones, incluido qué guardrail se activó y qué medida se tomó. Esto proporciona a los equipos los datos que necesitan para mejorar sus prompts de sistema y guardrails con el tiempo.
Redacción del historial de conversaciones
Cuando termina una llamada, puedes redactar automáticamente información confidencial de transcripciones, grabaciones y cargas útiles de webhooks. Conserva todo lo necesario para análisis, control de calidad y entrenamiento, mientras eliminas lo que no necesitas.
Las entidades detectadas se sustituyen por marcadores de posición en el texto y pitidos en el audio. Tú controlas el nivel de detalle hasta cada tipo de entidad: puedes redactar todos los nombres o solo los apellidos, todos los identificadores financieros o solo los números de tarjetas de pago.
Esto se complementa con controles de datos más amplios, como Zero Retention Mode, que puede utilizarse en implementaciones con requisitos de cumplimiento normativo más estrictos.
.webp&w=3840&q=80)
La redacción del historial de conversaciones y Zero Retention Mode están disponibles para clientes empresariales. Contacta con ventas para obtener acceso.
Parte de una base más amplia de confianza y seguridad
Guardrails 2.0 y las funciones de privacidad de datos respaldan las implementaciones empresariales de ElevenAgents, junto con herramientas de seguridad para cada etapa del ciclo de vida del agente:
Desarrollo de agentes
- Diseño de prompts de sistema, configuración de guardrails, red teaming y simulaciones para poner a prueba el comportamiento antes de poner los agentes en marcha
Cada conversación
- Durante: Guardrails 2.0 (Focus, Manipulation, Content y Custom Guardrails), registros, Zero Retention Mode opcional
- Después: Criterios de evaluación, monitorización y redacción del historial de conversaciones opcional
En conjunto, ofrecen a los equipos los controles que necesitan para pasar de la fase piloto a producción con menos incidencias, ciclos de aprobación más rápidos y un comportamiento más coherente de los agentes. Estas bases de la plataforma también respaldan la elegibilidad para la certificación AIUC-1 y el acceso a las primeras pólizas de seguro para agentes del sector.
Empieza a usar Guardrails hoy
Hemos ido lanzando funciones durante los últimos meses, y la suite completa de Guardrails 2.0 ya está disponible en alfa en ElevenAgents.
Actívalos en la pestaña Seguridad de la configuración de tu agente, o configúralos mediante la API. Para más información sobre implementaciones empresariales, contacta con nuestro equipo de ventas.
Para obtener orientación sobre la configuración y consultar buenas prácticas, consulta:
.webp&w=3840&q=80)


