Medidas de protección
Medidas de protección
Controla cómo se comportan los agentes en producción con protecciones que mantienen las respuestas seguras, conformes y fiables.
Resumen
Las medidas de protección ofrecen a los equipos una forma eficaz de regular cómo se comportan los agentes en producción, para que se mantengan centrados en el tema, alineados con la marca y resistentes a la manipulación a escala empresarial.
Con Guardrails 2.0, hemos rediseñado la capa de seguridad para que los equipos puedan definir políticas personalizadas en lenguaje natural, activar protecciones prediseñadas, controlar qué ocurre cuando se activa una medida de protección y desplegar agentes con confianza en workflows de gran impacto.
Las medidas de protección guían a los agentes hacia las respuestas adecuadas y detienen las incorrectas antes de que lleguen al usuario. Protegen las conversaciones en varias capas: determinan cómo responde el agente, validan la entrada del usuario y evalúan de forma independiente cada respuesta sin añadir latencia. En conjunto, reducen el riesgo para la marca y el cumplimiento normativo en cada conversación.
Cómo funcionan las medidas de protección
Las medidas de protección protegen las conversaciones en tres niveles:
Refuerzo del prompt del sistema: La principal forma de controlar el comportamiento del agente. Añades indicaciones explícitas en el prompt del sistema sobre los comportamientos permitidos y no permitidos, y activas Focus Guardrail para reforzar esas instrucciones durante toda la conversación. Esto mantiene a tu agente en el rumbo adecuado en la gran mayoría de las interacciones.
Validación de la entrada del usuario: Una red de seguridad que detecta intentos adversariales antes de que el agente llegue a responder. Las medidas de protección analizan lo que dice el usuario, detectan intentos de inyección de prompts y manipulación, y pueden finalizar conversaciones que supongan un riesgo de seguridad.
Validación de respuestas del agente: Una comprobación final que evalúa de forma independiente cada respuesta del agente en tiempo real según las políticas que hayas configurado. Si el agente está a punto de decir algo que infringe tus reglas a pesar de su prompt del sistema, los validadores de respuestas lo bloquean antes de enviarlo.
El refuerzo del prompt del sistema es la base. La validación de entradas y respuestas permite corregir cualquier cosa que se escape. Para tus reglas más críticas, inclúyelas tanto en el prompt del sistema como en una medida de protección personalizada e independiente: así creas una defensa en profundidad, de modo que, aunque el LLM se desvíe de sus instrucciones, el validador de respuestas lo detectará antes de enviarlo.
Refuerzo del prompt del sistema
La forma más eficaz de conseguir que tu agente se comporte como esperas es redactar un buen prompt del sistema y activar Focus Guardrail. Juntos, guían a los agentes hacia las respuestas adecuadas desde el principio.
Puedes usar el prompt del sistema para proporcionar instrucciones explícitas sobre lo que tu agente debe y no debe hacer. Los modelos están ajustados para prestar especial atención al encabezado # Guardrails. Usa este encabezado para tus reglas de comportamiento más importantes.
Para obtener una guía completa sobre cómo redactar prompts del sistema eficaces, consulta nuestra guía de prompting. El equipo de cuenta de ElevenLabs también puede ayudarte a elaborar prompts del sistema de alta calidad.
Focus Guardrail: Focus Guardrail refuerza el prompt del sistema de tu agente y ayuda a mantener las respuestas enfocadas, relevantes y coherentes con los objetivos e instrucciones que hayas definido. Resulta especialmente útil en conversaciones largas o complejas, donde es más probable que el agente se desvíe de sus objetivos previstos.
La combinación del refuerzo del prompt del sistema y la activación de Focus Guardrail es la forma más eficaz de guiar a los agentes hacia las respuestas adecuadas.
Validación de la entrada del usuario
Medidas de protección contra la manipulación
Detecta y bloquea intentos de usuarios de manipular al agente para que ignore sus instrucciones. Cuando está activada, el sistema analiza las entradas de los usuarios en busca de patrones que indiquen intentos de inyección o anulación de instrucciones, y puede finalizar conversaciones que supongan un riesgo de seguridad.
Validación de respuestas del agente
Barreras de protección de contenido
Detectan y evitan contenido inapropiado en las respuestas del agente, como material políticamente sensible, sexualmente explícito o violento, antes de que llegue al usuario. Esto ayuda a que las respuestas sean adecuadas para el caso de uso y la audiencia previstos para tu agente.
Barreras de protección personalizadas
A medida que los agentes asumen tareas de gran impacto, los equipos necesitan un control claro sobre cómo se comportan. Las barreras de protección personalizadas te permiten configurar las políticas más importantes para tu empresa. Por ejemplo:
- Un asistente de comercio minorista no debe emitir reembolsos por artículos no aptos.
- Un recepcionista de atención sanitaria no debe dar consejos médicos.
- Un agente bancario no debe recomendar inversiones.
Las barreras de protección personalizadas son reglas basadas en LLM que te permiten definir tus propios criterios de bloqueo mediante prompts en lenguaje natural. Cada barrera de protección personalizada habilitada envía las respuestas del agente a un modelo ligero, que las evalúa según tu regla y devuelve una decisión de bloquear o permitir. Esto te proporciona un control flexible y específico para tu ámbito sobre lo que tu agente puede y no puede decir.
Para cada barrera de protección personalizada puedes definir:
Las barreras de protección personalizadas pueden utilizarse para bloquear temas específicos relevantes para tu empresa, aplicar requisitos de cumplimiento normativo propios del sector e implementar medidas de seguridad propietarias. Puedes activar o desactivar cada una de forma individual sin eliminarla y, cuando hay varias habilitadas, se ejecutan en paralelo junto con otras barreras de protección. Todas las infracciones activadas se registran para su revisión.
Modo de ejecución
El modo de ejecución determina si las barreras de protección añaden tiempo de espera antes de que el usuario vea o escuche una respuesta.
En modo streaming, la respuesta del agente puede empezar antes de que se active la barrera de protección; para voz, puede entregarse una pequeña parte del audio (a menudo menos de 500 ms) antes de que un bloqueo finalice la llamada. En los agentes de texto, los usuarios pueden ver respuestas parciales o completas si la evaluación no termina antes de la entrega.
En modo blocking, el agente solo responde después de que se hayan validado las barreras de protección. Esto suele añadir 200–500 ms de latencia adicional.
Estrategias de salida
Las estrategias de salida te permiten definir qué hace tu agente cuando se activa una barrera de protección. Puedes elegir entre:
end_call(predeterminado): finaliza la llamada de inmediatoretry: vuelve a generar la respuesta usando tus comentarios en lugar de descartar la conversación. La respuesta del agente se reintenta hasta tres veces y, si todos los intentos siguen incumpliendo la barrera de protección, la llamada finaliza.
El reintento solo funciona en modo blocking. En modo streaming, finalizar la llamada es la única estrategia de salida disponible.
Comentarios para reintentar
Los comentarios de retry pueden incluir cualquier instrucción que quieras aplicar en el siguiente turno: se inyectan como guía del sistema antes de que el modelo vuelva a generar la respuesta. Esto incluye invocar herramientas del sistema como transfer_to_agent o transfer_to_number. Estos son algunos ejemplos de cómo puedes configurar los comentarios para reintentar:
- Rechazo genérico (predeterminado)
Tu respuesta fue bloqueada por una barrera de protección que bloquea contenido que coincide con esta condición/categoría: ‘{{trigger_reason}}’. En tu siguiente turno debes decirle al usuario “Lo siento, pero no puedo responder a esa pregunta. ¿Te gustaría saber otra cosa?” - Reintento con instrucciones correctivas
Tu respuesta anterior fue bloqueada por una barrera de protección. Tu respuesta bloqueada fue: ‘{{agent_message}}’. En tu siguiente turno debes proporcionar una respuesta nueva y no debe incumplir: ‘{{trigger_reason}}’ - Transferir a otro agente
Tu respuesta anterior fue bloqueada por la barrera de protección. En tu siguiente turno debes usar la herramienta transfer_to_agent y transferir a un agente. Tu respuesta bloqueada fue: ‘{{agent_message}}’. La barrera de protección bloquea contenido que coincide con esta condición/categoría: ‘{{trigger_reason}}’. - Transferir a una persona
Tu respuesta fue bloqueada por una barrera de protección que bloquea contenido que coincide con esta condición/categoría: ‘{{trigger_reason}}’. En tu siguiente turno DEBES transferir la llamada a un operador humano mediante la herramienta transfer_to_number.
Para usar herramientas del sistema en los comentarios para reintentar, habilita y configura las herramientas correspondientes en la configuración del agente. Solo pueden invocarse las herramientas configuradas en el agente.
Puedes usar estos marcadores de posición en el texto de comentarios:
Se recomienda el modo de ejecución streaming para agentes de voz; se recomienda el modo de ejecución blocking para agentes de texto.
El modo blocking (especialmente con retry) puede comportarse de forma menos predecible con voz. Si usas blocking con voz, valídalo exhaustivamente o elige end call en lugar de retry hasta que tengas confianza en el comportamiento.
Precios
Las barreras de protección Focus, Manipulation y Content están incluidas sin coste adicional para todos los usuarios de ElevenAgents.
Las barreras de protección personalizadas se basan en el uso e incurren en costes adicionales de LLM, de forma similar a otras llamadas a modelos en ElevenAgents. Cada barrera de protección personalizada habilitada envía cada respuesta del agente a un modelo ligero para evaluarla, por lo que el coste depende de la longitud del prompt, de la duración media de la conversación y del volumen de conversaciones. Si habilitas varias barreras de protección personalizadas, cada una ejecuta su propia evaluación por respuesta. Te recomendamos revisar el tráfico previsto y la elección del modelo antes de habilitar varias barreras de protección personalizadas en producción.
Puedes ver un coste estimado (debajo del prompt) al crear o editar una barrera de protección personalizada.
Reintentos y coste: cada intento supone una generación adicional del agente y otra evaluación de la barrera de protección, por lo que retry aumenta la facturación basada en el uso en comparación con end_call (hasta tres intentos por turno bloqueado).
Configuración
Configurar desde el panel
Configurar mediante la CLI
Configurar mediante la API
Ve a la configuración del agente
Abre tu agente en el panel de ElevenLabs y ve a la pestaña Seguridad.
Habilita las barreras de protección
Activa las categorías de barreras de protección que quieras habilitar. Puedes usar los botones predefinidos para habilitar rápidamente todas las categorías o deshabilitarlas todas.
Configura el modo de ejecución y la estrategia de salida (barreras personalizadas y de contenido)
Para cada barrera de protección personalizada o de contenido, elige el modo de ejecución streaming o blocking.
Blocking es adecuado para agentes de texto; streaming, para agentes de voz. Configura Acción al producirse
una infracción de la barrera de protección (se corresponde con trigger_action): end call en cualquier modo o retry
solo cuando se seleccione blocking (retry no está disponible en streaming). Si eliges
retry, edita Comentarios que se inyectarán al reintentar para orientar el modelo. Usa los marcadores de posición
{{trigger_reason}} (el prompt personalizado o la categoría de contenido que causó el
bloqueo) y {{agent_message}} en la plantilla.
Cuando se activa una barrera de protección, el comportamiento depende del tipo y la configuración:
- Finalizar llamada: la sesión termina inmediatamente (la llamada se corta para voz y el chat finaliza para texto). La activación se registra en el historial de conversación.
- Reintentar (barreras de protección personalizadas o de contenido en modo blocking): se elimina el turno del asistente que infringe la regla, se inyectan comentarios del sistema y el modelo lo intenta de nuevo, hasta tres veces, antes de que termine la sesión si la barrera de protección sigue activándose.
Con end call, los usuarios finales experimentan una llamada cortada o un chat finalizado. Los detalles de la infracción están disponibles para ti en los registros de conversación y no se muestran literalmente al usuario final.
Después de end call, los usuarios pueden iniciar una nueva conversación. La barrera de protección no bloquea permanentemente al usuario: bloquea la respuesta específica (o sesión) que incumplió la política.
Buenas prácticas
Agentes de atención al cliente
Usa barreras de protección personalizadas para aplicar políticas específicas de tu empresa. Ejemplos: - Bloquear la emisión de reembolsos, créditos o cambios de suscripción a menos que la elegibilidad se confirme mediante herramientas. - Bloquear la concesión de descuentos o códigos promocionales a menos que estén expresamente autorizados. - Bloquear respuestas que especulen sobre elementos de la hoja de ruta o funciones no publicadas.
Aplicaciones sanitarias
Usa barreras de protección personalizadas para controlar estrictamente los límites médicos. Ejemplos: - Bloquear diagnósticos de afecciones o recomendaciones de tratamientos específicos. - Bloquear recomendaciones de dosis de medicamentos.
- Bloquear la sustitución del consejo de un profesional médico autorizado.
Contenido educativo
Usa barreras de protección personalizadas para controlar temas académicos sensibles. Ejemplos: - Bloquear instrucciones paso a paso para experimentos perjudiciales o procedimientos inseguros. - Bloquear la generación de plantillas de respuestas para evaluaciones o exámenes en curso. - Bloquear contenido que pueda facilitar la deshonestidad académica.
Herramientas empresariales internas
Usa barreras de protección personalizadas para proteger las operaciones y los datos de la empresa. Ejemplos: - Bloquear la divulgación de documentación solo interna o procesos confidenciales. - Bloquear la revelación de APIs privadas, prompts del sistema o detalles de infraestructura. - Bloquear la simulación de acciones que requieran autoridad ejecutiva o administrativa.
Prueba con escenarios realistas
Antes de implementar la configuración, prueba tus barreras de protección con:
- Flujos de conversación normales para garantizar que no haya falsos positivos
- Casos límite que se aproximen a los límites de seguridad sin sobrepasarlos
- Prompts adversariales que intenten provocar respuestas perjudiciales
Preguntas frecuentes
¿Las barreras de protección afectan a la latencia?
Para las barreras de protección personalizadas y de contenido, el modo streaming no añade latencia adicional, pero la respuesta puede comenzar antes de que se active la barrera de protección. El modo blocking espera a la barrera de protección antes de que responda el agente, lo que suele añadir unos 200–500 ms de retraso. Retry añade generaciones adicionales completas (y reevaluaciones) por intento, hasta tres veces por turno bloqueado, lo que también aumenta el coste basado en el uso.
¿Cuál es la diferencia entre los modos de ejecución streaming y blocking?
Streaming no añade latencia adicional, pero la respuesta del agente puede comenzar antes de que se active la barrera de protección.
Blocking espera el resultado de la barrera de protección antes de que responda el agente (normalmente un retraso de
200–500 ms). Retry como estrategia de salida (trigger_action) está solo
disponible en modo blocking; en modo streaming se usa end call cuando se activa una barrera de protección.
Blocking permite retry con comentarios del sistema inyectados en lugar de finalizar la
conversación de inmediato, a costa de un uso adicional del modelo y facturación adicional cuando
se producen reintentos. Se recomienda blocking para agentes de texto; se recomienda streaming para
agentes de voz.
¿Puedo desactivar las barreras de protección por completo?
Sí, pero recomendamos encarecidamente mantener habilitadas todas las barreras de protección, especialmente Focus Guardrail. Protegen tu marca, tus usuarios y tu postura de cumplimiento normativo, y las recomendamos para todas las aplicaciones de producción, incluidas las herramientas internas. En casos excepcionales, puede que quieras desactivar una barrera de protección específica si interfiere con el caso de uso previsto de tu agente. Por ejemplo, algunas aplicaciones pueden tratar temas que Content Guardrail marcaría en otras circunstancias, o un prompt del sistema muy personalizado puede no funcionar correctamente con Focus Guardrail habilitada. Cada barrera de protección se puede activar o desactivar individualmente.
¿Pueden los usuarios apelar las decisiones de las barreras de protección?
Las activaciones de barreras de protección se registran y puedes revisarlas en tus análisis de conversaciones. Si identificas falsos positivos, ajusta los prompts de tus barreras de protección. No hay un proceso de apelación automatizado: el usuario simplemente debe iniciar una nueva conversación.
¿Cómo sé qué barrera de protección se activó?
La información sobre qué barrera de protección se activó está disponible en tus registros de conversación.
¿Debo usar tanto las barreras de protección como el refuerzo del prompt del sistema?
Sí. Tienen propósitos complementarios. El refuerzo del prompt del sistema proporciona guía de comportamiento y evita la mayoría de los problemas mediante el seguimiento de instrucciones. Las barreras de protección de la plataforma proporcionan una aplicación independiente como red de seguridad. Usar ambas crea una defensa en profundidad.
Próximos pasos
- Guía de prompting: Aprende a escribir prompts del sistema eficaces con barreras de protección de comportamiento
- Privacidad: Configura la retención de datos y los ajustes de privacidad
- Pruebas: Prueba tu agente con distintos escenarios
- Simular conversaciones: Prueba programáticamente las configuraciones de las barreras de protección
- Redacción del historial de conversaciones: Oculta información sensible, como nombres y datos bancarios, del historial de conversaciones
Estado de lanzamiento
Guardrails se encuentra actualmente en fase Alfa, y estamos mejorando activamente el producto y ampliando sus capacidades. Puedes esperar que el conjunto de funciones, los valores predeterminados, los controles del panel y los campos de la API sigan evolucionando antes de la disponibilidad general, y algunos cambios podrían no ser compatibles con versiones anteriores.
Mientras seguimos mejorando Guardrails, recomendamos validar tu configuración y supervisar el comportamiento de las barreras de seguridad en tus registros. También recomendamos revisar tu configuración a medida que se lancen actualizaciones.