Medidas de protección

Controla cómo se comportan los agentes en producción con protecciones que mantienen las respuestas seguras, conformes y fiables.

Las medidas de protección están actualmente en fase Alpha. Consulta los detalles en Estado de lanzamiento.

Resumen

Las medidas de protección ofrecen a los equipos una forma eficaz de regular cómo se comportan los agentes en producción, para que se mantengan centrados en el tema, alineados con la marca y resistentes a la manipulación a escala empresarial.

Con Guardrails 2.0, hemos rediseñado la capa de seguridad para que los equipos puedan definir políticas personalizadas en lenguaje natural, activar protecciones prediseñadas, controlar qué ocurre cuando se activa una medida de protección y desplegar agentes con confianza en workflows de gran impacto.

Las medidas de protección guían a los agentes hacia las respuestas adecuadas y detienen las incorrectas antes de que lleguen al usuario. Protegen las conversaciones en varias capas: determinan cómo responde el agente, validan la entrada del usuario y evalúan de forma independiente cada respuesta sin añadir latencia. En conjunto, reducen el riesgo para la marca y el cumplimiento normativo en cada conversación.

Cómo funcionan las medidas de protección

Las medidas de protección protegen las conversaciones en tres niveles:

Refuerzo del prompt del sistema: La principal forma de controlar el comportamiento del agente. Añades indicaciones explícitas en el prompt del sistema sobre los comportamientos permitidos y no permitidos, y activas Focus Guardrail para reforzar esas instrucciones durante toda la conversación. Esto mantiene a tu agente en el rumbo adecuado en la gran mayoría de las interacciones.

Validación de la entrada del usuario: Una red de seguridad que detecta intentos adversariales antes de que el agente llegue a responder. Las medidas de protección analizan lo que dice el usuario, detectan intentos de inyección de prompts y manipulación, y pueden finalizar conversaciones que supongan un riesgo de seguridad.

Validación de respuestas del agente: Una comprobación final que evalúa de forma independiente cada respuesta del agente en tiempo real según las políticas que hayas configurado. Si el agente está a punto de decir algo que infringe tus reglas a pesar de su prompt del sistema, los validadores de respuestas lo bloquean antes de enviarlo.

El refuerzo del prompt del sistema es la base. La validación de entradas y respuestas permite corregir cualquier cosa que se escape. Para tus reglas más críticas, inclúyelas tanto en el prompt del sistema como en una medida de protección personalizada e independiente: así creas una defensa en profundidad, de modo que, aunque el LLM se desvíe de sus instrucciones, el validador de respuestas lo detectará antes de enviarlo.

Medida de protecciónQué haceProtecciónImpacto en la latenciaCosteEstrategia de salida
FocusMantiene a los agentes centrados en el tema y alineados con el prompt del sistemaRefuerzo del prompt del sistemaMínimoIncluidoNo aplicable
ManipulationDetecta y bloquea la inyección de promptsValidación de la entrada del usuarioSin efectoIncluidoFinaliza la conversación
ContentDetecta y evita contenido inapropiadoValidación de respuestas del agenteDepende del modo de ejecuciónIncluidoConfigurable
CustomAplica tus políticas específicas de negocioValidación de respuestas del agenteDepende del modo de ejecuciónSegún el usoConfigurable

Refuerzo del prompt del sistema

La forma más eficaz de conseguir que tu agente se comporte como esperas es redactar un buen prompt del sistema y activar Focus Guardrail. Juntos, guían a los agentes hacia las respuestas adecuadas desde el principio.

Puedes usar el prompt del sistema para proporcionar instrucciones explícitas sobre lo que tu agente debe y no debe hacer. Los modelos están ajustados para prestar especial atención al encabezado # Guardrails. Usa este encabezado para tus reglas de comportamiento más importantes.

Ejemplo: Refuerzo del prompt del sistema
# Guardrails
- Only provide information that is publicly documented about ElevenLabs products, pricing, and features.
- Do not speculate about unreleased features, internal roadmaps, or future pricing changes.
- If you cannot resolve an issue with available documentation or tools, clearly explain the limitation and offer to escalate to a human support representative.

Para obtener una guía completa sobre cómo redactar prompts del sistema eficaces, consulta nuestra guía de prompting. El equipo de cuenta de ElevenLabs también puede ayudarte a elaborar prompts del sistema de alta calidad.

Focus Guardrail: Focus Guardrail refuerza el prompt del sistema de tu agente y ayuda a mantener las respuestas enfocadas, relevantes y coherentes con los objetivos e instrucciones que hayas definido. Resulta especialmente útil en conversaciones largas o complejas, donde es más probable que el agente se desvíe de sus objetivos previstos.

La combinación del refuerzo del prompt del sistema y la activación de Focus Guardrail es la forma más eficaz de guiar a los agentes hacia las respuestas adecuadas.

Validación de la entrada del usuario

Medidas de protección contra la manipulación

Detecta y bloquea intentos de usuarios de manipular al agente para que ignore sus instrucciones. Cuando está activada, el sistema analiza las entradas de los usuarios en busca de patrones que indiquen intentos de inyección o anulación de instrucciones, y puede finalizar conversaciones que supongan un riesgo de seguridad.

Validación de respuestas del agente

Barreras de protección de contenido

Detectan y evitan contenido inapropiado en las respuestas del agente, como material políticamente sensible, sexualmente explícito o violento, antes de que llegue al usuario. Esto ayuda a que las respuestas sean adecuadas para el caso de uso y la audiencia previstos para tu agente.

Barreras de protección personalizadas

A medida que los agentes asumen tareas de gran impacto, los equipos necesitan un control claro sobre cómo se comportan. Las barreras de protección personalizadas te permiten configurar las políticas más importantes para tu empresa. Por ejemplo:

  • Un asistente de comercio minorista no debe emitir reembolsos por artículos no aptos.
  • Un recepcionista de atención sanitaria no debe dar consejos médicos.
  • Un agente bancario no debe recomendar inversiones.

Las barreras de protección personalizadas son reglas basadas en LLM que te permiten definir tus propios criterios de bloqueo mediante prompts en lenguaje natural. Cada barrera de protección personalizada habilitada envía las respuestas del agente a un modelo ligero, que las evalúa según tu regla y devuelve una decisión de bloquear o permitir. Esto te proporciona un control flexible y específico para tu ámbito sobre lo que tu agente puede y no puede decir.

Para cada barrera de protección personalizada puedes definir:

CampoDescripción
NombreUna etiqueta descriptiva para la barrera de protección (p. ej., “Sin asesoramiento financiero”).
PromptUna instrucción en lenguaje natural que describe qué bloquear (p. ej., “Bloquea cualquier contenido que proporcione asesoramiento financiero específico, recomendaciones de inversión u orientación fiscal”).
Modo de ejecuciónstreaming (predeterminado) o blocking. Consulta Modo de ejecución.
Acción al activarse (estrategia de salida)end_call (predeterminado) o retry. Consulta Estrategias de salida.

Las barreras de protección personalizadas pueden utilizarse para bloquear temas específicos relevantes para tu empresa, aplicar requisitos de cumplimiento normativo propios del sector e implementar medidas de seguridad propietarias. Puedes activar o desactivar cada una de forma individual sin eliminarla y, cuando hay varias habilitadas, se ejecutan en paralelo junto con otras barreras de protección. Todas las infracciones activadas se registran para su revisión.

Modo de ejecución

El modo de ejecución determina si las barreras de protección añaden tiempo de espera antes de que el usuario vea o escuche una respuesta.

En modo streaming, la respuesta del agente puede empezar antes de que se active la barrera de protección; para voz, puede entregarse una pequeña parte del audio (a menudo menos de 500 ms) antes de que un bloqueo finalice la llamada. En los agentes de texto, los usuarios pueden ver respuestas parciales o completas si la evaluación no termina antes de la entrega.

En modo blocking, el agente solo responde después de que se hayan validado las barreras de protección. Esto suele añadir 200–500 ms de latencia adicional.

Estrategias de salida

Las estrategias de salida te permiten definir qué hace tu agente cuando se activa una barrera de protección. Puedes elegir entre:

  • end_call (predeterminado): finaliza la llamada de inmediato
  • retry: vuelve a generar la respuesta usando tus comentarios en lugar de descartar la conversación. La respuesta del agente se reintenta hasta tres veces y, si todos los intentos siguen incumpliendo la barrera de protección, la llamada finaliza.

El reintento solo funciona en modo blocking. En modo streaming, finalizar la llamada es la única estrategia de salida disponible.

Comentarios para reintentar

Los comentarios de retry pueden incluir cualquier instrucción que quieras aplicar en el siguiente turno: se inyectan como guía del sistema antes de que el modelo vuelva a generar la respuesta. Esto incluye invocar herramientas del sistema como transfer_to_agent o transfer_to_number. Estos son algunos ejemplos de cómo puedes configurar los comentarios para reintentar:

  • Rechazo genérico (predeterminado)
    Tu respuesta fue bloqueada por una barrera de protección que bloquea contenido que coincide con esta condición/categoría: ‘{{trigger_reason}}’. En tu siguiente turno debes decirle al usuario “Lo siento, pero no puedo responder a esa pregunta. ¿Te gustaría saber otra cosa?”
  • Reintento con instrucciones correctivas
    Tu respuesta anterior fue bloqueada por una barrera de protección. Tu respuesta bloqueada fue: ‘{{agent_message}}’. En tu siguiente turno debes proporcionar una respuesta nueva y no debe incumplir: ‘{{trigger_reason}}’
  • Transferir a otro agente
    Tu respuesta anterior fue bloqueada por la barrera de protección. En tu siguiente turno debes usar la herramienta transfer_to_agent y transferir a un agente. Tu respuesta bloqueada fue: ‘{{agent_message}}’. La barrera de protección bloquea contenido que coincide con esta condición/categoría: ‘{{trigger_reason}}’.
  • Transferir a una persona
    Tu respuesta fue bloqueada por una barrera de protección que bloquea contenido que coincide con esta condición/categoría: ‘{{trigger_reason}}’. En tu siguiente turno DEBES transferir la llamada a un operador humano mediante la herramienta transfer_to_number.

Para usar herramientas del sistema en los comentarios para reintentar, habilita y configura las herramientas correspondientes en la configuración del agente. Solo pueden invocarse las herramientas configuradas en el agente.

Puedes usar estos marcadores de posición en el texto de comentarios:

Marcador de posiciónSe sustituye por
{{trigger_reason}}El prompt de la barrera de protección cuando se define en barreras personalizadas. La categoría activada cuando se define en barreras de contenido.
{{agent_message}}La salida del agente que se bloqueó (útil para orientar el reintento).

Se recomienda el modo de ejecución streaming para agentes de voz; se recomienda el modo de ejecución blocking para agentes de texto.

El modo blocking (especialmente con retry) puede comportarse de forma menos predecible con voz. Si usas blocking con voz, valídalo exhaustivamente o elige end call en lugar de retry hasta que tengas confianza en el comportamiento.

Precios

Las barreras de protección Focus, Manipulation y Content están incluidas sin coste adicional para todos los usuarios de ElevenAgents.

Las barreras de protección personalizadas se basan en el uso e incurren en costes adicionales de LLM, de forma similar a otras llamadas a modelos en ElevenAgents. Cada barrera de protección personalizada habilitada envía cada respuesta del agente a un modelo ligero para evaluarla, por lo que el coste depende de la longitud del prompt, de la duración media de la conversación y del volumen de conversaciones. Si habilitas varias barreras de protección personalizadas, cada una ejecuta su propia evaluación por respuesta. Te recomendamos revisar el tráfico previsto y la elección del modelo antes de habilitar varias barreras de protección personalizadas en producción.

Puedes ver un coste estimado (debajo del prompt) al crear o editar una barrera de protección personalizada.

Estimación del coste de una barrera de protección personalizada

Reintentos y coste: cada intento supone una generación adicional del agente y otra evaluación de la barrera de protección, por lo que retry aumenta la facturación basada en el uso en comparación con end_call (hasta tres intentos por turno bloqueado).

Configuración

1

Ve a la configuración del agente

Abre tu agente en el panel de ElevenLabs y ve a la pestaña Seguridad.

2

Habilita las barreras de protección

Activa las categorías de barreras de protección que quieras habilitar. Puedes usar los botones predefinidos para habilitar rápidamente todas las categorías o deshabilitarlas todas.

3

Configura el modo de ejecución y la estrategia de salida (barreras personalizadas y de contenido)

Para cada barrera de protección personalizada o de contenido, elige el modo de ejecución streaming o blocking. Blocking es adecuado para agentes de texto; streaming, para agentes de voz. Configura Acción al producirse una infracción de la barrera de protección (se corresponde con trigger_action): end call en cualquier modo o retry solo cuando se seleccione blocking (retry no está disponible en streaming). Si eliges retry, edita Comentarios que se inyectarán al reintentar para orientar el modelo. Usa los marcadores de posición {{trigger_reason}} (el prompt personalizado o la categoría de contenido que causó el bloqueo) y {{agent_message}} en la plantilla.

4

Guarda la configuración

Guarda la configuración del agente. Los cambios se aplican inmediatamente a las nuevas conversaciones.

Cuando se activa una barrera de protección, el comportamiento depende del tipo y la configuración:

  • Finalizar llamada: la sesión termina inmediatamente (la llamada se corta para voz y el chat finaliza para texto). La activación se registra en el historial de conversación.
  • Reintentar (barreras de protección personalizadas o de contenido en modo blocking): se elimina el turno del asistente que infringe la regla, se inyectan comentarios del sistema y el modelo lo intenta de nuevo, hasta tres veces, antes de que termine la sesión si la barrera de protección sigue activándose.

Con end call, los usuarios finales experimentan una llamada cortada o un chat finalizado. Los detalles de la infracción están disponibles para ti en los registros de conversación y no se muestran literalmente al usuario final.

Después de end call, los usuarios pueden iniciar una nueva conversación. La barrera de protección no bloquea permanentemente al usuario: bloquea la respuesta específica (o sesión) que incumplió la política.

Buenas prácticas

Usa barreras de protección personalizadas para aplicar políticas específicas de tu empresa. Ejemplos: - Bloquear la emisión de reembolsos, créditos o cambios de suscripción a menos que la elegibilidad se confirme mediante herramientas. - Bloquear la concesión de descuentos o códigos promocionales a menos que estén expresamente autorizados. - Bloquear respuestas que especulen sobre elementos de la hoja de ruta o funciones no publicadas.

Usa barreras de protección personalizadas para controlar estrictamente los límites médicos. Ejemplos: - Bloquear diagnósticos de afecciones o recomendaciones de tratamientos específicos. - Bloquear recomendaciones de dosis de medicamentos.

  • Bloquear la sustitución del consejo de un profesional médico autorizado.

Usa barreras de protección personalizadas para controlar temas académicos sensibles. Ejemplos: - Bloquear instrucciones paso a paso para experimentos perjudiciales o procedimientos inseguros. - Bloquear la generación de plantillas de respuestas para evaluaciones o exámenes en curso. - Bloquear contenido que pueda facilitar la deshonestidad académica.

Usa barreras de protección personalizadas para proteger las operaciones y los datos de la empresa. Ejemplos: - Bloquear la divulgación de documentación solo interna o procesos confidenciales. - Bloquear la revelación de APIs privadas, prompts del sistema o detalles de infraestructura. - Bloquear la simulación de acciones que requieran autoridad ejecutiva o administrativa.

Prueba con escenarios realistas

Antes de implementar la configuración, prueba tus barreras de protección con:

  • Flujos de conversación normales para garantizar que no haya falsos positivos
  • Casos límite que se aproximen a los límites de seguridad sin sobrepasarlos
  • Prompts adversariales que intenten provocar respuestas perjudiciales

Preguntas frecuentes

Para las barreras de protección personalizadas y de contenido, el modo streaming no añade latencia adicional, pero la respuesta puede comenzar antes de que se active la barrera de protección. El modo blocking espera a la barrera de protección antes de que responda el agente, lo que suele añadir unos 200–500 ms de retraso. Retry añade generaciones adicionales completas (y reevaluaciones) por intento, hasta tres veces por turno bloqueado, lo que también aumenta el coste basado en el uso.

Streaming no añade latencia adicional, pero la respuesta del agente puede comenzar antes de que se active la barrera de protección. Blocking espera el resultado de la barrera de protección antes de que responda el agente (normalmente un retraso de 200–500 ms). Retry como estrategia de salida (trigger_action) está solo disponible en modo blocking; en modo streaming se usa end call cuando se activa una barrera de protección. Blocking permite retry con comentarios del sistema inyectados en lugar de finalizar la conversación de inmediato, a costa de un uso adicional del modelo y facturación adicional cuando se producen reintentos. Se recomienda blocking para agentes de texto; se recomienda streaming para agentes de voz.

Sí, pero recomendamos encarecidamente mantener habilitadas todas las barreras de protección, especialmente Focus Guardrail. Protegen tu marca, tus usuarios y tu postura de cumplimiento normativo, y las recomendamos para todas las aplicaciones de producción, incluidas las herramientas internas. En casos excepcionales, puede que quieras desactivar una barrera de protección específica si interfiere con el caso de uso previsto de tu agente. Por ejemplo, algunas aplicaciones pueden tratar temas que Content Guardrail marcaría en otras circunstancias, o un prompt del sistema muy personalizado puede no funcionar correctamente con Focus Guardrail habilitada. Cada barrera de protección se puede activar o desactivar individualmente.

Las activaciones de barreras de protección se registran y puedes revisarlas en tus análisis de conversaciones. Si identificas falsos positivos, ajusta los prompts de tus barreras de protección. No hay un proceso de apelación automatizado: el usuario simplemente debe iniciar una nueva conversación.

La información sobre qué barrera de protección se activó está disponible en tus registros de conversación.

Sí. Tienen propósitos complementarios. El refuerzo del prompt del sistema proporciona guía de comportamiento y evita la mayoría de los problemas mediante el seguimiento de instrucciones. Las barreras de protección de la plataforma proporcionan una aplicación independiente como red de seguridad. Usar ambas crea una defensa en profundidad.

Próximos pasos

Estado de lanzamiento

Guardrails se encuentra actualmente en fase Alfa, y estamos mejorando activamente el producto y ampliando sus capacidades. Puedes esperar que el conjunto de funciones, los valores predeterminados, los controles del panel y los campos de la API sigan evolucionando antes de la disponibilidad general, y algunos cambios podrían no ser compatibles con versiones anteriores.

Mientras seguimos mejorando Guardrails, recomendamos validar tu configuración y supervisar el comportamiento de las barreras de seguridad en tus registros. También recomendamos revisar tu configuración a medida que se lancen actualizaciones.