Guardrails 2.0: ElevenAgents의 새롭게 설계된 제어 레이어
- 게시일
- 최종 업데이트
듣기이 글 오디오로 듣기
음성 에이전트가 음성 에이전트 지원, 영업, 마케팅, 내부 워크플로 등에서 중요한 업무를 맡게 되면서, 팀은 엔터프라이즈 규모에서도 에이전트가 안전하고 브랜드 정체성에 부합하며 규정을 준수할 것이라는 확신이 필요합니다.
ElevenAgents의 Guardrails 2.0은 에이전트가 적절한 응답을 하도록 안내하고, 잘못된 응답이 최종 사용자에게 전달되기 전에 차단하도록 설계된 새로운 제어 레이어입니다.

실시간 다층 보호
잘 작성된 시스템 프롬프트는 대부분의 상호작용에서 예측 가능한 동작을 이끌어 냅니다. 하지만 에이전트는 비결정적 시스템이므로 긴 대화에서 본래 목적에서 벗어날 수 있고, 사용자는 경계를 넘기 위한 창의적인 방법을 찾아낼 수 있으며, 모델에 부담이 가해질 때는 잘 정의된 정책조차 항상 지켜지지는 않습니다.
따라서 프로덕션 환경에 에이전트를 배포하는 팀에는 다층 방어가 필요합니다. 즉, 견고한 시스템 프롬프트를 기반으로 사용자 발화와 에이전트 응답을 각각 독립적으로 검사해야 합니다.
Guardrails 2.0은 서로를 보완하는 3가지 수준에서 대화를 보호합니다:
사전 구축된 보호 기능
사전 구축된 안전장치는 가장 일반적인 위험 영역을 포괄합니다.
Focus Guardrail은 에이전트의 시스템 프롬프트를 강화하여 정의한 목표와 지침에 맞춰 응답이 명확하고 관련성 있으며 일관되게 유지되도록 돕습니다. 특히 에이전트가 원래 목표에서 벗어날 가능성이 높은 길거나 복잡한 대화에서 유용합니다.
Manipulation Guardrails는 사용자가 시스템 지침을 우회하려는 시도를 감지하고 차단합니다. 활성화하면 시스템은 프롬프트 인젝션 또는 지침 재정의 시도를 나타내는 패턴을 사용자 입력에서 분석하고, 보안 위험을 초래하는 대화를 종료할 수 있습니다.
Content Guardrails는 잠재적으로 민감하거나 안전하지 않은 콘텐츠의 여러 카테고리를 검사하여 적절한 에이전트 응답을 보장합니다. 각 카테고리의 임곗값을 조정해 정밀하게 제어할 수 있습니다.
Custom Guardrails: 규칙을 자동으로 적용
Custom Guardrails를 사용하면 자연어로 도메인별 정책을 정의하고 모든 통화에 자동으로 적용할 수 있습니다. 이를 통해 배포를 지연시킬 수 있는 사고, 에스컬레이션, 규정 준수 검토 주기를 줄일 수 있습니다.
.webp&w=3840&q=95)
경량 모델이 모든 에이전트 응답을 규칙에 따라 평가하고 차단 또는 허용 결정을 반환합니다. 응답 생성과 독립적으로 병렬 실행됩니다.
가드레일 실행 방식 완전 제어
정책 위반을 감지하는 방식과 이후 수행할 작업을 제어할 수 있습니다.
실행 모드. 지연 시간이 특히 중요한 음성 환경에서 속도와 엄격성 간의 균형을 설정합니다. 응답과 함께 가드레일을 실행하면 지연을 거의 없앨 수 있지만, 차단되기 전 일부 오디오가 재생될 수 있습니다. 또는 응답이 완전히 승인될 때까지 보류할 수 있습니다. 약간 더 느리지만, 검증되지 않은 내용은 사용자에게 전달되지 않습니다.
종료 전략. 가드레일이 실행되면 이후 동작을 정의할 수 있습니다. 대화를 종료하거나, 다른 에이전트에게 연결하거나, 상담원에게 에스컬레이션하거나, 수정 지침과 함께 응답을 다시 생성할 수 있습니다.
콘텐츠 민감도 수준. 개별 콘텐츠 카테고리별로 민감도를 조정할 수 있습니다. 고위험 사용 사례에서는 적용을 강화하고, 과도한 차단이 사용자 경험을 해칠 수 있는 경우에는 완화할 수 있습니다.
세분화된 구성. 각 가드레일은 개별적으로 활성화하거나 비활성화할 수 있으며, 서로 다른 에이전트에 서로 다른 구성을 적용할 수 있습니다.
완전한 가시성. 어떤 가드레일이 실행되었고 어떤 조치가 수행되었는지를 포함해 모든 트리거가 대화 분석에 기록됩니다. 이를 통해 팀은 시간이 지남에 따라 시스템 프롬프트와 가드레일을 개선하는 데 필요한 데이터를 확보할 수 있습니다.
대화 기록 마스킹
통화가 끝난 후 대화록, 녹음 및 웹훅 페이로드에서 민감한 정보를 자동으로 마스킹할 수 있습니다. 분석, QA, 학습에 필요한 정보는 유지하면서 불필요한 정보는 제거할 수 있습니다.
감지된 엔터티는 텍스트에서는 플레이스홀더로, 오디오에서는 비프음으로 대체됩니다. 개별 엔터티 유형까지 세부적으로 제어할 수 있습니다. 모든 이름을 마스킹하거나 성만 마스킹하고, 모든 금융 식별자를 마스킹하거나 결제 카드 번호만 마스킹할 수 있습니다.
이는 Zero Retention Mode와 같은 더 폭넓은 데이터 제어 기능과 함께 제공되며, 더 엄격한 규정 준수 요건을 충족해야 하는 배포에 사용할 수 있습니다.
.webp&w=3840&q=95)
대화 기록 마스킹과 Zero Retention Mode는 엔터프라이즈 고객에게 제공됩니다. 영업팀에 문의하여 이용 권한을 받으세요.
더 폭넓은 신뢰 및 안전 기반의 일부
Guardrails 2.0과 데이터 개인정보 보호 기능은 에이전트 수명 주기의 모든 단계에 적용되는 안전 도구와 함께 ElevenAgents의 엔터프라이즈 배포를 지원합니다:
에이전트 개발
- 에이전트 운영 전 동작을 스트레스 테스트하기 위한 시스템 프롬프트 설계, 가드레일 구성, 레드 팀 테스트 및 시뮬레이션
모든 대화
- 진행 중: Guardrails 2.0(Focus, Manipulation, Content, Custom Guardrails), 로깅, 선택형 Zero Retention Mode
- 종료 후: 평가 기준, 모니터링, 선택형 대화 기록 마스킹
이러한 기능을 함께 사용하면 사고는 줄이고 승인 주기는 단축하며 에이전트 동작의 일관성은 높여, 팀이 파일럿 단계에서 프로덕션 환경으로 전환하는 데 필요한 제어 기능을 제공합니다. 또한 이러한 플랫폼 기반은 AIUC-1 인증 자격과 업계 최초의 에이전트 보험 정책 이용을 지원합니다.
지금 Guardrails 시작하기
지난 몇 달간 기능을 순차적으로 출시해 왔으며, 이제 Guardrails 2.0 전체 제품군을 ElevenAgents에서 알파 버전으로 이용할 수 있습니다.
보안 탭에서 에이전트 설정으로 이동해 활성화하거나 API를 통해 구성하세요. 엔터프라이즈 배포에 관한 자세한 내용은 영업팀에 문의하세요.
설정 안내와 모범 사례는 다음 문서를 참고하세요:
.webp&w=3840&q=80)



