Guardrails 2.0: ElevenAgents의 새롭게 설계된 제어 레이어
- 게시일
- 최종 업데이트
듣기이 글 오디오로 듣기
지원, 영업, 마케팅, 내부 워크플로 등에서 음성 에이전트가 영향력 큰 업무를 맡게 되면서, 팀에는 엔터프라이즈 규모에서도 안전성을 유지하고, 브랜드 정체성에 부합하며, 규정을 준수할 것이라는 확신이 필요합니다.
ElevenAgents의 Guardrails 2.0은 에이전트가 적절한 응답을 하도록 안내하고, 잘못된 응답이 최종 사용자에게 전달되기 전에 차단하도록 돕는 새롭게 설계된 제어 계층입니다.

실시간 다층 보호
잘 설계된 시스템 프롬프트는 대부분의 상호작용에서 예측 가능한 행동을 이끌어냅니다. 하지만 에이전트는 비결정적 시스템이므로 긴 대화에서 방향을 잃을 수 있고, 사용자는 경계를 넘기 위한 창의적인 방법을 찾을 수 있으며, 명확히 정의된 정책도 모델에 부담이 가해지면 항상 지켜지지는 않습니다.
따라서 에이전트를 프로덕션에 배포하는 팀에는 다층 방어가 필요합니다. 강화된 시스템 프롬프트를 기반으로, 사용자가 말하는 내용과 에이전트의 응답을 독립적으로 점검해야 합니다.
Guardrails 2.0은 서로를 보완하는 3가지 수준에서 대화를 보호합니다.
사전 구축된 보호 기능
사전 구축된 보호 기능은 가장 일반적인 위험 영역을 다룹니다.
Focus Guardrail은 에이전트의 시스템 프롬프트를 강화하여, 정의한 목표와 지침에 맞게 응답의 방향성, 관련성, 일관성을 유지하도록 돕습니다. 에이전트가 의도한 목표에서 벗어나기 쉬운 길거나 복잡한 대화에서 특히 유용합니다.
Manipulation Guardrails는 사용자가 시스템 지침을 우회하려는 시도를 감지하고 차단합니다. 활성화하면 시스템이 프롬프트 인젝션 또는 지침 재정의 시도를 나타내는 패턴을 사용자 입력에서 분석하고, 보안 위험이 있는 대화를 종료할 수 있습니다.
Content Guardrails는 민감하거나 안전하지 않을 수 있는 콘텐츠의 여러 범주를 검사하여 적절한 에이전트 응답을 보장합니다. 각 범주에는 정밀한 제어를 위한 조정 가능한 임곗값이 제공됩니다.
Custom Guardrails: 규칙을 자동으로 적용
Custom Guardrails를 사용하면 자연어로 도메인별 정책을 정의하고 모든 통화에 자동으로 적용할 수 있습니다. 이를 통해 배포를 지연시킬 수 있는 사고, 에스컬레이션, 컴플라이언스 검토 주기를 줄일 수 있습니다.
.webp&w=3840&q=80)
경량 모델이 모든 에이전트 응답을 규칙에 따라 평가하고 차단 또는 허용 결정을 반환합니다. 이 과정은 응답 생성과 독립적으로 병렬 실행됩니다.
가드레일 실행 방식 완전 제어
정책 위반을 감지하는 방식과 이후 진행 방식을 제어할 수 있습니다.
실행 모드. 지연 시간이 특히 중요한 음성 환경에 맞춰 속도와 엄격성 간의 균형을 설정합니다. 가드레일을 응답과 함께 실행하면 지연을 거의 없앨 수 있지만, 차단 전에 몇 초의 일부에 해당하는 오디오가 재생될 수 있습니다. 또는 응답이 완전히 승인될 때까지 보류할 수 있습니다. 약간 느려지지만, 검토되지 않은 내용이 사용자에게 전달되지 않습니다.
종료 전략. 가드레일이 트리거되면 이후 조치를 정의할 수 있습니다. 대화 종료, 다른 에이전트로 전환, 상담원에게 에스컬레이션 또는 수정 지침과 함께 응답 재시도 중에서 선택하세요.
콘텐츠 민감도 수준. 개별 콘텐츠 범주별로 민감도를 조정하여, 고위험 사용 사례에서는 적용을 강화하고 과도한 차단이 사용자 경험을 해칠 수 있는 경우에는 완화할 수 있습니다.
세부 구성. 각 가드레일은 개별적으로 활성화하거나 비활성화할 수 있으며, 서로 다른 에이전트에 서로 다른 구성을 적용할 수 있습니다.
완전한 가시성. 어떤 가드레일이 작동했는지와 어떤 조치가 취해졌는지를 포함해 모든 트리거가 대화 분석에 기록됩니다. 이를 통해 팀은 시간이 지남에 따라 시스템 프롬프트와 가드레일을 개선하는 데 필요한 데이터를 확보할 수 있습니다.
대화 기록 마스킹
통화가 끝나면 트랜스크립트, 녹음 및 웹훅 페이로드에서 민감한 정보를 자동으로 마스킹할 수 있습니다. 분석, QA, 학습에 필요한 모든 정보는 유지하면서 불필요한 정보는 제거합니다.
감지된 엔터티는 텍스트에서는 플레이스홀더로, 오디오에서는 비프음으로 대체됩니다. 개별 엔터티 유형별로 세부 수준을 제어할 수 있습니다. 모든 이름 또는 성만, 모든 금융 식별자 또는 결제 카드 번호만 마스킹할 수 있습니다.
이는 Zero Retention Mode와 같은 더 광범위한 데이터 제어 기능과 함께 사용할 수 있으며, 더 엄격한 컴플라이언스 요구사항이 있는 배포에 활용할 수 있습니다.
.webp&w=3840&q=80)
대화 기록 마스킹과 Zero Retention Mode는 엔터프라이즈 고객에게 제공됩니다. 영업팀 문의를 통해 이용 권한을 요청하세요.
더 폭넓은 신뢰 및 안전 기반의 일부
Guardrails 2.0과 데이터 개인정보 보호 기능은 에이전트 수명 주기의 모든 단계에서 제공되는 안전 도구와 함께 ElevenAgents의 엔터프라이즈 배포를 지원합니다.
에이전트 개발
- 에이전트 운영 시작 전 행동을 스트레스 테스트하기 위한 시스템 프롬프트 설계, 가드레일 구성, 레드팀 테스트 및 시뮬레이션
모든 대화
- 진행 중: Guardrails 2.0(Focus, Manipulation, Content 및 Custom Guardrails), 로깅, 선택적 Zero Retention Mode
- 종료 후: 평가 기준, 모니터링, 선택적 대화 기록 마스킹
이러한 기능을 함께 활용하면 팀은 더 적은 사고, 더 빠른 승인 주기, 더 일관된 에이전트 행동으로 파일럿 단계에서 프로덕션 단계로 전환하는 데 필요한 제어 기능을 확보할 수 있습니다. 이러한 플랫폼 기반은 AIUC-1 인증 자격과 업계 최초의 에이전트 보험 정책에 대한 접근도 지원합니다.
지금 Guardrails 사용 시작
지난 몇 달간 기능을 순차적으로 출시해 왔으며, 이제 전체 Guardrails 2.0 제품군을 ElevenAgents에서 알파 버전으로 이용할 수 있습니다.
Security 탭에서 에이전트 설정으로 이동해 활성화하거나 API를 통해 구성하세요. 엔터프라이즈 배포에 관한 자세한 정보는 영업팀에 문의하세요.
설정 가이드와 모범 사례는 다음 문서를 참조하세요.
Eli is on the ElevenAgents growth team, helping drive awareness and adoption of conversational agents. Previously, he was on the growth teams at Rippling and Spot AI, and studied Management Science & Engineering at Stanford University.

.webp&w=3840&q=80)


