AI 에이전트를 위한 다층 안전 프레임워크
- 게시일
- 최종 업데이트
AI 에이전트가 중요한 업무를 맡게 되면서, 팀은 에이전트가 안전하고 예측 가능하게 작동한다는 확신이 필요합니다.
ElevenAgents는 대화의 모든 단계에서 작동하는 가드레일, 출시 전 적대적 테스트, 프로덕션 모니터링, 데이터 보호, 독립적 검증을 아우르는 다층형 안전 아키텍처를 활용합니다.
비결정론적 시스템이 모든 위험을 막을 수는 없지만, 이 포괄적인 안전 프레임워크를 통해 ElevenAgents를 기반으로 구축하는 선도적인 기업과 정부 기관은 장애 발생을 최소화하고, 원활하게 복구하며, 높은 안전 기준을 충족하는 에이전트를 설계할 수 있습니다.
대화의 모든 단계에서 보호
모든 상호작용의 3단계를 보호하는 제어 기능을 쉽게 활성화하고 구성할 수 있습니다. 이는 ElevenAgents의 Guardrails 2.0의 기반입니다.
입력 - 사용자가 전송하는 내용을 실시간으로 검사합니다.
- 조작 가드레일은 사용자 입력을 독립적으로 분석하며, 프롬프트 인젝션 징후가 보이는 대화를 종료할 수 있습니다.
결정 - 에이전트가 수행할 작업을 결정하는 과정에서 올바른 방향을 유지하도록 안내하고 관리합니다.
- 시스템 프롬프트에는 부적절한 주제 피하기, 에이전트의 자기표현 방식 정의, 역할 범위 제한 등 에이전트를 위한 명시적인 지침이 포함되어야 합니다.
- 워크플로 및 절차를 통해 계정 정보를 공유하기 전에 발신자 신원을 확인하는 것처럼, 가장 민감한 작업은 도구 호출 뒤에 제한할 수 있습니다.
- Focus 가드레일은 기존 시스템 지침을 강화하고 방향 이탈을 완화합니다. 이는 길거나 복잡한 상호작용에서 특히 중요합니다.
출력 - 독립 검증기가 응답 생성과 병렬로 실행되어 지연 시간을 최소화합니다. 민감한 콘텐츠를 포함하거나 정책을 위반하는 응답을 차단하도록 활성화할 수 있습니다.
- 콘텐츠 가드레일은 카테고리별 임계값을 적용해 민감한 카테고리를 검사합니다.
- 맞춤형 가드레일은 자연어로 작성된 도메인별 규칙을 적용하며, 각 규칙은 경량 모델이 평가합니다.
- 종료 전략을 통해 가드레일이 작동했을 때 통화 종료, 상담원 연결, 수정 지침과 함께 응답 재시도 등 수행할 작업을 정의할 수 있습니다.
강력한 출시 전 테스트
ElevenAgents는 플랫폼을 기반으로 구축하는 팀이 에이전트나 구성 변경 사항을 배포하기 전에 문제를 찾아 해결할 수 있도록 강력한 테스트 기능을 제공합니다.
시뮬레이션 기능을 사용하면 실제 상호작용 전에 시뮬레이션 사용자와 전체 멀티턴 대화를 실행할 수 있습니다. 시나리오를 정의하면 시뮬레이터가 실제 또는 모의 도구 호출을 포함해 대화가 해결될 때까지 진행합니다. 시뮬레이션 사용자를 직접 제어하므로 적대적이거나 조작적으로 설정할 수 있으며, 일반 경로를 검증하는 동일한 메커니즘으로 적대적 경로도 테스트할 수 있습니다.
다음 기능으로 테스트 범위를 확장할 수 있습니다:
- 반복 실행 기능은 테스트를 여러 번 실행하고 실패 원인별로 그룹화하여 오류 패턴과 엣지 케이스를 파악할 수 있게 합니다.
- 다음 응답 및 도구 호출 테스트는 개별 응답과 중요한 작업을 확인합니다.
- 채널별 테스트 기능은 에이전트의 출력이 채널에 따라 조정될 수 있으므로(예: 통화에서는 간결하게, 이메일에서는 상세하게), 배포되는 모든 채널에서 에이전트가 예상대로 작동하는지 검증합니다.
- API를 통한 레드팀 테스트. 레드팀 SDK를 사용해 API를 통해서도 테스트를 실행할 수 있습니다.
출시 후 에이전트 평가 및 개선
에이전트를 배포하면 실제 대화에 대해 평가가 지속적으로 실행됩니다. LLM 심사위원(LLM-as-a-judge) 방식을 활용해 각 통화를 설정한 기준에 따라 자동으로 평가할 수 있습니다. 검색 가능한 트랜스크립트, 소스, 도구 호출, 가드레일 트리거가 포함된 상세한 대화 로그를 통해 대시보드에서 대화 결과를 검토하고 문제를 추적할 수 있습니다.
프로덕션에서 발견된 모든 문제는 테스트 제품군에 쉽게 반영할 수 있습니다. 변경 사항이 제안되면 Experiments를 사용해 실제 트래픽의 일부를 변형 버전으로 라우팅하고, 광범위하게 적용하기 전에 실제 결과를 측정할 수 있습니다.
단계적으로 배포하는 것을 권장합니다. 제한된 일부 트래픽을 에이전트로 라우팅하고 해당 대화를 평가한 뒤, 에이전트가 예상대로 작동하는 것을 확인하면 추가 사용 사례, 채널 또는 지역으로 확장하세요.
민감한 데이터 보호
에이전트는 결제 정보, 건강 정보, 개인 식별 정보를 처리할 수 있으므로 어떤 데이터가 어디에 얼마나 오래 저장되는지 고려하는 것이 중요합니다.
고객이 데이터를 보호할 수 있도록 다양한 메커니즘을 제공합니다:
- Zero Retention Mode는 엄격한 규제 환경을 고려해 설계된 기능으로, 적격 서비스에서 활성화하면 특정 유형의 데이터가 보존되지 않도록 합니다.
- 대화 기록 삭제는 통화 후 민감한 엔터티를 제거하고, 개별 엔터티 유형별로 텍스트에서는 플레이스홀더로, 오디오에서는 비프음으로 대체합니다.
- 구성 가능한 보존 기간은 저장 기간을 규제 요건에 맞춥니다.
- 데이터 레지던시는 처리가 요구되는 관할권 내에서 이루어지도록 합니다.
- 프라이빗 배포(VPC)는 민감도가 높은 워크로드를 위한 환경을 격리합니다.
- 암호화는 전송 중 및 저장된 데이터를 보호합니다.
플랫폼 수준의 안전 장치 및 외부 검증
앞서 설명한 모든 기능은 더 폭넓은 플랫폼 수준의 안전 장치를 기반으로 합니다. 이는 콘텐츠 출처, 악용 탐지, 금지된 사용에 대한 조치, 모델 레드팀 테스트를 아우르는 포괄적인 프로그램입니다. 또한 안전 파트너십 프로그램을 통해 AI 안전 분야를 선도하는 기업과 협력하며, 이들의 제품과 새롭게 등장하는 업계 표준에 기여하고 있습니다.
SOC 2 Type II, ISO 27001, GDPR과 같은 일반적인 보안 및 개인정보 보호 표준은 물론, 결제 처리 부문의 PCI DSS Level 1, 미국 의료 부문의 HIPAA와 같은 산업 및 사용 사례별 인증을 포함해 접근 방식을 독립적인 검토에 맡기고 있습니다. 자세한 내용은 신뢰 센터에서 확인하세요.
또한 AI 관리 시스템을 규정하는 ISO 42001과 AIUC-1 등 새로운 AI 네이티브 표준도 충족합니다. AIUC-1은 AI 에이전트가 독립 평가 기관의 분기별 적대적 시뮬레이션을 견뎌낼 것을 요구합니다. AIUC-1을 뒷받침하는 동일한 기능을 통해 업계 최초의 에이전트 보험 상품도 이용할 수 있습니다.
대규모 또는 복잡한 배포의 경우, Forward Deployed Engineers가 팀과 함께 구성, 가드레일, 테스트, 모니터링, 출시 전략을 포함한 에이전트 전략을 설계하고 구현합니다.
결론
ElevenAgents의 안전 접근 방식은 각 요소가 서로를 강화하는 다층형 구조입니다:
- 에이전트 구성: 동작을 형성하는 시스템 프롬프트, 워크플로, 절차와 도구 호출 뒤에 제한된 가장 민감한 작업.
- 가드레일: 모든 단계의 독립적인 검사. 입력 단계의 조작 탐지, 결정 단계의 Focus, 출력 단계의 콘텐츠 및 맞춤형 검증기와 구성 가능한 종료 전략을 포함합니다.
- 테스트: 출시 전 적대적 시뮬레이션, 반복 실행, 채널별 테스트, 레드팀 테스트.
- 모니터링: 단계적 출시, 이후의 지속적인 평가, 검색 가능한 로그 및 트랜스크립트, 출시 후 피드백 루프.
- 데이터 보호: 삭제, Zero Retention Mode, 구성 가능한 보존 기간, 데이터 레지던시, 프라이빗(VPC) 배포 및 암호화.
- 외부 검증: 인증, AIUC-1의 독립적 적대적 테스트, 에이전트 보험, 레드팀 테스트 및 전문가 지원.

.webp&w=3840&q=80)


