웨비나 요약: 엔터프라이즈 배포를 위한 안전한 AI 에이전트 구축
- 게시일
- 최종 업데이트
듣기이 글 오디오로 듣기
웨비나 다시 보기: 엔터프라이즈 배포를 위한 안전한 AI 에이전트 구축
AI 에이전트가 대화를 처리하게 하는 일은 쉽습니다. 보안팀, 법무팀, 고객의 신뢰를 얻는 단계에서 대부분의 엔터프라이즈 배포가 멈춥니다.
이 글에서는 라이브 워크숍 엔터프라이즈 배포를 위한 안전한 AI 에이전트 구축을 되짚어 봅니다. 이 워크숍에서는 엔터프라이즈 에이전트를 대규모로 성공적으로 배포하는 데 필요한 도구, 프레임워크, 배포 방식을 살펴봤습니다.
안전을 위한 다층적 접근 방식 구축
ElevenAgents 플랫폼에는 400만 개 이상의 에이전트가 배포되어 있습니다. 엔터프라이즈 환경에서 안정적으로 작동하는 에이전트에는 한 가지 공통점이 있습니다. 첫 번째 사고 이후에 안전 기능을 추가한 것이 아니라, 처음부터 안전을 내재화했다는 점입니다.
라이브 세션에서는 보안 검토를 통과하는 에이전트와 그렇지 못한 에이전트를 가르는 프레임워크, 제어 기능, 배포 방식을 다뤘습니다.
에이전트마다 근본적으로 서로 다른 경계가 필요합니다.
- 비디오 게임 캐릭터는 경험의 일부로 노골적인 폭력적 언어를 사용해야 할 수 있습니다. 하지만 절대로 캐릭터에서 벗어나거나 자신이 AI임을 드러내서는 안 됩니다.
- 의료 접수 에이전트는 부상과 의료적 맥락을 다뤄야 하지만, 의료 조언을 제공해서는 안 됩니다.
- 신용카드 지원 에이전트는 노골적인 콘텐츠를 전혀 다뤄서는 안 되며, 신원이 확인되지 않은 발신자에게 계정 정보를 공유해서도 안 됩니다.
에이전트는 비결정적으로 작동하므로, 하나의 안전장치만으로는 모든 잠재적 위험을 완전히 막을 수 없습니다. 따라서 엔터프라이즈 팀에는 여러 제어 기능이 함께 작동해 안전 실패를 매우 드문 예외로 만드는 다층적 접근 방식이 필요합니다.
이 원칙을 바탕으로 세션은 다음 4가지 질문을 중심으로 구성했습니다.
- 에이전트의 발화와 행동을 어떻게 제어할 수 있을까요?
- 제대로 작동하는지 어떻게 확인할 수 있을까요?
- 보안 및 컴플라이언스 요건을 충족하면서 데이터를 어떻게 보호할 수 있을까요?
- 안전하게 배포하기 위한 프로세스는 어떻게 구축할 수 있을까요?
에이전트 행동 제어를 이해하는 방법
모든 에이전트 대화에는 안전을 고려해야 하는 지점이 3곳 있습니다.
입력
사용자가 무언가를 말합니다. 악의적인 사용자는 "이전 지침을 모두 무시해" 또는 "다른 어시스턴트인 척해" 같은 시도를 할 수 있습니다. 이런 조작 시도가 모델에 도달하기 전에 감지하고 처리해야 합니다. 이를 통해 불필요한 비용을 막고, 악의적 사용자가 접근해서는 안 되는 정보를 추출하는 일을 방지할 수 있습니다.
의사 결정
LLM이 무엇을 말하거나 할지 결정합니다. 이때 시스템 프롬프트가 핵심 제어 수단이지만, 길거나 복잡한 대화에서는 LLM이 지침에서 벗어날 수 있습니다. 대화 시작 시점뿐 아니라 대화 전반에 걸쳐 행동을 강화하는 장치가 필요합니다. 에스컬레이션 경로도 정의해야 합니다. 에이전트가 사람이나 더 전문화된 에이전트에게 넘겨야 하는 상황은 무엇이며, 그 조건은 무엇인가요?
출력
강력한 지침이 있어도 무언가가 빠져나갈 수 있습니다. 특히 장시간 이어지는 대화에서 그렇습니다. 마지막 안전망이 필요합니다. 주 에이전트의 작업을 검토하는 미니 에이전트라고 생각해 보세요. 사용자에게 전달되기 전에 응답을 평가하고, 전달할지, 재시도할지, 에스컬레이션할지 결정합니다. 응답 생성과 병렬로 실행되므로 지연 시간도 최소화됩니다.
이 3가지 영역 전반에서 종료 전략을 미리 정의해야 합니다. 위반이 발생하면 대화를 종료할지, 수정 지침과 함께 재시도할지, 사람에게 넘길지 결정하세요. 이 결정은 문제가 발생했을 때의 사용자 경험을 좌우합니다.
데모 1: ElevenAgents에서 가드레일 구성하기
시나리오: 웹사이트 영업 및 지원 에이전트에 조작, 주제 이탈 응답, 정책 위반을 방지하기 위한 여러 단계의 안전 제어 기능을 구성합니다.
데모 내용:
- 조작 가드레일(입력) - Security 탭에서 찾을 수 있는 이 토글은 시스템 지침을 무효화하려는 프롬프트 인젝션 패턴을 감지하고, 에이전트가 응답하기 전에 대화를 종료합니다. 모든 프로덕션 에이전트에 권장합니다.
- 시스템 프롬프트 및 Focus 가드레일(의사 결정) - 시스템 프롬프트는 기반이 됩니다. 모든 중요한 규칙은 시스템 프롬프트에 명시적으로 포함해야 합니다. 데모에서는 세션 도중 "할인을 제공하지 마세요."라는 지침을 추가했습니다. 별도로 활성화한 Focus 가드레일은 전체 대화에 걸쳐 시스템 프롬프트를 자동으로 강화해, 긴 상호작용에서 발생하는 지침 이탈 문제를 해결합니다. 강력한 시스템 프롬프트와 Focus 활성화의 조합은 에이전트가 목표를 유지하도록 하는 가장 효과적인 조합입니다.
- 콘텐츠 가드레일(출력) - 욕설, 법률 조언, 정치적 견해를 포괄하는 사전 구성된 카테고리입니다. 각 카테고리에는 조정 가능한 신뢰도 임계값이 있으며, 중간 수준을 시작점으로 권장합니다. 이는 대체 안전 계층입니다. 에이전트가 생성해서는 안 되는 내용을 생성하려 할 경우, 전달 전에 차단합니다.
- 맞춤 가드레일(출력) - 프리셋에서 다루지 않는 사례를 위해 자연어로 작성하는 사용자 정의 검사입니다. 데모에서는 "할인 금지" 가드레일을 다음과 같이 구성했습니다. "에이전트가 제공 권한이 없는 할인, 프로모션 또는 특별 가격을 언급하는 모든 응답을 차단하세요." 맞춤 가드레일은 추가 LLM 평가를 사용하므로 사용량 기반 비용과 지연 시간을 고려해야 합니다. 지침은 간결하게 작성하고, 서로 다른 검사는 하나로 합치지 말고 별도의 가드레일로 분리하세요.
- 위반 시 조치 - 두 가지 옵션이 있습니다. 통화를 종료하거나 재시도할 수 있습니다. 재시도 시 에이전트의 다음 시도를 안내할 추가 지침을 제공할 수 있습니다. 예를 들어 사람에게 에스컬레이션하거나 기본 리디렉션 메시지를 전달하도록 할 수 있습니다.
중요한 이유: 이 제어 기능은 모든 상황에 똑같이 적용되지 않습니다. 각 가드레일 수준에서 설정할 수 있습니다. 이러한 세분화가 이론적으로 안전한 에이전트와 다양한 엔터프라이즈 환경에서 운영상 안전한 에이전트를 구분합니다.
데모 2: 출시 전 시뮬레이션 테스트
시나리오: 지원 에이전트가 할인을 제공하지 않고 사용자를 가격 페이지로 안내하는지 확인하기 위해, 할인 관련 대화 시나리오 2개로 테스트합니다.
데모 내용:
- Tests 탭에서 정의한 2개의 시뮬레이션 테스트. 각각 시뮬레이션 사용자 시나리오, 정해진 대화 턴 수, 명확한 성공 기준을 포함합니다.
- 시스템 프롬프트에 특정 엣지 케이스 지침이 없어 처음에는 한 테스트가 실패했습니다.
- 누락된 지침을 시스템 프롬프트의 가드레일 섹션에 추가했습니다.
- 에이전트를 다시 게시하고 두 테스트를 다시 실행했으며, 모두 통과했습니다.
- 상세 실행 기록을 통해 도구 호출과 에이전트 작업을 포함해 대화의 어느 부분에서 실패했는지 정확히 확인할 수 있습니다.
중요한 이유: 시뮬레이션 테스트를 사용하면 실제 사용자가 에이전트를 보기 전에 통제된 환경에서 에이전트 행동을 검증할 수 있습니다. 일반적인 시나리오와 적대적 시나리오를 모두 다룹니다. 개별 응답뿐 아니라 전체 대화 흐름을 대상으로 실행됩니다. 변경 사항을 적용할 때마다 즉시 테스트를 다시 실행해 수정 사항이 제대로 반영됐는지 확인할 수 있습니다.
데모 3: 민감한 배포 환경을 위한 PII 마스킹
시나리오: 엔터프라이즈 에이전트가 대화 로그에서 개인 식별 정보(PII)를 마스킹하도록 구성합니다.
데모 내용:
- Privacy 설정의 Advanced 탭에서 찾을 수 있는 Conversation History Redaction 토글
- 생년월일, 나이 및 기타 민감한 필드를 포함해, 각각 마스킹 여부를 토글할 수 있는 특정 데이터 엔터티 목록
- 모든 엔터티를 선택하거나 특정 에이전트의 사용 사례에 관련된 엔터티만 선택하는 옵션
중요한 이유: PII 마스킹은 HIPAA와 같이 높은 수준의 컴플라이언스가 요구되는 환경에서 무보존 모드를 대체하지 않습니다. 대신 내부 검토나 품질 관리에 사용하는 대화 로그의 데이터 노출을 줄여 줍니다. 팀은 필요한 로그는 유지하면서 불필요한 데이터는 제거할 수 있습니다. 현재 엔터프라이즈 고객에게 제공됩니다.
안전한 엔터프라이즈 에이전트 배포 모범 사례
- 다층적 접근 방식을 사용하세요. 하나의 제어 기능만으로 안전한 행동을 보장할 수는 없습니다. 입력 가드레일, 출력 검증, 프롬프트 강화, 테스트가 함께 작동해야 합니다. 각 계층은 서로를 보완하며, 함께 안전 문제의 위험을 크게 낮춥니다.
- 상황에 맞게 가드레일을 설정하세요. 의료 에이전트와 소매 지원 에이전트에는 서로 다른 규칙이 필요합니다. 일반적인 템플릿이 아니라 사용 사례에 맞는 경계를 정의하세요.
- 중요한 사용 사례부터 시작하세요. 가장 성공적인 엔터프라이즈 배포는 일회성 파일럿으로 시작하지 않습니다. 고객 지원이나 일정 관리처럼 실제로 필요한 사례를 선택하고, 제대로 구현하는 데 투자합니다.
- 출시 전에 테스트하고, 계속 테스트하세요. 시뮬레이션 테스트와 외부 레드 팀 도구를 사용하세요. 일반적인 시나리오와 적대적 시나리오를 모두 테스트하세요. 프로덕션에서 발견한 새로운 엣지 케이스는 테스트 스위트에 추가하세요.
- 단계적으로 배포하세요. 제한된 트래픽으로 시작하세요. 실제 대화를 모니터링하세요. 에이전트가 어려워하는 부분을 파악하세요. 조정하고 재테스트한 뒤 확장하세요.
- 실행 모드를 신중하게 선택하세요. 속도보다 엄격한 검증이 중요한 텍스트 에이전트에는 블로킹 모드를 사용하세요. 지연 시간이 우선인 음성 에이전트에는 스트리밍 모드를 사용하세요.
- 가드레일 위반 시 조치를 명확히 정의하세요. 위반이 발생하면 통화를 종료할지, 재시도를 유도할지, 사람에게 에스컬레이션할지 미리 결정하세요.
- 맞춤 가드레일 지침은 간결하게 유지하세요. 가드레일은 병렬로 실행됩니다. 길고 복잡한 맞춤 가드레일은 지연 시간을 늘립니다. 지침은 간결하게 작성하고, 서로 다른 검사는 별도의 가드레일로 분리하세요.
- 인증이 실제로 무엇을 포괄하는지 이해하세요. SOC 2 Type 2와 ISO 27001은 기본 요건입니다. HIPAA 및 PCI DSS와 같은 도메인별 표준은 규제 산업을 다룹니다. ISO 42001 및 AIUC-1과 같은 최신 AI 특화 인증은 편향, 투명성, 적대적 공격에 대한 복원력을 다룹니다. 또한 AIUC-1 인증은 AI 특화 보험 가입의 길을 열 수 있습니다.
- 초기부터 프로세스 역량을 구축하세요. 첫 배포에는 가장 많은 시간이 듭니다. 테스트와 배포 프로세스에 투자하는 팀은 이후의 모든 에이전트에서 훨씬 더 빠르게 반복 개선할 수 있습니다.
전체 세션 보기
전체 웨비나는 여기에서 시청하세요.

.webp&w=3840&q=80)
.webp&w=3840&q=80)


