가드레일
가드레일
응답을 안전하고 규정을 준수하며 신뢰할 수 있게 유지하는 보호 기능으로 프로덕션 환경에서 에이전트의 동작을 제어하세요.
개요
가드레일은 팀이 프로덕션 환경에서 에이전트의 동작을 관리할 수 있는 강력한 방법을 제공하여, 엔터프라이즈 규모에서 주제를 벗어나지 않고 브랜드에 부합하며 조작에 강한 상태를 유지합니다.
Guardrails 2.0에서는 팀이 자연어로 커스텀 정책을 쉽게 정의하고, 사전 구축된 보호 기능을 켜며, 가드레일이 작동했을 때의 처리 방식을 제어하고, 영향력이 큰 workflow 전반에 에이전트를 자신 있게 배포할 수 있도록 안전 계층을 새롭게 설계했습니다.
가드레일은 에이전트를 올바른 응답으로 유도하고 잘못된 응답이 사용자에게 전달되기 전에 차단합니다. 여러 계층에서 대화를 보호합니다. 즉, 에이전트의 응답 방식을 조정하고, 사용자 입력을 검증하며, 지연 시간을 추가하지 않고 모든 답변을 독립적으로 평가합니다. 이를 통해 모든 대화에서 브랜드 및 규정 준수 위험을 줄입니다.
가드레일 작동 방식
가드레일은 세 가지 수준에서 대화를 보호합니다.
시스템 프롬프트 강화: 에이전트 동작을 제어하는 주된 방법입니다. 시스템 프롬프트에 허용 및 비허용 동작에 관한 명시적 지침을 추가하고, Focus Guardrail을 활성화해 대화 전반에서 이러한 지침을 강화합니다. 대부분의 상호작용에서 에이전트가 올바른 방향을 유지하게 하는 방식입니다.
사용자 입력 검증: 에이전트가 응답하기도 전에 적대적 시도를 포착하는 안전망입니다. 가드레일은 사용자의 발화를 분석하고, 프롬프트 인젝션 및 조작 시도를 감지하며, 보안 위험을 초래하는 대화를 종료할 수 있습니다.
에이전트 응답 검증: 구성한 정책에 따라 모든 에이전트 답변을 실시간으로 독립 평가하는 최종 점검입니다. 시스템 프롬프트가 있어도 에이전트가 규칙을 위반하는 내용을 말하려 할 경우, 응답 검증기가 전달 전에 차단합니다.
시스템 프롬프트 강화가 기반입니다. 입력 및 응답 검증은 누락된 부분을 보완합니다. 가장 중요한 규칙은 시스템 프롬프트와 독립적인 커스텀 가드레일 모두에 포함하세요. 심층 방어가 구축되어 LLM이 지침에서 벗어나더라도 응답 검증기가 전달 전에 포착할 수 있습니다.
시스템 프롬프트 강화
에이전트가 의도한 대로 동작하도록 하는 가장 효과적인 방법은 뛰어난 시스템 프롬프트를 작성하고 Focus Guardrail을 활성화하는 것입니다. 두 가지를 함께 사용하면 처음부터 에이전트를 올바른 응답으로 유도할 수 있습니다.
시스템 프롬프트를 사용해 에이전트가 해야 할 일과 하지 말아야 할 일에 대한 명시적 지침을 제공할 수 있습니다. 모델은 # Guardrails 제목에 특별히 주의를 기울이도록 조정되어 있습니다. 가장 중요한 동작 규칙에는 이 제목을 사용하세요.
효과적인 시스템 프롬프트 작성에 대한 종합적인 지침은 프롬프팅 가이드를 참조하세요. ElevenLabs 계정 팀도 고품질 시스템 프롬프트를 작성할 수 있도록 지원해 드립니다.
Focus Guardrail: Focus Guardrail은 에이전트의 시스템 프롬프트를 강화하여 응답이 정의한 목표와 지침에 맞게 명확하고 관련성 있으며 일관되도록 돕습니다. 특히 에이전트가 의도한 목표에서 벗어나기 쉬운 길거나 복잡한 대화에서 유용합니다.
시스템 프롬프트 강화와 Focus Guardrail 활성화를 함께 사용하는 것이 에이전트를 올바른 응답으로 유도하는 가장 효과적인 방법입니다.
사용자 입력 검증
Manipulation 가드레일
사용자가 에이전트를 조작하여 지침을 우회하려는 시도를 감지하고 차단합니다. 활성화하면 시스템이 사용자 입력에서 인젝션 또는 지침 재정의 시도를 나타내는 패턴을 분석하고, 보안 위험을 초래하는 대화를 종료할 수 있습니다.
에이전트 응답 검증
Content 가드레일
정치적으로 민감하거나 성적으로 노골적이거나 폭력적인 자료처럼 에이전트 응답에 포함된 부적절한 콘텐츠가 사용자에게 전달되기 전에 플래그를 지정하고 차단합니다. 이를 통해 에이전트의 의도된 사용 사례와 대상에 맞는 적절한 응답을 유지할 수 있습니다.
커스텀 가드레일
에이전트가 영향력이 큰 업무를 맡게 되면서, 팀에는 에이전트 동작에 대한 명확한 제어가 필요합니다. 커스텀 가드레일을 사용하면 비즈니스에 가장 중요한 정책을 구성할 수 있습니다. 예를 들면 다음과 같습니다.
- 소매 지원 에이전트는 환불 대상이 아닌 상품에 대해 환불을 처리해서는 안 됩니다.
- 의료 접수 에이전트는 의학적 조언을 제공해서는 안 됩니다.
- 은행 에이전트는 투자 상품을 추천해서는 안 됩니다.
커스텀 가드레일은 자연어 프롬프트를 사용해 자체 차단 기준을 정의할 수 있는 LLM 기반 규칙입니다. 활성화된 각 커스텀 가드레일은 에이전트 응답을 경량 모델로 전송하며, 이 모델은 규칙에 따라 응답을 평가하고 차단 또는 허용 결정을 반환합니다. 이를 통해 에이전트가 말할 수 있는 내용과 말할 수 없는 내용을 도메인별로 유연하게 제어할 수 있습니다.
각 커스텀 가드레일에서 다음을 정의할 수 있습니다.
커스텀 가드레일은 비즈니스와 관련된 특정 주제를 차단하고, 업계별 규정 준수 요구 사항을 적용하며, 독점적인 안전 조치를 구현하는 데 사용할 수 있습니다. 각 가드레일은 삭제하지 않고 개별적으로 켜거나 끌 수 있으며, 여러 개를 활성화하면 다른 가드레일과 함께 병렬로 실행됩니다. 트리거된 모든 위반은 검토를 위해 기록됩니다.
실행 모드
실행 모드는 사용자가 답변을 보거나 듣기 전에 가드레일이 대기 시간을 추가하는지 결정합니다.
streaming 모드에서는 가드레일이 작동하기 전에 에이전트 응답이 시작될 수 있습니다. 음성의 경우 차단으로 통화가 종료되기 전에 일부 오디오(대개 500ms 미만)가 전달될 수 있습니다. 텍스트 에이전트의 경우 평가가 전달 전에 완료되지 않으면 사용자가 응답의 일부 또는 전체를 볼 수 있습니다.
Blocking 모드에서는 가드레일 검증이 완료된 후에만 에이전트가 응답합니다. 일반적으로 200~500ms의 추가 지연 시간이 발생합니다.
종료 전략
종료 전략을 사용하면 가드레일이 작동했을 때 에이전트가 수행할 작업을 정의할 수 있습니다. 다음 중에서 선택할 수 있습니다.
end_call(기본값): 즉시 통화를 종료합니다.retry: 대화를 중단하는 대신 피드백을 사용해 응답을 다시 생성합니다. 에이전트 응답은 최대 세 번 재시도되며, 모든 시도가 계속 가드레일을 위반하면 통화가 종료됩니다.
재시도는 차단 모드에서만 작동합니다. 스트리밍 모드에서는 통화 종료가 유일하게 사용할 수 있는 종료 전략입니다.
재시도 피드백
재시도 피드백에는 다음 턴에 적용할 모든 지침을 포함할 수 있습니다. 모델이 다시 생성하기 전에 시스템 지침으로 삽입됩니다. 여기에는 transfer_to_agent 또는 transfer_to_number 같은 시스템 도구 호출도 포함됩니다. 재시도 피드백을 구성하는 몇 가지 예시는 다음과 같습니다.
- 일반적인 거절 (기본값)
이 조건/카테고리와 일치하는 콘텐츠를 차단하는 가드레일에 의해 응답이 차단되었습니다: ‘{{trigger_reason}}’ 다음 턴에는 반드시 사용자에게 “죄송하지만 해당 질문에는 답변할 수 없습니다. 다른 내용을 알고 싶으신가요?”라고 말해야 합니다. - 수정 지침을 포함한 재시도
이전 응답은 가드레일에 의해 차단되었습니다. 차단된 응답은 다음과 같습니다: ‘{{agent_message}}’. 다음 턴에는 새 답변을 제공해야 하며, ‘{{trigger_reason}}‘을(를) 위반해서는 안 됩니다. - 다른 에이전트로 전환
이전 응답은 가드레일에 의해 차단되었습니다. 다음 턴에는 transfer_to_agent 도구를 사용하여 에이전트에게 전환해야 합니다. 차단된 응답은 다음과 같습니다: ‘{{agent_message}}’. 가드레일은 이 조건/카테고리와 일치하는 콘텐츠를 차단합니다: ‘{{trigger_reason}}’. - 상담원에게 전환
이 조건/카테고리와 일치하는 콘텐츠를 차단하는 가드레일에 의해 응답이 차단되었습니다: ‘{{trigger_reason}}’. 다음 턴에는 반드시 transfer_to_number 도구를 사용하여 통화를 상담원에게 전환해야 합니다.
재시도 피드백에서 시스템 도구를 사용하려면 에이전트 설정에서 해당 도구를 활성화하고 구성하세요. 에이전트에 설정된 도구만 호출할 수 있습니다.
피드백 텍스트에서 다음 플레이스홀더를 사용할 수 있습니다.
음성 에이전트에는 스트리밍 실행 모드를, 텍스트 에이전트에는 차단 실행 모드를 권장합니다.
차단 모드(특히 재시도 사용 시)는 음성에서 예측 가능성이 낮게 동작할 수 있습니다. 음성에서 차단 모드를 사용한다면 동작을 완전히 확인하거나, 확신이 들 때까지 재시도 대신 통화 종료를 선택하세요.
가격
Focus, Manipulation, Content 가드레일은 모든 ElevenAgents 사용자에게 추가 비용 없이 제공됩니다.
커스텀 가드레일은 사용량 기반이며 ElevenAgents의 다른 모델 호출과 마찬가지로 추가 LLM 비용이 발생합니다. 활성화된 각 커스텀 가드레일은 평가를 위해 모든 에이전트 응답을 경량 모델로 전송하므로, 비용은 프롬프트 길이, 평균 대화 길이 및 대화량에 따라 달라집니다. 여러 커스텀 가드레일을 활성화하면 각 가드레일이 응답마다 자체 평가를 실행합니다. 프로덕션에서 여러 커스텀 가드레일을 활성화하기 전에 예상 트래픽과 모델 선택을 검토하는 것이 좋습니다.
커스텀 가드레일을 생성하거나 수정할 때 프롬프트 아래에서 예상 비용을 확인할 수 있습니다.
재시도 및 비용: 각 시도에는 추가 에이전트 생성과 또 한 번의 가드레일 평가가 필요하므로, 재시도는 end_call에 비해 사용량 기반 청구를 증가시킵니다(차단된 턴당 최대 세 번의 시도).
구성
대시보드에서 구성
CLI에서 구성
API에서 구성
실행 모드 및 종료 전략 구성(커스텀 및 콘텐츠 가드레일)
각 커스텀 또는 콘텐츠 가드레일에서 streaming 또는 blocking 실행 모드를 선택합니다.
Blocking은 text 에이전트에 적합하고, streaming은 voice 에이전트에 적합합니다. **Action on
guardrail violation (trigger_action**에 매핑)을 설정합니다. 어떤 모드에서든 end call을 선택할 수 있으며, retry는
blocking을 선택한 경우에만 사용할 수 있습니다(streaming에서는 retry를 사용할 수 없음). retry를 선택한 경우
모델을 유도할 수 있도록 Feedback to inject when retrying을 수정합니다. 템플릿에서
{{trigger_reason}}(차단을 유발한 커스텀 프롬프트 또는 콘텐츠 카테고리) 및
{{agent_message}} 플레이스홀더를 사용합니다.
가드레일이 트리거되면 유형과 구성에 따라 동작이 달라집니다.
- End call: 세션이 즉시 종료됩니다(음성의 경우 통화 종료, 텍스트의 경우 채팅 종료). 트리거는 대화 기록에 기록됩니다.
- Retry(차단형 커스텀 또는 콘텐츠 가드레일): 위반한 어시스턴트 차례가 제거되고 시스템 피드백이 주입되며, 가드레일이 계속 트리거될 경우 세션이 종료되기 전까지 모델이 최대 3회 다시 시도합니다.
end call의 경우 최종 사용자는 통화가 끊기거나 채팅이 종료된 것으로 경험합니다. 위반 세부 정보는 대화 로그에서 확인할 수 있으며 최종 사용자에게 그대로 표시되지 않습니다.
end call 후 사용자는 새 대화를 시작할 수 있습니다. 가드레일은 사용자를 영구적으로 차단하지 않으며 정책을 위반한 특정 응답(또는 세션)을 차단합니다.
모범 사례
고객 지원 에이전트
커스텀 가드레일을 사용해 비즈니스별 정책을 적용하세요. 예시: - 도구를 통해 자격이 확인되지 않은 경우 환불, 크레딧 또는 구독 변경을 처리하지 못하도록 차단합니다. - 명시적으로 승인되지 않은 경우 할인 또는 프로모션 코드를 제공하지 못하도록 차단합니다. - 로드맵 항목이나 출시되지 않은 기능에 대해 추측하는 응답을 차단합니다.
헬스케어 애플리케이션
커스텀 가드레일을 사용해 의료 관련 경계를 엄격하게 관리하세요. 예시: - 질환을 진단하거나 특정 치료를 권장하지 못하도록 차단합니다. - 의약품 복용량 권장을 차단합니다. - 면허를 보유한 의료 전문가의 조언을 대체하지 못하도록 차단합니다.
교육 콘텐츠
커스텀 가드레일을 사용해 민감한 학술 주제를 관리하세요. 예시: - 유해한 실험이나 안전하지 않은 절차에 대한 단계별 지침을 차단합니다. - 진행 중인 평가나 시험의 정답 생성을 차단합니다. - 학업 부정행위를 조장할 수 있는 콘텐츠를 차단합니다.
내부 엔터프라이즈 도구
커스텀 가드레일을 사용해 회사 운영 및 데이터를 보호하세요. 예시: - 내부 전용 문서나 기밀 프로세스의 공유를 차단합니다. - 비공개 API, 시스템 프롬프트 또는 인프라 세부 정보를 공개하지 못하도록 차단합니다. - 임원 또는 관리자 권한이 필요한 작업을 시뮬레이션하지 못하도록 차단합니다.
현실적인 시나리오로 테스트
배포 전에 다음 항목으로 가드레일 구성을 테스트하세요.
- 오탐이 없는지 확인하기 위한 일반적인 대화 흐름
- 안전 경계에 가까워지지만 넘지는 않는 엣지 케이스
- 유해한 응답을 유도하려는 적대적 프롬프트
자주 묻는 질문
가드레일이 지연 시간에 영향을 주나요?
커스텀 및 콘텐츠 가드레일의 경우 streaming 모드는 추가 지연 시간이 없지만, 가드레일이 트리거되기 전에 응답이 시작될 수 있습니다. Blocking 모드는 에이전트가 응답하기 전에 가드레일을 기다리므로 일반적으로 약 200~500ms의 지연이 발생합니다. Retry는 시도할 때마다 전체 추가 생성(및 재평가)을 수행하며, 차단된 차례당 최대 3회까지 가능하므로 사용량 기반 비용도 증가합니다.
스트리밍 실행 모드와 차단 실행 모드의 차이점은 무엇인가요?
Streaming은 추가 지연 시간이 없지만, 가드레일이 트리거되기 전에 에이전트 응답이 시작될 수 있습니다.
Blocking은 에이전트가 응답하기 전에 가드레일 결과를 기다립니다(일반적으로 200~500ms 지연). 종료 전략으로서의
Retry(trigger_action)는 blocking 모드에서만 사용할 수 있으며, streaming 모드에서는 가드레일이
트리거될 때 end call을 사용합니다. Blocking은 대화를 즉시 종료하는 대신 주입된 시스템 피드백과 함께 retry를
사용할 수 있게 하지만, 재시도가 발생하면 추가 모델 사용량 및 추가 청구가 발생합니다. Blocking은 text 에이전트에,
streaming은 voice 에이전트에 권장됩니다.
가드레일을 완전히 비활성화할 수 있나요?
예. 하지만 모든 가드레일, 특히 Focus Guardrail은 활성화 상태로 유지하는 것을 강력히 권장합니다. 가드레일은 브랜드, 사용자 및 규정 준수 상태를 보호하며, 내부 도구를 포함한 모든 프로덕션 애플리케이션에 권장됩니다. 드문 경우지만 특정 가드레일이 에이전트의 의도된 사용 사례를 방해한다면 비활성화할 수 있습니다. 예를 들어 일부 애플리케이션은 Content Guardrail이 다른 경우에는 플래그를 지정할 주제를 다룰 수 있으며, 고도로 맞춤화된 시스템 프롬프트는 Focus Guardrail을 활성화하면 제대로 작동하지 않을 수 있습니다. 각 가드레일은 개별적으로 켜거나 끌 수 있습니다.
사용자가 가드레일 결정을 이의 제기할 수 있나요?
가드레일 트리거는 기록되며 대화 분석에서 검토할 수 있습니다. 오탐을 발견하면 가드레일 프롬프트를 조정하세요. 자동화된 이의 제기 절차는 없으며, 사용자는 새 대화를 시작하면 됩니다.
어떤 가드레일이 트리거되었는지 어떻게 알 수 있나요?
어떤 가드레일이 트리거되었는지에 대한 정보는 대화 로그에서 확인할 수 있습니다.
가드레일과 시스템 프롬프트 강화 기능을 모두 사용해야 하나요?
예. 두 기능은 상호 보완적인 목적을 제공합니다. 시스템 프롬프트 강화는 행동 지침을 제공하고 지침 준수를 통해 대부분의 문제를 방지합니다. 플랫폼 가드레일은 안전망으로서 독립적인 적용을 제공합니다. 둘 다 사용하면 심층 방어를 구축할 수 있습니다.
다음 단계
- 프롬프팅 가이드: 행동 가드레일을 포함한 효과적인 시스템 프롬프트 작성 방법 알아보기
- 개인정보 보호: 데이터 보존 및 개인정보 보호 설정 구성
- 테스트: 다양한 시나리오로 에이전트 테스트
- 대화 시뮬레이션: 프로그래밍 방식으로 가드레일 구성 테스트
- 대화 기록 비식별화: 대화 기록에서 이름, 은행 정보 등 민감한 정보 비식별화
출시 상태
가드레일은 Focus 및 Manipulation 가드레일을 포함해 정식 출시되었습니다.
Content 및 Custom 가드레일은 알파 단계입니다. 지속적으로 개선하고 있으며, 정식 출시 전까지 기본값, 대시보드 컨트롤 및 API 필드는 계속 변경될 수 있습니다. 일부 변경 사항은 호환성이 깨질 수 있습니다.
Content 또는 Custom 가드레일을 사용한다면 설정을 검증하고, 로그에서 가드레일 동작을 모니터링하며, 업데이트가 출시될 때 구성을 다시 검토하는 것을 권장합니다.