Eleven v4를 소개합니다역대 가장 감성적인 모델, Eleven v4를 만나보세요. 10월 12일까지 Creator+에 크레딧 3배 제공

콘텐츠로 건너뛰기

웨비나 다시 보기: 유럽 최대 보험사 중 하나가 AI 에이전트를 프로덕션에 도입한 방법

작성자
Anna Neely
게시일
최종 업데이트

듣기이 글 오디오로 듣기

보험 고객은 일이 잘 풀릴 때는 좀처럼 전화를 하지 않습니다. 사고가 났을 때, 보험금을 청구할 때, 또는 진정한 위기 상황에 처했을 때 전화를 합니다. 이 대화는 이후의 모든 과정을 좌우하며, 고객이 보험사와 나누는 유일한 실질적 접점인 경우도 많습니다.

Admiral은 영국, 이탈리아, 프랑스, 스페인에서 매년 수백만 건의 이러한 대화를 처리합니다. 이제 AI 에이전트를 활용해 규정을 준수하면서 이러한 대화를 처리하고 있습니다. 

이 웨비나에서 Admiral 팀은 그 과정을 소개했습니다. 첫 번째 사용 사례를 선정하고, 첫날부터 법무 및 컴플라이언스 팀을 참여시키며, 작동하는 프로토타입에서 몇 주가 아닌 몇 시간 만에 배포되는 프로덕션 변경 사항으로 발전시킨 방법입니다.

핵심 요점

  • 범위는 좁게 잡되, 실제 문제를 다루세요. Admiral의 첫 프로덕션 사용 사례인 영국 대출 사업의 합의 견적은 현실적인 일정 안에 배포할 만큼 범위가 제한적이면서도 전화 시스템 및 백엔드 통합을 포함해, 모든 문제를 한꺼번에 해결하지 않고도 아키텍처를 검증할 수 있었습니다.
  • 확장하기 전에 기준을 높이세요. 낮추지 마세요. Admiral은 첫날부터 프로덕션을 염두에 두고 구축했으며, 기술 발전 속도에 맞춰 거버넌스 주기를 재설계하고, 명확하게 범위를 정한 파일럿에 법무 및 컴플라이언스 팀을 첫날부터 참여시켰습니다.
  • 규제는 최소 기준일 뿐, 설계의 전부가 아닙니다. Admiral은 규제 요건에 자체 내부 규칙을 더하고, 입증 가능해야 하는 모든 사항에는 결정론적 로직을 사용하며, 취약하거나 심리적으로 힘든 고객은 상담원에게 연결합니다.
  • 진짜 일은 프로덕션에서 시작됩니다. 모든 에이전트 변경 사항은 전체 시뮬레이션 테스트 스위트를 거치며, 트래픽의 1%에서 시작해 100%까지 단계적으로 배포됩니다. 이 주기는 몇 주에서 몇 시간으로 단축되었습니다.

범위는 좁게, 너무 좁지는 않게

Admiral의 첫 프로덕션 사용 사례는 영국 대출 사업의 합의 견적이었습니다. 목록에서 가장 어려운 문제를 고르기보다 의도적으로 통제된 출발점을 택한 것입니다. Kampa는 확장하기 전에 한 국가와 한 사업 부문을 선택해 실험하는 접근 방식이라고 설명했습니다.

Neely는 이것이 프로덕션에 도달하는 배포와 중단되는 배포를 가르는 패턴이라고 말했습니다. 사용 사례는 현실적인 일정 안에 해결할 수 있을 만큼 범위가 좁아야 하지만, 주변 시스템을 실제로 검증할 만큼은 복잡해야 합니다. 합의 견적은 대화 경로가 제한되어 있으면서도 전화 시스템과 백엔드 통합을 거치기 때문에 효과적이었습니다. 모든 것을 한꺼번에 해결하려 하지 않고도 아키텍처를 검증할 수 있었습니다.

이 선택에서 중요했던 몇 가지 요소는 다음과 같습니다.

  • 제한된 범위, 실제 복잡성. 사용 사례에는 단순히 스크립트화된 이상적인 경로가 아니라 전화 시스템과 백엔드 통합을 테스트할 수 있을 만큼의 변수가 필요합니다.
  • 빠른 프로덕션 전환. 개발 중인 빌드가 오래 머무를수록, 에이전트를 실제로 개선하는 피드백을 실제 대화에서 얻기까지 더 오래 걸립니다. Neely는 이를 실제 고객이 시스템과 대화하기 시작한 뒤에야 드러나는 부분인 '마지막 20%'라고 불렀습니다.
  • 처리량과 영향력을 함께 고려. Admiral은 대기 시간을 줄이고 더 빠른 해결을 통해 고객 경험을 눈에 띄게 개선할 수 있는 단순하고 처리량이 많은 상호작용부터 시작했습니다.

확장하기 전에 기준을 낮추지 말고 높이세요

Admiral 경영진은 AI 에이전트가 컴플라이언스와 테스트의 기준을 낮추는 것이 아니라 높여야 한다는 점을 분명히 했습니다. Kampa는 이를 직접적으로 설명했습니다. 에이전트가 스크립트에서 벗어나거나 규칙을 위반할 위험은 사람이 판단을 내리는 경우와 성격이 다르므로, 검증 기준은 이전보다 더 엄격해야 합니다.

이 기준은 팀이 초기에 세운 세 가지 약속에 반영되었습니다.

  • 개념 증명이 아닌 프로덕션을 위해 구축. Kampa는 확장되지 못할 작은 실험을 운영하기보다, 첫날부터 실제 서비스 출시를 목표로 설계하라고 팀에 지시했습니다.
  • 기술 발전 속도에 맞춰 움직이는 거버넌스. Kampa는 무언가를 승인하는 데 6개월이 걸리는 거버넌스 프로세스는 출시 시점에 이미 구식이 된 기술을 승인할 위험이 있다고 지적했습니다. Admiral은 기반 모델과 도구가 변화하는 속도에 맞춰 검토 주기를 재설계했습니다.
  • 첫날부터 법무 및 컴플라이언스 참여. 법무 및 컴플라이언스 팀이 언제 프로젝트에 참여했는지 묻자 Kampa와 Clark은 즉시 첫날이라고 답했습니다. 포괄적인 승인 요청이 아니라 명확하게 범위를 정한 파일럿(정해진 통화 수)으로 시작했습니다.

규제를 최소 기준으로 삼되, 설계의 전부로 삼지는 마세요

Clark는 고객에게 AI와 대화 중임을 알리고 일부 관할권에서는 상담원 연결을 제공하는 등의 규제 요건이 영국, 이탈리아, 프랑스, 스페인마다 다르다고 분명히 밝혔습니다. Admiral은 이러한 차이를 처리하도록 에이전트를 구축하는 동시에, 해결 가능한 대화에서 특정 발신자가 '상담원 연결'만으로 빠져나가지 않도록 했습니다.

일부 대화는 에이전트가 전혀 처리하지 않습니다. Admiral은 취약하거나 심리적으로 힘든 고객을 상담원에게 연결하며, AI는 이러한 전환을 유발하는 신호를 감지하도록 학습되었습니다.

Kampa는 더 광범위한 접근 방식을 계층형으로 설명했습니다. '규제는 최소 기준일 뿐'이며, 그 위에 Admiral의 자체 내부 규칙과 문화적 기준이 더해집니다. 때로는 규제가 요구하는 수준을 넘어섭니다.

이러한 계층 구조는 Admiral이 결정론적 로직과 비결정론적 로직을 어디에 사용할지도 결정했습니다. Clark는 비결정론적 추론이 발신자의 의도를 이해하거나 심리적 고통을 감지하는 데 적합한 반면, 비즈니스상 입증 가능해야 하는 사항, 필수 규제 고지, 또는 고객이 반드시 따라야 하는 경로는 에이전트의 임의 판단을 전혀 허용하지 않는 결정론적 방식으로 작동해야 한다고 설명했습니다.

Neely는 ElevenLabs의 workflow 구조가 이를 실무에서 어떻게 지원하는지 설명했습니다. 에이전트는 전문화된 하위 에이전트 집합으로 구축되며, 인증과 같은 결정론적 게이트가 조건 충족 여부에 따라 기능을 허용하거나 제한합니다. 모델이 무엇을 할 수 있는지 스스로 추론하도록 맡기지 않습니다.

프로세스를 소유한 사람들과 함께 구축하세요

Admiral과 ElevenLabs는 비즈니스 요구 사항을 엔지니어링 팀에 전통적으로 넘기는 방식 대신, 사용 사례를 잘 아는 사람들, 엔지니어링 팀, 전화 시스템 팀을 한자리에 모은 현장 워크숍을 진행했습니다. Neely는 첫 워크숍에서 4~5시간 만에 백엔드와 전화 시스템에 연결된 작동 가능한 에이전트 v0를 만들었고, Kampa와 Clark는 이를 내부에 시연해 개발을 계속할 승인을 받을 수 있었다고 말했습니다.

Clark는 이러한 긴밀한 협업이 첫 프로토타입 이후에도 중요했다고 말했습니다. 워크숍이 플랫폼을 낯선 새 프로세스를 도입하는 도구가 아니라 기존 비즈니스 프로세스를 옮기는 방식으로 다뤘기 때문에, 이제 비즈니스 책임자는 기술에 충분히 가까이 다가가 일부 변경을 직접 할 수 있습니다. Kampa는 이를 더 넓은 의미의 변화 관리와 연결했습니다. 리더, 중간 관리자, 현장 직원을 초기에 프로세스에 참여시켜 기술이 부수 프로젝트가 아니라 실제 비즈니스 운영 방식의 일부가 되도록 한 것입니다.

진짜 일은 프로덕션에서 시작됩니다

출시 후 Admiral은 크고 작은 모든 에이전트 변경 사항을 동일하게 다룹니다. 고객에게 도달하기 전에 전체 시뮬레이션 테스트 스위트를 실행하는 브랜치로 취급합니다. Clark는 트래픽의 1%에서 배포를 시작하고 고객 만족도 및 해결률 지표를 실시간으로 관찰한 뒤, 수치가 유지되면 100%까지 확대한다고 설명했습니다. 이 주기는 몇 주에서 몇 시간으로 단축되었습니다.

이 반복 과정에서 두 가지 교훈이 특히 두드러졌습니다.

  • 단어만이 아니라 언어 자체를 현지화하세요. Admiral은 처음에 모든 프롬프트와 workflow를 영어로 작성했고, 프랑스, 스페인, 이탈리아에서의 성과가 영국과 일치하지 않는다는 사실을 확인했습니다. 영어에서 번역하는 대신 각 시장의 언어로 프롬프트를 새로 작성하자, 현지 고객의 기대와 문화에 맞는 응답을 만들 수 있었습니다.
  • 시뮬레이션 테스트는 형식적으로 하지 말고 진지하게 수행해야 합니다. Neely는 몇 개의 시뮬레이션 테스트를 통과하는 프롬프트를 작성하는 일은 쉬워 보이지만, 에이전트에 실질적인 부담을 주는 테스트 스위트를 구축하고 명확한 성공 기준을 사전에 정의하는 일이 더 어렵고 중요하다고 말했습니다. Admiral은 이제 모든 변경 사항을 배포하기 전에 수백 건에서 수천 건의 시뮬레이션 대화를 실행합니다.

성과 측면에서 Kampa는 처리 시간을 가장 두드러진 지표로 꼽았습니다. AI 주도 대화는 시스템이 로드되는 동안 침묵이 발생하지 않기 때문에, 사람 주도 대화보다 같은 해결책에 더 빠르게 도달하는 경우가 많습니다. 또한 한 번의 큰 도약이 아니라 반복적인 테스트와 조정을 통해 시장별로 CSAT와 해결률이 점진적으로 상승했다고 설명했습니다.

시작하는 팀이 여기서 얻을 점

이 작업을 시작하는 팀을 위한 Neely의 조언은 명확합니다. 범위가 잘 정의된 사용 사례 하나를 선택해 빠르게 프로덕션에 배포하고, 출시 전 테스트를 더 늘리기보다 실제 고객 대화가 엣지 케이스를 찾아내게 하라는 것입니다. Clark는 양쪽의 통합, 즉 전화 시스템과 내부 시스템 통합이 검증되면 팀이 이미 어떤 평가와 지표가 중요한지 알고 있으므로 추가 사용 사례로 확장하는 속도가 점점 빨라진다고 덧붙였습니다.

Kampa의 마지막 메시지는 더 먼 미래를 바라봤습니다. 목표는 대화를 자동화하는 데 그치지 않고, 실시간 트랜스크립트, 최적의 다음 조치 프롬프트, 교육 시뮬레이션을 통해 같은 AI 레이어로 상담원을 직접 지원하는 데까지 확장됩니다.

진행자가 요약했듯이, 이 대화의 핵심은 규제와 AI가 서로 충돌하지 않는다는 점입니다. 첫날부터 감사 가능성, 일관성, 상담원 연결을 고려해 구축함으로써 Admiral의 에이전트는 더 엄격해졌지, 그렇지 않은 것이 아닙니다.

전체 세션 시청

여기에서 전체 세션을 시청하세요. 라이브 빌드와 청중 Q&A도 포함되어 있습니다.

작성자

Anna Neely

Anna Neely

Enterprise - Deployment

Anna Neely focuses on product strategy and partners with enterprise customers on solution design and implementation

유사한 기사

최고 품질의 AI 오디오로 창작하세요