대화형 AI 디자인: 더 인간적인 사용자 경험 만들기
- 게시일
- 최종 업데이트
대화형 AI 디자인은 한때 의사결정 트리를 구축하는 일을 뜻했습니다. 초기 챗봇과 IVR 메뉴는 미리 작성된 경직된 분기 방식으로 작동했습니다. 청구 문의는 1번을 누르고, "예" 또는 "아니요"라고 말한 뒤, 고객의 질문이 예상해 둔 경로 중 하나와 맞기를 바라는 식이었습니다. 이 모델은 대화가 이미 구축해 둔 범위 안에 머무를 때만 작동했습니다.
AI 에이전트는 이러한 제약을 없앴습니다. 이제 실시간으로 대화를 추론하고, 지식 베이스에서 정보를 가져오며, 도구를 호출하고, 이미 나눈 내용을 기억할 수 있으므로 고정된 스크립트에 더 이상 제한되지 않습니다.
하지만 이러한 변화가 대화형 AI 디자인의 필요성을 없앤 것은 아닙니다. 오히려 기준을 높였습니다. 의지할 경직된 스크립트가 없는 만큼, 에이전트의 페르소나, 워크플로, 의사결정 지점은 미리 정해진 대화가 아닌 개방형 실시간 대화에서도 원활히 작동하도록 충분히 잘 정의되어야 합니다.
이 가이드에서는 채팅과 음성 에이전트를 위한 대화형 AI 디자인이 실제로 무엇을 의미하는지, 이미 평가받고 있는 지표에 왜 중요한지, 더 자연스럽게 만들기 위해 무엇을 최적화해야 하는지 설명합니다. 이를 제대로 구현하면 고객과 연결되고 더 빠르고 나은 서비스를 제공하는 AI 에이전트를 배포할 수 있습니다.
요약
- 대화형 AI 디자인은 대화가 자연스럽게 느껴지도록 AI 에이전트의 커뮤니케이션 방식을 구성하고 최적화하는 것을 말합니다.
- 음성 AI는 텍스트보다 허용 범위가 좁습니다. 채팅 인터페이스에서는 눈에 띄지 않는 음성, 지연 시간, 타이밍 문제가 음성 대화에서는 로봇처럼 느껴지게 할 수 있기 때문입니다.
- ElevenAgents는 음성, 페르소나, 대화 흐름을 제어하고 모든 채널의 지연 시간을 최적화할 수 있는 기능을 결합해 사람 같은 AI 음성 및 채팅 에이전트를 만들도록 설계되었습니다.
대화형 AI 디자인이란?
대화형 AI 디자인은 AI 에이전트의 행동 방식을 구성하는 UX 작업입니다. 페르소나부터 가드레일, 워크플로, 활용하는 지식 베이스까지 모든 요소가 함께 작동하여 대화가 제품 경험의 다른 어떤 부분만큼이나 완성도 있게 느껴지도록 합니다.
다만 이러한 구성은 모든 환경에서 똑같지 않습니다. 에이전트는 하나의 구성으로 채팅, 음성, SMS 등 여러 채널에서 작동할 수 있습니다. 채널마다 제약이 있지만, 음성에서 제약이 가장 큽니다. 음성이 에이전트 채널 중 하나라면 음성을 선택해 제공하고, 실시간으로 말하는 속도와 발화 순서를 관리하며, 통화가 끊긴 듯한 정적이 느껴지기 전에 응답해야 합니다. 약간 느리거나 완벽하지 않은 응답도 상호작용을 거의 망치지 않는 채팅과 달리, 음성에서는 이런 요소가 선택 사항이 아닙니다.
채팅 에이전트에 대화형 AI 디자인을 구현할 때 고려할 사항과 음성이 추가하는 요소를 살펴보겠습니다.
고객은 이러한 요소를 하나하나 의식적으로 평가하지 않습니다. 다만 무언가 어색하다고 느끼며, 그 느낌만으로도 에이전트 전체에 대한 신뢰가 약화되어 처음에 배포한 목적을 위협할 수 있습니다.
좋은 사용자 경험에 대화형 AI 디자인이 중요한 이유
발화 순서부터 지연 시간과 페르소나까지 위에서 다룬 모든 요소는 고객이 지지자가 될지 비판자가 될지를 가를 수 있는 중요한 순간에 브랜드를 인식하는 방식에 영향을 줍니다. 이러한 인식은 팀의 평가 지표에 직접 반영됩니다.
- 더 높은 만족도 및 해결률: 에이전트가 신속하게 응답하고 어색하게 말을 끊지 않으면 고객은 상호작용을 더 높게 평가합니다.
- 이탈 감소: 고객이 긴 대기 시간 때문에만 대화를 중단하는 것은 아닙니다. 통화 중 어색한 정적이나 채팅의 딱딱하고 브랜드와 맞지 않는 답변처럼 기대에 부합하지 않는 전달 방식도 대화를 끝내고 싶게 만들 수 있습니다.
- 더 빠른 문제 해결: 명확한 대화 흐름 설정과 잘 설계된 워크플로는 막다른 길, 반복 질문, "담당자에게 연결해 드리겠습니다"라는 상황을 줄여 줍니다.
- 상담원 에스컬레이션 감소: 에이전트가 자연스럽게 대화 흐름을 처리하고 정의된 워크플로를 따르면, 고객을 혼란스럽게 해 사람을 요청하게 만드는 대신 첫 시도에서 더 많은 문제를 해결합니다.
예를 들어 eDreams ODIGEO를 살펴보겠습니다. 세계 최대 온라인 여행 플랫폼 중 하나인 이 기업은 AI 에이전트를 ElevenAgents와 함께 5개 핵심 언어에 배포했으며, 저지연 음성 합성과 더욱 정확한 의도 인식을 각 통화 시작 시 활용하여 해결 속도를 두 자릿수 비율로 개선하고 통화 전환율을 두 자릿수 비율로 낮췄습니다. 이러한 결과는 대화 디자인 외에도 많은 변수에 따라 달라지지만, 우수한 대화형 AI 디자인으로 무엇이 가능한지 보여 줍니다.
ElevenAgents에서 대화형 AI 디자인이 작동하는 방식
ElevenAgents에서는 에이전트가 사람처럼 느껴지는지를 결정하는 페르소나, 음성, 발화 순서, 핸드오프, 지연 시간 등의 요소를 최적화할 수 있습니다. 실제 대화에서 에이전트가 제 역할을 하도록 각 요소를 구성하고 최적화하는 방법을 알아보겠습니다.
페르소나 및 음성 선택
페르소나는 고객의 첫인상을 결정하며, 어울리지 않으면 대화가 시작되기도 전에 신뢰를 약화시킵니다. 친근한 리테일 브랜드에 지나치게 딱딱한 페르소나를 사용하면, 고객은 에이전트가 유용한 말을 하기도 전에 의심하게 됩니다. 시스템 프롬프트에서 에이전트의 역할, 성격, 가드레일을 정의하며 페르소나를 먼저 설계하세요.
음성 에이전트에서는 그 페르소나가 음성에도 드러나야 합니다. 금융 관련 통화에 너무 가벼운 음성을 사용하면 텍스트에서 페르소나가 맞지 않을 때와 같은 인상을 주므로, 음성 선택도 같은 작업의 일부가 됩니다. 다음부터 시작해 보세요.
- 음성 선택: 브랜드, 대상 고객, 주제에 맞는 음성을 선택하세요. 억양, 성별, 톤은 특정 발신자와 신뢰를 쌓고 대화의 분위기를 설정하는 데 도움이 됩니다.
- 다국어 지원: 시장 전반에 하나의 음성을 기본값으로 적용하기보다 지원하는 각 언어에 맞는 음성을 선택하세요. 하나의 음성을 여러 언어에 억지로 적용하면 적어도 한 언어에서는 어색한 외국어 억양처럼 들리기 쉬워, 쌓으려는 신뢰를 약화시킵니다.
ElevenAgents에서는 보이스 라이브러리에서 억양, 캐릭터, 사용 사례별로 검색할 수 있는 11,000개 이상의 음성을 제공하므로, 처음부터 시작할 일은 드뭅니다. 맞는 음성이 없다면 두 가지 선택지가 더 있습니다. 짧은 오디오 샘플로 기존 음성을 복제하거나 처음부터 음성 디자인하기를 통해 원하는 연령, 억양, 톤, 말하는 속도를 설명하는 텍스트 프롬프트로 만들 수 있습니다.
대화 흐름 설정
음성은 가장 엄격한 시간 제약 속에서 대화가 이루어지는 채널입니다. 잠시 멈춰도 그저 빈 공간으로 느껴지는 채팅과 달리, 통화에서 리듬이 끊기면 곧바로 정적이나 연결 끊김으로 인식됩니다. 이러한 리듬을 제대로 맞추는 것은 음성 에이전트를 자연스러운 대화 참여자처럼 느끼게 하는 가장 큰 요소이며, 발화 순서 모델 자체에서 시작됩니다.
ElevenLabs의 발화 순서 모델은 화자가 단순히 잠시 멈춘 것이 아니라 실제로 말을 마쳤는지 감지하도록 구축된 연구 기반 시스템입니다. 이를 통해 고정된 지연 시간을 기준으로 추측하는 대신 에이전트가 언제 응답해야 하는지 판단할 수 있습니다.
이와 함께 대화 흐름을 올바르게 설정하기 위해 조정할 수 있는 항목은 다음과 같습니다.
- 턴 타임아웃: 에이전트가 응답하기 전 침묵 상태로 기다리는 시간입니다. 고객이 아직 생각 중일 때 끼어들거나, 고객이 말을 마친 뒤 너무 오래 기다리게 하지 않습니다.
- 소프트 타임아웃: "잠시만요" 또는 "확인해 보겠습니다"처럼 처리 중 발생하는 공백을 메우기 위해 에이전트가 사용하는 짧은 필러 문구입니다. 고객이 통화가 끊겼다고 생각하지 않도록 합니다. 실제 응답 시간은 달라질 수 있으므로 "1초만요"처럼 특정 시간을 약속하는 필러 문구는 피하세요.
- 인터럽션: 고객이 에이전트의 말에 겹쳐 말하기 시작할 때 에이전트가 말을 멈출지 결정합니다. 자연스러운 대화를 위해서는 활성화하세요. 법적 고지, 안전 지침, 또는 전체 내용을 반드시 들어야 하는 경우에는 비활성화하세요.
- 응답 적극성: 고객이 말을 멈춘 후 에이전트가 얼마나 빠르게 응답을 시작하는지입니다. 빠른 응답이 가장 중요한 고객 서비스에는 "적극적"이 적합합니다. 전화번호나 이메일 주소처럼 고객 정보를 수집할 때는 숫자를 말하는 중간에 끊지 않도록 "여유 있게"가 가장 적합합니다. 일반적인 대화에는 "보통"이 좋은 기본값입니다.
이 부분의 작은 조정도 큰 차이를 만듭니다. 타임아웃을 조금만 바꿔도 세심하게 느껴지는 에이전트와 사람의 말을 끊는 것처럼 느껴지는 에이전트의 차이가 될 수 있습니다.
워크플로, 핸드오프 디자인 및 스크립팅
워크플로는 ElevenAgents에서 대화형 AI 디자인의 상당 부분을 실제로 구현하는 곳입니다. 무엇이 언제 일어나는지, 즉 의사결정 지점, 에스컬레이션 경로, 핸드오프 등 에이전트가 즉흥적으로 처리해야 할 모든 사항을 정의합니다.
워크플로는 에이전트를 정교하게 다듬는 두 가지 다른 시스템과 함께 작동합니다. 시스템 프롬프트는 인사나 핸드오프 같은 주요 시점에서 에이전트의 역할, 톤, 말할 내용과 말하지 않을 내용을 비롯한 핵심 행동을 정의합니다. 절차는 고객 신원 확인이나 반품 안내처럼 단일하고 명확하게 정의된 작업을 위한 더 구체적인 옵션입니다. 고객의 말에 따라 분기하는 대신, 대화가 어떻게 진행되든 처음부터 끝까지 단계별 고정 순서를 따릅니다.
에이전트 구축을 가장 쉽게 시작하는 방법은 사전 구축된 에이전트 템플릿을 사용하는 것입니다. 워크플로와 시스템 프롬프트의 출발점을 모두 제공하므로 처음부터 만드는 대신 세부 조정에 집중할 수 있습니다. 다음과 같은 변경부터 시작해 나만의 템플릿으로 만들어 보세요.
- 의사결정 매핑: 모든 의사결정 지점에서 에이전트가 정확히 무엇을 할지 매핑하여, 시작부터 해결까지 전체 대화를 정의하세요. 서브에이전트 노드를 사용하면 흐름의 특정 지점에서 시스템 프롬프트, 모델, 심지어 음성까지 조정할 수 있으므로, 민감한 인증 단계에는 통화 초반의 가벼운 대화보다 더 엄격한 가드레일을 적용할 수 있습니다.
- 에스컬레이션 트리거: 순간마다 에이전트가 판단하도록 맡기지 말고, 상담원에게 넘길 명확한 트리거를 워크플로에 구축하세요. 예를 들어 두 번 시도한 뒤에도 문제가 해결되지 않거나, 고객이 관리자와의 연결을 요청하거나, 거래가 민감하거나 고액이어서 상담원이 필요한 경우 에스컬레이션하도록 설정할 수 있습니다.
- 핸드오프 컨텍스트: 시스템 프롬프트에서 주문 ID나 계정 번호처럼 에이전트가 연결 전 수집해야 할 정보와 핸드오프를 유발하는 조건을 정의하세요. 그런 다음 저장된 세부 정보를 전송 도구 구성에 매핑하면 고객이 상담원에게 같은 내용을 반복하지 않아도 정보가 자동으로 전달됩니다.
- 스크립트 문구: 시스템 프롬프트에서 중요한 순간에 사용할 정확한 문구를 정의하세요. 시작 인사, 오류 메시지, 법적 고지, 에스컬레이션 핸드오프는 에이전트가 즉석에서 만들어 내도록 두어서는 안 됩니다. 문제가 발생했을 때 에이전트가 표현을 추측하도록 두는 것보다 "현재 해당 정보에 접근하는 데 문제가 있습니다"처럼 정확한 문구를 지정하는 편이 더 안정적입니다.
워크플로는 ElevenAgents에서 시각적 그래프로 구축되며, 각 의사결정 지점과 에스컬레이션 트리거는 직접 확인하고 편집할 수 있는 노드로 매핑됩니다.

운영을 시작하면 분석 기능이 실제 대화 데이터를 동일한 그래프에 오버레이하므로, 고객이 정확히 어디에서 막히거나 이탈하는지 확인하고 추측 없이 해결할 수 있습니다.
지연 시간 및 성능
지연 시간은 상호작용이 사람처럼 느껴지는지를 결정하는 가장 큰 요소 중 하나입니다. 대화의 다른 모든 요소가 잘 작동하더라도, 느린 응답은 고객에게 기계와 대화하고 있음을 가장 빠르게 인식시키는 요인 중 하나입니다.
에이전트가 채팅 또는 음성으로 작동하는지와 관계없이 파이프라인의 모든 부분은 저마다의 지연 시간을 추가합니다. 일부는 두 방식 모두에 적용되고, 다른 일부는 음성이 포함될 때만 적용됩니다.
- LLM: 모든 모델 선택은 비용, 추론 품질, 속도 간의 절충이며, 적절한 균형은 대화에 따라 달라집니다. FAQ나 예약 확인처럼 단순하고 빈도가 높은 상호작용은 경험을 해치지 않으면서 더 빠르고 가벼운 모델로 처리할 수 있습니다. 금융 자문이나 여러 단계의 문제 해결처럼 더 복잡한 작업은 응답이 조금 느려지더라도 일반적으로 더 강력한 추론 모델에 비용을 투자할 가치가 있습니다.
- 지식 베이스 및 RAG: 지식 베이스를 조회할 때마다 에이전트가 응답하기 전에 왕복 시간이 추가되므로, 광범위하게 검색해야 하는 지식 베이스보다 간결하고 집중된 지식 베이스가 더 빠르게 응답합니다.
- 통합 및 도구 호출: Salesforce에서 주문을 조회하거나 캘린더의 일정을 확인하는 것처럼 외부 도구를 호출할 때마다 별도의 왕복 시간이 추가됩니다. 에이전트가 어떤 도구를 호출할지 망설이지 않도록 도구 설명을 명확히 작성하고, 대화에 실제로 필요한 도구만 호출하세요.
- 지역 및 데이터 호스팅: ElevenAgents 리전을 데이터가 호스팅되는 위치에 맞추고, 전화 기반 배포의 경우 통신 제공업체(Twilio, SIP 등)의 리전에도 맞추세요. 에이전트 리전과 통화 게이트웨이 리전이 지구 반대편에 있으면 대화가 시작되기도 전에 그 거리만큼 지연 시간이 추가됩니다.
- 음성-텍스트 변환(음성 전용):Scribe는 에이전트가 추론하기 전에 고객의 말을 텍스트로 변환합니다. 정확도보다 속도에 맞춰 설계된 배치 버전 대신 실시간 대화에는 실시간 버전인 Scribe v2 Realtime을 사용하세요.
- 발화 순서(음성 전용): 에이전트가 응답하기로 결정하는 시점을 정하며, 위에서 자세히 다뤘습니다. 발화 종료를 감지하는 데 주저하는 모델은 나머지 파이프라인이 시작되기 전부터 지연을 더하므로, 그 자체로 지연 시간 요소라는 점을 기억할 필요가 있습니다.
- 텍스트 음성 변환 및 음성 선택(음성 전용):기본 음성과 합성 음성, Instant Voice Clone은 Professional Voice Clone보다 더 빠르게 응답합니다. 추가적인 충실도가 지연 시간의 절충을 감수할 만한 경우에만 Professional Voice Clone을 사용하세요.
지연 시간에 대해 자세히 알아보려면 지연 시간 최적화 모범 사례와 파이프라인 전반에서 지연 시간을 측정하고 보고하는 방식을 확인하세요.
ElevenAgents로 첫 에이전트 디자인하기
여기서 다룬 요소는 AI 에이전트에서 대화형 AI 디자인이 실제로 무엇을 뜻하는지 보여 줍니다. 모든 기능은 ElevenAgents에 기본 제공되며 노코드 콘솔에서 구성할 수 있으므로, 질문에 정확히 답하는 데 그치지 않고 실제 대화를 이어가는 에이전트를 구축할 수 있습니다.
이를 직접 구현하는 데 도움이 필요한 팀을 위해 ElevenLabs Forward Deployed Engineers가 팀과 직접 협력하여 운영 준비가 된 에이전트의 범위를 정하고 구축 및 출시한 뒤, 운영 이후에도 성능을 세부 조정합니다.
직접 구축하든 지원을 받든, 차이를 가장 빠르게 확인하는 방법은 직접 사용해 보는 것입니다. 지금 에이전트 만들기 또는 영업팀에 문의하기로 시작하세요.



