대화형 AI 디자인: 더 인간적인 사용자 경험 만들기
- 게시일
예전의 대화형 AI 디자인은 결정 트리를 만드는 것이었습니다. 초기 챗봇과 IVR 메뉴는 미리 정해진 분기대로만 작동했죠. 예를 들어 1번을 누르면 결제, '예' 또는 '아니오'라고 말하면 되고, 고객의 질문이 미리 예상한 경로와 일치하기만을 바랐습니다. 이런 방식은 대화가 이미 만들어둔 범위 안에서만 이루어질 때만 효과가 있었습니다.
AI 에이전트는 이런 한계를 없앴습니다. 이제는 실시간으로 대화를 이해하고, 지식 베이스에서 정보를 가져오고, 도구를 호출하며, 이전에 했던 말을 기억할 수 있어 더 이상 고정된 스크립트에만 의존하지 않습니다.
하지만 이런 변화가 대화형 AI 디자인의 필요성을 없앤 것은 아닙니다. 오히려 기준이 더 높아졌습니다. 더 이상 딱딱한 스크립트에 기대지 못하기 때문에, 에이전트의 페르소나, 워크플로우, 결정 포인트를 잘 정의해야 예측할 수 없는 실시간 대화에서도 자연스럽게 작동할 수 있습니다.
이 가이드에서는 대화형 AI 디자인이 실제로 챗과 보이스 에이전트에서 어떤 의미인지, 왜 이미 중요하게 여기는 지표에 영향을 주는지, 더 자연스럽게 만들기 위해 무엇을 최적화해야 하는지 설명합니다. 제대로 설계하면, 고객과 연결되고 더 빠르고 나은 서비스를 제공하는 AI 에이전트를 도입할 수 있습니다.
요약
- 대화형 AI 디자인은 AI 에이전트의 소통 방식을 구조화하고 최적화해 대화가 자연스럽게 느껴지도록 만드는 것을 의미합니다.
- 보이스 AI는 텍스트보다 더 민감합니다. 챗에서는 잘 느껴지지 않는 음성, 지연, 타이밍 문제가 보이스 대화에서는 로봇처럼 느껴질 수 있습니다.
- ElevenAgents는 음성, 페르소나, 대화 흐름을 제어하고, 모든 채널에서 지연 시간을 최적화할 수 있는 다양한 기능을 통해 인간 같은 AI 음성 및 챗 에이전트를 구현할 수 있도록 설계되었습니다.
대화형 AI 디자인이란?
대화형 AI 디자인은 AI 에이전트의 행동 방식을 설정하는 UX 실천 방법입니다. 페르소나부터 가드레일, 워크플로우, 지식 베이스까지 모든 요소가 함께 작동해 대화가 제품 경험의 다른 부분만큼이나 완성도 있게 느껴지도록 만듭니다.
하지만 이런 설정이 항상 똑같은 것은 아닙니다. 에이전트는 챗, 보이스, SMS 등 여러 채널에서 하나의 설정으로 동작할 수 있습니다. 각 채널마다 제약이 다르지만, 보이스가 가장 까다롭습니다. 보이스가 포함된 경우, 에이전트는 음성을 선택하고, 실시간으로 속도와 순서를 조절하며, 잠깐의 정적이 통화가 끊긴 것처럼 느껴지기 전에 답변을 내보내야 합니다. 챗에서는 약간 느리거나 완벽하지 않은 답변이 대화를 망치지 않지만, 보이스에서는 선택이 아닙니다.
챗 에이전트에 대화형 AI 디자인을 적용할 때 고려해야 할 점과, 여기에 보이스가 추가되면 달라지는 점을 살펴보세요.
고객은 이런 요소들을 의식적으로 평가하지 않습니다. 단지 뭔가 어색하게 느껴지면, 그 느낌만으로도 에이전트 전체에 대한 신뢰가 떨어지고, 처음 도입한 목적 자체가 위협받을 수 있습니다.
좋은 사용자 경험을 위한 대화형 AI 디자인의 중요성
앞서 언급한 턴테이킹, 지연, 페르소나 등 모든 요소는 고객이 브랜드를 인식하는 중요한 순간에 영향을 미칩니다. 이 인식은 팀이 평가받는 지표에 직접적으로 반영됩니다.
- 만족도 및 해결률 향상: 에이전트가 신속하게 응답하고 어색하게 끼어들지 않을 때, 고객은 상호작용을 더 높게 평가합니다.
- 이탈률 감소: 고객이 대화를 중단하는 이유는 단순히 대기 시간이 길어서만이 아닙니다. 통화 중 어색한 정적이나 챗에서 딱딱하고 브랜드와 맞지 않는 답변 등, 기대에 맞지 않는 전달 방식도 대화를 끝내고 싶게 만듭니다.
- 더 빠른 문제 해결: 명확한 대화 흐름 설정과 잘 설계된 워크플로우는 막다른 길, 반복 질문, '다른 담당자에게 연결해드릴게요' 같은 상황을 줄여줍니다.
- 사람 상담원으로의 이관 감소: 에이전트가 자연스럽게 대화 흐름을 관리하고 정해진 워크플로우를 따르면, 고객이 혼란스러워서 사람을 찾는 대신 처음부터 더 많은 문제를 해결할 수 있습니다.
예를 들어, eDreams ODIGEO는 세계 최대 온라인 여행 플랫폼 중 하나입니다. 이들은 AI 에이전트를 ElevenAgents로 5개 주요 언어에 도입해, 통화 전환율은 두 자릿수 감소, 해결 속도는 두 자릿수 향상이라는 결과를 얻었습니다. 이는 저지연 음성 합성과 통화 시작 시 더 정확한 의도 인식 덕분이기도 합니다. 이런 결과는 대화 디자인 외에도 다양한 변수에 따라 달라지지만, 좋은 대화형 AI 디자인이 어떤 가능성을 여는지 보여줍니다.
ElevenAgents에서의 대화형 AI 디자인 작동 방식
ElevenAgents에서는 페르소나, 음성, 턴테이킹, 이관, 지연 등 에이전트가 인간처럼 느껴지는 데 중요한 요소들을 최적화할 수 있습니다. 각 요소를 어떻게 설정하고 최적화할 수 있는지 살펴보세요.
페르소나 및 음성 선택
페르소나는 고객의 첫인상을 결정합니다. 맞지 않는 페르소나는 대화가 시작되기도 전에 신뢰를 떨어뜨립니다. 예를 들어, 친근한 리테일 브랜드에 너무 딱딱한 페르소나가 적용되면, 고객은 에이전트가 유용한 답을 하기 전부터 의심하게 됩니다. 페르소나는 시스템 프롬프트에서 역할, 성격, 가드레일을 먼저 정의하는 것부터 시작하세요.
보이스 에이전트의 경우, 페르소나가 음성에도 그대로 드러나야 합니다. 금융 상담에 너무 캐주얼한 목소리는, 텍스트에서 맞지 않는 페르소나가 주는 신호와 같습니다. 그래서 음성 선택도 같은 맥락에서 중요합니다. 시작 방법은 다음과 같습니다:
- 음성 선택: 브랜드, 대상 고객, 주제에 맞는 음성을 선택하세요. 억양, 성별, 톤 모두가 신뢰를 쌓고 대화의 분위기를 만듭니다.
- 다국어 지원: 지원하는 각 언어마다 음성을 따로 선택하세요. 한 가지 음성을 모든 언어에 적용하면, 최소 한 언어에서는 어색하게 들려 신뢰를 떨어뜨릴 수 있습니다.
ElevenAgents에서는 보이스 라이브러리에서 억양, 캐릭터, 용도별로 검색 가능한 11,000개 이상의 음성을 제공합니다. 그래서 처음부터 새로 시작할 필요가 거의 없습니다. 원하는 음성이 없다면, 짧은 오디오 샘플로 기존 음성을 복제하거나, 텍스트 프롬프트로 직접 디자인해 나이, 억양, 톤, 속도를 지정할 수도 있습니다.
대화 흐름 설정
보이스에서는 대화가 가장 엄격한 타이밍에 맞춰 진행됩니다. 챗에서는 잠깐의 정적이 그냥 빈 공간이지만, 통화에서는 리듬이 끊기면 바로 정적이나 끊긴 통화로 느껴집니다. 이 리듬을 맞추는 것이 보이스 에이전트를 자연스럽게 만드는 가장 중요한 요소이며, 턴테이킹 모델에서 시작됩니다.
ElevenLabs의 턴테이킹 모델은 실제로 화자가 말을 끝냈는지, 잠시 멈춘 것인지를 감지하도록 연구 기반으로 설계되었습니다. 덕분에 에이전트가 고정된 지연이 아니라 실제로 응답해야 할 때를 정확히 판단할 수 있습니다.
여기에 더해, 대화 흐름을 맞추기 위해 조정할 수 있는 설정은 다음과 같습니다:
- 턴 타임아웃: 에이전트가 응답 전 얼마나 침묵을 유지할지 설정합니다. 고객이 아직 생각 중일 때 너무 빨리 끼어들지 않게 하고, 다 말한 뒤에는 오래 기다리게 하지 않습니다.
- 소프트 타임아웃: 처리 중 잠깐 멈출 때 에이전트가 사용하는 짧은 연결 문구입니다. 예를 들어 '잠시만요', '확인해볼게요'처럼, 고객이 통화가 끊겼다고 느끼지 않게 해줍니다. 실제 응답 시간이 달라질 수 있으니 '1초만요'처럼 구체적인 시간 약속은 피하세요.
- 중간 끼어들기: 고객이 말을 시작하면 에이전트가 말을 멈출지 여부입니다. 자연스러운 대화를 원하면 활성화하세요. 법적 고지, 안전 안내 등 반드시 끝까지 들어야 하는 경우에는 비활성화하세요.
- 턴 적극성: 고객이 말을 멈추면 에이전트가 얼마나 빨리 응답할지 설정합니다. '적극적'은 빠른 응답이 중요한 고객센터에 적합하고, '여유로움'은 전화번호나 이메일 등 정보를 받을 때 중간에 끊지 않도록 좋습니다. 일반 대화에는 '보통'이 기본값으로 적합합니다.
여기서의 작은 조정도 큰 차이를 만듭니다. 타임아웃을 조금만 바꿔도, 에이전트가 세심하게 반응하는지, 아니면 말을 끊는 것처럼 느껴지는지가 달라집니다.
워크플로우, 이관 설계, 스크립트 작성
워크플로우는 ElevenAgents에서 대화형 AI 디자인이 실제로 구현되는 핵심입니다. 언제, 무엇을 할지, 결정 포인트, 이관 경로, 모든 상황을 미리 정의해 에이전트가 즉흥적으로 처리하지 않도록 합니다.
워크플로우는 두 가지 시스템과 함께 에이전트를 더 정교하게 만듭니다. 시스템 프롬프트에서는 에이전트의 역할, 톤, 인사말이나 이관 등 중요한 순간에 할 말과 하지 않을 말을 정의합니다.프로시저는 고객 신원 확인, 반품 안내 등 단일하고 명확한 작업에 적합한 더 엄격한 옵션입니다. 고객의 답변에 따라 분기하지 않고, 대화가 어떻게 흘러가든 처음부터 끝까지 정해진 순서대로 진행합니다.
에이전트 구축을 시작하는 가장 쉬운 방법은 사전 제작된 에이전트 템플릿을 사용하는 것입니다. 워크플로우와 시스템 프롬프트가 기본으로 제공되어, 처음부터 새로 만드는 대신 세부 조정만 하면 됩니다. 다음은 이 템플릿을 내 상황에 맞게 바꿀 수 있는 예시입니다:
- 결정 맵핑: 에이전트가 각 결정 포인트에서 무엇을 할지 정확히 설계해, 대화 전체가 시작부터 해결까지 모두 정의되도록 하세요. 서브에이전트 노드를 사용하면, 흐름 중 특정 지점에서 시스템 프롬프트, 모델, 음성까지 따로 조정할 수 있습니다. 예를 들어, 민감한 인증 단계는 통화 초반의 가벼운 대화보다 더 엄격한 가드레일로 운영할 수 있습니다.
- 이관 트리거: 이관 기준을 워크플로우에 명확히 정의하세요. 예를 들어, 두 번 시도해도 해결되지 않거나, 고객이 관리자 연결을 요청하거나, 민감하거나 고가의 거래일 때는 반드시 사람에게 이관하도록 설정합니다.
- 이관 컨텍스트: 시스템 프롬프트에서 이관 전 에이전트가 수집해야 할 정보(주문번호, 계정번호 등)와 이관 조건을 정의하세요. 그런 다음 이 정보를 이관 도구 설정에 매핑해, 고객이 사람 상담원에게 같은 말을 반복하지 않아도 자동으로 전달되게 하세요.
- 스크립트 문구: 시스템 프롬프트에서 중요한 순간에 사용할 정확한 문구를 정의하세요. 인사말, 오류 메시지, 법적 고지, 이관 안내 등은 즉흥적으로 맡기지 말고, '지금 해당 정보를 불러올 수 없습니다'처럼 명확한 문장을 지정하는 것이 더 신뢰할 수 있습니다.
워크플로우는 ElevenAgents에서 시각적 그래프로 구성되어, 각 결정 포인트와 이관 트리거를 직접 보고 수정할 수 있습니다.

실제 운영 시에는 분석 데이터가 같은 그래프에 오버레이되어, 고객이 어디서 막히거나 이탈하는지 바로 확인하고, 추측 없이 개선할 수 있습니다.
지연 및 성능
지연은 상호작용이 인간적으로 느껴지는지 아닌지에 가장 큰 영향을 주는 요소 중 하나입니다. 응답이 느리면, 대화가 아무리 잘 진행되어도 고객은 기계와 대화하고 있다는 사실을 바로 인식하게 됩니다.
에이전트가 챗이든 보이스든, 파이프라인의 모든 단계마다 지연이 추가됩니다. 일부는 두 방식 모두에 적용되고, 일부는 보이스에서만 해당됩니다.
- LLM: 모델 선택은 비용, 추론 품질, 속도 간의 균형입니다. FAQ나 예약 확인처럼 단순하고 자주 쓰는 대화는 빠르고 가벼운 모델로도 충분합니다. 금융 상담이나 복잡한 문제 해결처럼 더 어려운 작업은, 약간 느리더라도 더 강력한 추론 모델을 쓰는 것이 보통 더 낫습니다.
- 지식 베이스 및 RAG: 지식 베이스를 조회할 때마다 한 번의 왕복 시간이 추가됩니다. 범위가 넓은 지식 베이스보다, 꼭 필요한 정보만 담긴 간결한 지식 베이스가 더 빠르게 응답합니다.
- 통합 및 도구 호출: Salesforce에서 주문을 조회하거나 캘린더에서 일정 확인 등 외부 도구를 호출할 때마다 별도의 왕복 시간이 추가됩니다. 도구 설명을 명확히 작성해 에이전트가 어떤 도구를 쓸지 망설이지 않게 하고, 실제 대화에 필요한 도구만 호출하세요.
- 지역 및 데이터 호스팅: ElevenAgents의 지역을 데이터가 호스팅된 위치와 맞추고, 전화 기반 배포라면 통신사(Twilio, SIP 등) 지역도 일치시키세요. 에이전트와 콜 게이트웨이의 지역이 멀리 떨어져 있으면, 대화 시작 전부터 지연이 발생할 수 있습니다.
- 음성 인식(보이스 전용): Scribe가 고객의 말을 실시간으로 받아 적어야 에이전트가 추론을 시작할 수 있습니다. 실시간 대화에는 Scribe v2 Realtime을 사용하고, 배치 버전은 속도보다 정확도가 중요한 경우에만 사용하세요.
- 턴테이킹(보이스 전용): 에이전트가 언제 응답할지 결정하는 단계로, 위에서 자세히 설명했습니다. 턴 종료 감지에 망설이면 파이프라인 전체가 시작되기 전부터 지연이 추가되니, 별도의 지연 요소로 꼭 기억하세요.
- 텍스트 음성 변환 및 음성 선택(보이스 전용): 기본 및 합성 음성, 인스턴트 음성 복제는 프로페셔널 음성 복제보다 더 빠르게 응답합니다. 더 높은 음질이 꼭 필요할 때만 프로페셔널 음성 복제를 사용하세요.
지연에 대해 더 자세히 알고 싶다면 지연 최적화 모범 사례와 지연 측정 및 보고 방법을 참고하세요.
ElevenAgents로 첫 에이전트 디자인하기
여기서 다룬 요소들이 실제로 AI 에이전트에서 대화형 AI 디자인이 의미하는 바입니다. 이 모든 기능은 ElevenAgents에 기본 내장되어 있고, 코드 없이 콘솔에서 설정할 수 있어, 단순히 답만 하는 것이 아니라 실제로 대화하는 에이전트를 만들 수 있습니다.
직접 구축하든, 지원을 받든, ElevenLabs의 Forward Deployed Engineers가 팀과 함께 기획, 구축, 배포까지 직접 참여하고, 운영 후에도 성능을 계속 개선해드립니다.
직접 만들든, 지원을 받든, 가장 빠르게 차이를 확인하는 방법은 직접 써보는 것입니다. 오늘 바로 에이전트 만들기 또는 영업팀과 상담하기로 시작해보세요.



.webp&w=3840&q=80)
