콘텐츠로 건너뛰기

대화형 AI 디자인: 더 인간적인 사용자 경험 만들기

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

대화형 AI 디자인은 과거에는 의사 결정 트리를 만드는 일을 의미했습니다. 초기 챗봇과 IVR 메뉴는 엄격하게 미리 작성된 분기를 기반으로 작동했습니다. 청구 관련 문의는 1번을 누르고, "예" 또는 "아니요"라고 답한 뒤, 고객의 질문이 미리 예상한 경로 중 하나와 맞기를 바라는 방식이었습니다. 이 모델은 대화가 이미 구축한 범위 안에 머무를 때만 작동했습니다.

AI 에이전트는 이러한 제약을 없앴습니다. 이제 실시간으로 대화를 추론하고, 지식 베이스에서 정보를 가져오며, 도구를 호출하고, 앞서 말한 내용을 기억할 수 있으므로 고정된 스크립트에 더 이상 제한되지 않습니다.

하지만 이러한 변화가 대화형 AI 디자인의 필요성을 없앤 것은 아닙니다. 오히려 기준을 높였습니다. 의지할 엄격한 스크립트가 없으므로, 미리 정해진 대화가 아닌 개방형 실시간 대화에서도 잘 작동하도록 에이전트의 페르소나, workflow, 의사 결정 지점을 충분히 명확하게 정의해야 합니다.

이 가이드에서는 채팅과 음성 에이전트를 위한 대화형 AI 디자인이 실제로 무엇을 의미하는지, 이미 평가받고 있는 지표에 왜 중요한지, 그리고 더 자연스럽게 느껴지게 하려면 무엇을 최적화해야 하는지 설명합니다. 제대로 설계하면 고객과 소통하고 더 빠르고 나은 서비스를 제공하는 AI 에이전트를 배포할 수 있습니다.

요약

  • 대화형 AI 디자인은 대화가 자연스럽게 느껴지도록 AI 에이전트의 커뮤니케이션을 구성하고 최적화하는 방식을 말합니다.
  • 음성 AI는 텍스트보다 허용 범위가 좁습니다. 채팅 인터페이스에서는 눈에 띄지 않는 음성, 지연 시간, 타이밍 문제가 음성 대화에서는 로봇처럼 느껴지게 할 수 있기 때문입니다.
  • ElevenAgents는 음성, 페르소나, 대화 흐름을 제어하고 모든 채널의 지연 시간을 최적화할 수 있는 다양한 기능을 통해 사람 같은 AI 음성 및 채팅 에이전트를 구현하도록 설계되었습니다.

대화형 AI 디자인이란?

대화형 AI 디자인은 AI 에이전트의 행동 방식을 구성하는 UX 실무입니다. 페르소나부터 참조하는 가드레일, workflow, 지식 베이스까지 모든 요소가 함께 작동하여, 대화가 제품 경험의 다른 어떤 부분만큼이나 완성도 있게 느껴지도록 합니다.

다만 이 구성은 어디서나 동일하지 않습니다. 에이전트는 하나의 구성으로 채팅, 음성, SMS 등 여러 채널에서 작동할 수 있습니다. 각 채널에는 고유한 제약이 있지만, 음성에서 그 제약이 가장 엄격합니다. 음성이 에이전트 채널 중 하나라면 적절한 음성을 선택해 전달하고, 실시간으로 말의 속도와 턴 전환을 관리하며, 통화가 끊긴 것처럼 느껴지기 전에 응답해야 합니다. 약간 느리거나 완벽하지 않은 응답이 상호작용을 거의 망치지 않는 채팅과 달리, 음성에서는 이 모든 것이 선택 사항이 아닙니다.

채팅 에이전트에 대화형 AI 디자인을 적용할 때 고려해야 할 사항과, 음성에서 추가되는 요소는 다음과 같습니다.

Feature
Chat
Voice
Latency
Small delays are unnoticeable, and there is often more time to think as users type their own answers.
Voice agents have almost no room for delay. A pause that's fine in a chat window reads as dead air on a call, and the customer assumes it dropped.
Persona
Comes through in font, color, and word choice.
Persona also has to come through in accent, pacing, and tone, since the customer hears it instead of reading it.
Conversation flow
Messages simply queue up. No turn-taking, interruption handling, or silence detection needed.
The agent has to decide, in real time, when the customer is done talking and when it’s safe to respond.
Language and accent
The agent just needs to detect and match the right language.
The agent also has to get the accent right, since language detection alone won't catch it.

고객은 이러한 요소를 하나하나 의식적으로 평가하지 않습니다. 그저 무언가 어색하다고 느낄 뿐이며, 그 느낌만으로도 에이전트 전체에 대한 신뢰가 약화되어 처음에 에이전트를 배포한 목적까지 위협할 수 있습니다.

좋은 사용자 경험을 위해 대화형 AI 디자인이 중요한 이유

턴 전환, 지연 시간, 페르소나 등 앞서 다룬 모든 요소는 고객이 지지자가 될지 비판자가 될지를 가를 수 있는 중요한 순간에 브랜드를 어떻게 인식하는지에 영향을 줍니다. 이러한 인식은 팀의 평가 지표에 직접 반영됩니다.

  • 더 높은 만족도와 해결률: 에이전트가 빠르게 응답하고 어색하게 말을 끊지 않으면 고객은 상호작용을 더 높게 평가합니다.
  • 이탈 감소: 고객이 대화에서 이탈하는 이유는 긴 대기 시간만이 아닙니다. 통화 중 어색한 침묵이든 채팅의 딱딱하고 브랜드와 맞지 않는 답변이든, 기대에 맞지 않는 전달 방식은 대화를 끝내고 싶다는 같은 충동을 일으킬 수 있습니다.
  • 더 빠른 문제 해결: 명확한 대화 흐름 설정과 잘 매핑된 workflow는 막다른 길, 반복 질문, "담당자에게 연결해 드리겠습니다"라는 상황을 줄여 줍니다.
  • 상담원 에스컬레이션 감소: 에이전트가 대화 흐름을 자연스럽게 처리하고 정의된 workflow를 따르면, 고객이 혼란스러워 사람을 찾게 하는 대신 첫 시도에서 더 많은 문제를 해결합니다.

예를 들어 eDreams ODIGEO를 살펴보겠습니다. 세계 최대 온라인 여행 플랫폼 중 하나인 이 회사는 AI 에이전트를 ElevenAgents와 함께 5개 핵심 언어에 배포했고, 저지연 음성 합성과 통화 시작 시 더 정확한 의도 인식에 힘입어 문제 해결 속도는 두 자릿수 개선, 통화 전환율은 두 자릿수 감소를 달성했습니다. 이런 결과는 대화 디자인 외에도 다양한 변수에 좌우되지만, 우수한 대화형 AI 디자인이 무엇을 가능하게 하는지 보여 줍니다.

ElevenAgents에서 대화형 AI 디자인이 작동하는 방식

ElevenAgents에서는 에이전트가 사람처럼 느껴지는지를 결정하는 페르소나, 음성, 턴 전환, 핸드오프, 지연 시간 등의 요소를 최적화할 수 있습니다. 실제 대화에서 에이전트가 제 역할을 해내도록 각각을 구성하고 최적화하는 방법을 살펴보겠습니다.

페르소나와 음성 선택

페르소나는 고객의 첫인상을 결정하며, 어긋난 페르소나는 대화가 시작되기도 전에 신뢰를 약화시킵니다. 친근한 리테일 브랜드에 지나치게 딱딱한 페르소나를 적용하면, 에이전트가 유용한 말을 하기도 전에 고객은 이를 의심하게 됩니다. 시스템 프롬프트에서 에이전트의 역할, 성격, 가드레일을 정의하며 페르소나 설계를 시작하세요.

음성 에이전트에서는 그 페르소나가 음성에도 드러나야 합니다. 금융 관련 통화에 지나치게 캐주얼한 음성을 사용하면, 텍스트에서 페르소나가 어긋났을 때와 같은 신호를 보내므로 음성 선택 역시 같은 작업의 일부가 됩니다. 다음부터 시작하세요.

  • 음성 선택: 브랜드, 고객층, 주제에 맞는 음성을 선택하세요. 억양, 성별, 톤은 특정 발신자와의 신뢰를 형성하고 대화의 분위기를 정하는 데 모두 도움이 됩니다.
  • 다국어 지원: 시장 전체에 하나의 음성을 기본값으로 적용하는 대신 지원하는 언어마다 음성을 선택하세요. 하나의 음성을 여러 언어에 억지로 적용하면 최소한 한 언어에서는 이질적으로 들리는 경향이 있어, 구축하려는 신뢰를 약화시킵니다.

ElevenAgents에서는 보이스 라이브러리에서 억양, 캐릭터, 사용 사례별로 검색할 수 있는 11,000개 이상의 음성을 이용할 수 있으므로, 빈 상태에서 시작할 일은 드뭅니다. 적합한 음성이 없다면 두 가지 옵션이 더 있습니다. 짧은 오디오 샘플로 기존 음성을 복제하거나 처음부터 새로 디자인할 수 있습니다. 원하는 연령, 억양, 톤, 속도를 설명하는 텍스트 프롬프트를 사용하면 됩니다.

대화 흐름 설정

음성에서는 대화가 가장 엄격한 시간 제약 속에서 진행됩니다. 침묵이 단지 빈 공간인 채팅과 달리, 통화에서 리듬이 끊기면 즉시 무음이나 연결 끊김으로 인식됩니다. 이 리듬을 맞추는 것은 음성 에이전트가 대화의 자연스러운 참여자처럼 느껴지게 하는 가장 큰 요인이며, 턴 전환 모델 자체에서 시작됩니다.

ElevenLabs의 턴 전환 모델은 화자가 단순히 잠시 멈춘 것이 아니라 실제로 말을 마쳤는지를 감지하도록 구축된 연구 기반 시스템입니다. 이를 통해 고정된 지연 시간을 기준으로 추측하는 대신 에이전트가 언제 응답해야 하는지 판단할 수 있습니다.

이와 함께 대화 흐름을 올바르게 설정하기 위해 조정할 수 있는 항목은 다음과 같습니다.

  • 턴 타임아웃: 에이전트가 응답하기 전 침묵 상태에서 기다리는 시간입니다. 고객이 아직 생각 중일 때 끼어들거나, 말을 마친 뒤 너무 오래 기다리게 하지 않습니다. 
  • 소프트 타임아웃: "잠시만요" 또는 "확인해 보겠습니다"처럼 처리 중 생기는 잠깐의 공백을 메우기 위해 에이전트가 사용하는 짧은 필러 문구입니다. 고객이 통화가 끊겼다고 생각하지 않도록 합니다. 실제 응답 시간은 달라질 수 있으므로 "1초만요"처럼 특정 시간을 약속하는 필러는 피하세요.
  • 인터럽션: 고객이 에이전트의 말 위에 겹쳐 말하기 시작할 때 에이전트가 말을 멈출지 여부입니다. 자연스러운 대화를 위해서는 활성화하세요. 법적 고지, 안전 지침, 끝까지 들어야 하는 모든 내용처럼 완전한 전달이 중요할 때는 비활성화하세요.
  • 턴 응답 민감도: 고객이 말을 멈춘 뒤 에이전트가 얼마나 빠르게 응답에 나서는지를 정합니다. 빠른 응답이 가장 중요한 고객 서비스에는 "Eager"가 적합합니다. 전화번호나 이메일 주소처럼 고객 정보를 수집할 때는 숫자를 말하는 도중 끊지 않도록 "Patient"가 가장 효과적입니다. 일반적인 대화에는 "Normal"이 좋은 기본값입니다.

여기서 작은 조정만으로도 큰 차이를 만들 수 있습니다. 타임아웃을 조금만 바꿔도 세심하게 느껴지는 에이전트와 사람의 말을 끊는 것처럼 느껴지는 에이전트가 갈릴 수 있습니다. 

Workflow, 핸드오프 디자인 및 스크립팅

Workflow는 ElevenAgents에서 대화형 AI 디자인의 상당 부분이 실제로 적용되는 곳입니다. 무엇이 언제 일어나는지, 즉 의사 결정 지점, 에스컬레이션 경로, 핸드오프 등 에이전트가 즉석에서 처리하도록 남겨둘 모든 것을 정의합니다. 

Workflow는 에이전트를 정교하게 만드는 다른 두 시스템과 함께 작동합니다. 시스템 프롬프트는 인사나 핸드오프 같은 주요 시점에서 에이전트의 역할, 톤, 말할 내용과 말하지 않을 내용을 포함한 핵심 행동을 정의합니다. 절차는 고객 신원 확인이나 반품 안내처럼 하나의 명확히 정의된 작업에 사용할 수 있는 더 규정적인 옵션입니다. 고객의 말에 따라 분기하는 대신, 대화가 어떻게 진행되든 처음부터 끝까지 단계별 고정 순서를 따릅니다.

에이전트 구축을 시작하는 가장 쉬운 방법은 사전 구축된 에이전트 템플릿을 사용하는 것입니다. workflow와 시스템 프롬프트의 시작점이 제공되므로 처음부터 구축하는 대신 미세 조정할 수 있습니다. 다음과 같은 변경부터 적용하여 자신만의 에이전트로 만들어 보세요.

  • 의사 결정 매핑: 모든 의사 결정 지점에서 에이전트가 정확히 무엇을 하는지 매핑하여, 시작부터 해결까지 전체 대화를 정의하세요. 서브에이전트 노드를 사용하면 흐름의 특정 지점에서 시스템 프롬프트, 모델, 심지어 음성까지 조정할 수 있으므로, 민감한 인증 단계에는 통화 초반의 가벼운 대화보다 더 엄격한 가드레일을 적용할 수 있습니다.
  • 에스컬레이션 트리거: 상황에 따라 에이전트가 판단하도록 두는 대신 workflow에 상담원 핸드오프를 위한 명확한 트리거를 설정하세요. 예를 들어 두 번 시도한 뒤에도 문제가 해결되지 않을 때, 고객이 관리자 연결을 요청할 때, 또는 거래가 민감하거나 고액이어서 상담원이 필요할 때 에스컬레이션할 수 있습니다.
  • 핸드오프 컨텍스트: 시스템 프롬프트에서 주문 ID나 계좌 번호처럼 전환 전에 에이전트가 수집해야 할 정보와 핸드오프를 유발하는 조건을 정의하세요. 그런 다음 저장된 세부 정보를 전환 도구 구성에 매핑하면, 고객이 상담원에게 같은 내용을 반복하지 않아도 정보가 자동으로 전달됩니다.
  • 스크립트 문구: 시스템 프롬프트에서 중요한 순간에 사용할 정확한 문구를 정의하세요. 시작 인사, 오류 메시지, 법적 고지, 에스컬레이션 핸드오프는 에이전트가 즉석에서 만들어 내도록 두어서는 안 됩니다. 문제가 생겼을 때 에이전트가 어떻게 표현할지 추측하게 하는 것보다 "현재 해당 정보에 접근하는 데 문제가 있습니다"처럼 정확한 문장을 정해 두는 편이 더 안정적입니다.

Workflow 자체는 ElevenAgents에서 시각적 그래프로 구축되며, 각 의사 결정 지점과 에스컬레이션 트리거는 직접 보고 편집할 수 있는 노드로 매핑됩니다.

Conversational AI design. Workflow interface for managing agent transfers and meetings in ElevenLabs platform.

운영을 시작하면 분석 기능이 같은 그래프에 실제 대화 데이터를 오버레이하므로, 고객이 정확히 어디에서 막히거나 이탈하는지 확인하고 추측 없이 수정할 수 있습니다.

지연 시간과 성능

지연 시간은 상호작용이 사람처럼 느껴지는지를 결정하는 가장 큰 요소 중 하나입니다. 대화의 다른 모든 요소가 잘 작동하더라도, 느린 응답은 고객에게 기계와 대화하고 있음을 가장 빠르게 깨닫게 하는 요인 중 하나입니다.

에이전트가 채팅과 음성 중 어느 방식으로 작동하든 파이프라인의 모든 부분은 자체적인 지연 시간을 더합니다. 일부는 두 방식 모두에 적용되고, 다른 일부는 음성이 포함될 때만 적용됩니다.

  • LLM: 모든 모델 선택에는 비용, 추론 품질, 속도 간의 트레이드오프가 있으며, 적절한 균형은 대화에 따라 달라집니다. FAQ나 예약 확인처럼 단순하고 빈도가 높은 상호작용은 더 빠르고 가벼운 모델로도 경험을 해치지 않고 처리할 수 있습니다. 금융 자문이나 여러 단계의 문제 해결 같은 더 복잡한 작업에는 조금 느리게 응답하더라도 더 강력한 추론 모델을 선택할 가치가 있는 경우가 많습니다. 
  • 지식 베이스 및 RAG: 지식 베이스를 조회할 때마다 에이전트가 응답하기 전 왕복 시간이 추가됩니다. 따라서 광범위하게 검색해야 하는 지식 베이스보다 간결하고 집중된 지식 베이스가 더 빠르게 응답합니다.
  • 통합 및 도구 호출: Salesforce에서 주문을 조회하거나 캘린더의 예약 가능 시간을 확인하는 것처럼, 외부 도구를 호출할 때마다 자체적인 왕복 시간이 추가됩니다. 에이전트가 어떤 도구를 호출할지 망설이지 않도록 명확한 도구 설명을 작성하고, 대화에 실제로 필요한 도구만 호출하세요.
  • 지역 및 데이터 호스팅: ElevenAgents 리전을 데이터가 호스팅되는 위치와 맞추고, 전화 기반 배포의 경우 통신 제공업체(Twilio, SIP 등)의 리전과도 맞추세요. 에이전트 리전과 통화 게이트웨이 리전이 지구 반대편에 있으면 대화가 시작되기도 전에 지연 시간이 추가됩니다.
  • 음성-텍스트 변환(음성 전용): Scribe는 에이전트가 추론하기 전에 고객의 말을 텍스트로 변환합니다. 정확도보다 속도를 위해 설계된 배치 버전 대신, 실시간 대화에는 실시간 버전(Scribe v2 Realtime)을 사용하세요.
  • 턴 전환(음성 전용): 에이전트가 언제 응답하기로 결정하는지를 정하며, 위에서 자세히 다뤘습니다. 턴이 끝났음을 감지하는 데 주저하는 모델은 나머지 파이프라인이 시작되기도 전에 지연을 더하므로, 그 자체로 지연 시간 요소라는 점을 기억할 필요가 있습니다.
  • 텍스트 음성 변환 및 음성 선택(음성 전용): 기본 및 합성 음성과 Instant Voice Clone은 Professional Voice Clone보다 더 빠르게 응답합니다. 추가적인 충실도가 지연 시간 트레이드오프를 감수할 가치가 있는 경우에만 Professional Voice Clone을 사용하세요.

지연 시간을 자세히 알아보려면 지연 시간 최적화 모범 사례와 파이프라인 전반에서 지연 시간을 측정하고 보고하는 방식을 확인하세요.

ElevenAgents로 첫 에이전트 디자인하기

여기서 다룬 요소들은 AI 에이전트를 위한 대화형 AI 디자인이 실제로 무엇을 의미하는지 보여 줍니다. 모두 ElevenAgents에 기본으로 제공되며 노코드 콘솔에서 구성할 수 있으므로, 질문에 정확히 답하는 데 그치지 않고 실제 대화를 이어가는 에이전트를 만들 수 있습니다.

직접적인 도움을 원하는 팀을 위해 ElevenLabs Forward Deployed Engineers가 팀과 직접 협력하여 프로덕션 준비가 된 에이전트의 범위를 정의하고, 구축 및 출시한 후 운영 시작 뒤에도 성능을 미세 조정합니다.

직접 구축하든 지원을 받든, 차이를 가장 빠르게 확인하는 방법은 직접 사용해 보는 것입니다. 오늘 에이전트를 만들거나 영업팀에 문의하세요.

대화형 AI 디자인 FAQ

유사한 기사

최고 품질의 AI 오디오로 창작하세요