콘텐츠로 건너뛰기

인터랙션 모델: 자연스러운 인간-AI 대화 구축

작성자
Jack Limebear
게시일
최종 업데이트

듣기이 글 오디오로 듣기

문장 중간에 AI 음성 에이전트를 끼어들어 본 사람이라면, 시스템이 사람 간의 대화를 위해 만들어지지 않았을 때 어떤 느낌인지 알 것입니다. 리듬은 어색하고, 음성은 내용과 동떨어져 있으며, 정보가 정확하더라도 상호작용은 어딘가 부자연스럽습니다. 박식한 사람과 대화하는 느낌이 아니라, 우연히 단어를 사용하는 소프트웨어를 조작하는 느낌에 가깝습니다.

이런 부자연스러움의 원인은 구조적입니다. 많은 음성 AI 시스템은 대화가 아니라 턴을 처리하도록 만들어졌습니다. 한 번의 발화를 듣고, 처리하고, 응답합니다. 간단한 데모에서는 잘 작동하지만, 대화가 감정적이고 예측 불가능해지면 한계가 드러납니다.

인터랙션 모델은 오디오와 텍스트를 통해 실시간으로 소통하도록 설계된 AI 시스템입니다. 무엇을 말했는지뿐 아니라 언제 말했는지, 그리고 그 순간에 어떤 감정적 반응이 필요한지도 파악합니다. 이 글에서는 인터랙션 모델이 다른 점, 음성 AI를 도입하는 기업에 중요한 이유, 그리고 ElevenLabs가 이를 어떻게 구축하고 있는지 설명합니다.

요약

  • 대부분의 음성 AI는 끼어들기, 침묵 또는 턴을 넘어 이어지는 맥락을 처리하지 못해 실제 대화에서 제대로 작동하지 않습니다.
  • ElevenLabs의 인터랙션 스택은 맥락을 잃거나 대화 흐름을 끊지 않고 끼어들기, 멈춤, 겹치는 발화를 처리하도록 설계되었습니다.
  • ElevenLabs는 고도화된 캐스케이드 아키텍처와 자체 개발 음성 텍스트 변환 (STT), 텍스트 음성 변환 (TTS), 그리고 낮은 지연 시간과 자연스러운 양방향 대화에 맞춰 조정된 스택을 바탕으로 진정한 인터랙션 모델을 구축하고 있습니다.

대부분의 인간-AI 음성 커뮤니케이션이 자연스럽지 않은 이유

대부분의 음성 AI는 대화를 분리된 입력과 출력의 연속으로 처리합니다. 시스템은 일정 구간의 음성을 기다린 뒤 텍스트로 변환하고, 그 텍스트를 처리해 응답합니다. 이는 명령과 응답 방식의 상호작용에는 효과적이지만, 실제 대화는 깔끔하게 이어지는 텍스트 교환이 아닙니다. 멈춤과 짧은 끼어들기가 가득한 지속적인 주고받기입니다. 

턴 사이의 흐름과 턴을 넘어서 이어지는 맥락을 제거하면 다음과 같은 세 가지 문제가 발생합니다.

  • 말을 끊거나 기다리게 합니다: 시스템은 생각을 위한 잠시의 멈춤과 발화가 끝난 상황을 구분하지 못합니다. 그래서 아직 말하는 중에 끼어들거나, 말이 끝난 뒤에도 침묵합니다. 문장 중간에 생각을 정리하면 말이 끊기고, 할 말을 마치면 잠깐의 정적을 기다려야 합니다.
  • 말하기 시작하면 반응하지 못합니다: 시스템은 응답을 시작하는 순간 듣기를 멈춥니다. 방향을 바꾸려고 끼어들어도, 무언가 바뀌었다는 사실을 인식하지 못해 이미 화제가 지난 질문에 대한 답변을 계속합니다.
  • 대화가 진행될수록 잊어버립니다: 각 턴이 독립적으로 처리되므로, 다섯 번 전의 대화 맥락은 이어지지 않습니다. 같은 말을 반복해야 하거나 시스템이 마치 대화가 막 시작된 것처럼 응답하게 됩니다.

그 결과, 기능적으로는 정확하지만 여전히 어색하게 느껴지는 대화가 만들어집니다. 

기존 음성 AI로는 할 수 없는 인터랙션 모델의 기능

기존 음성 AI가 한 번에 하나의 턴을 처리하는 반면, 인터랙션 모델은 말하고 있는 내용과 다음에 일어나야 할 일을 동시에 고려하며 전체 대화를 운영합니다. 기능적 차이는 인터랙션 모델이 가장 최근의 입력만이 아니라 실제 대화 상태에 반응한다는 점입니다.

인터랙션 모델의 특징:

  • 실시간 응답: 시스템은 대화 속도로 응답하도록 설계되었으며, 설정에 따라 엔드투엔드 주기를 1초 이내로 실행할 수 있습니다.
  • 끼어들기, 침묵, 겹침의 자연스러운 처리: 생각을 위한 멈춤과 발화가 끝난 상황을 구분하므로 말을 끊거나 정적을 남기지 않습니다. 고객이 방향을 바꾸기 위해 말 위로 겹쳐 말해도, 맥락을 잃거나 대화가 무너지지 않도록 겹침을 처리합니다.
  • 전체 대화에 걸친 연속성: 매 턴마다 맥락을 초기화하는 대신 대화 기록을 계속 유지하므로, 10번째 턴의 응답에는 첫 번째 턴부터 지금까지 발생한 모든 일이 반영됩니다.
  • 상황에 맞춘 전달 방식: 음성은 수행 중인 작업의 종류에 따라 더 차분하게, 더 직접적으로, 더 안심이 되도록 바뀌게 프로그래밍할 수 있습니다.
  • 병렬 작업 실행: 시스템은 정보를 검색하고, 도구를 호출하고, 대화를 계속하는 일을 동시에 수행합니다. 무언가를 찾는 동안 침묵하지 않습니다.

인터랙션 모델의 진가는 통화가 잘 풀리지 않을 때 드러납니다. 아래 녹음에서 고객은 항공편 취소 문제로 전화합니다. 긴장한 상태이며 문제를 빠르게 해결해야 합니다.

mark screenshot w caption space

에이전트는 고객이 사용하는 말에서 긴급함과 좌절감을 즉시 파악합니다. 말투를 조정하고, 흐름을 놓치지 않고 끼어들기를 처리하며, 연결된 도구를 사용해 취소된 항공편에 대한 실제 해결책을 제시합니다. 결국 고객은 사람 상담원 없이도 문제를 해결합니다.

이를 오늘날 사용되는 일반적인 턴 기반 에이전트와 비교해 보세요. 이런 시스템은 매번 멈출 때까지 기다리고, 중립적인 기준점에서 답변하며, 고객이 느끼는 좌절감을 완전히 놓칩니다. 발신자가 실제로 느끼는 감정을 다루지 못하는 대화가 몇 번 이어지면, 통화는 사람에게 넘겨질 가능성이 높고 고객은 처음보다 더 좌절하게 됩니다.

ElevenLabs가 인터랙션 모델을 구축하는 방식

ElevenLabs의 대화 파이프라인은 고도화된 캐스케이드 아키텍처를 사용합니다. 퓨즈드 아키텍처와 달리 하나의 모델이 모든 것을 처리하는 대신, 각 단계가 전문화된 독립 컴포넌트로 구성됩니다.

이 접근 방식의 장점은 전체 시스템을 다시 구축하지 않고도 파이프라인의 각 단계를 독립적으로 최적화하고, 어떤 컴포넌트든 더 나은 모델로 교체할 수 있다는 점입니다. 또한 이러한 컴포넌트를 자체 개발하기 때문에 단순한 데이터가 아니라 풍부한 맥락을 서로 전달하도록 공동 최적화됩니다. 따라서 파이프라인은 여러 도구의 연결이 아니라 하나의 일관된 대화처럼 작동합니다.

캐스케이드 모델 구조

Flowchart of an audio processing system: Audio, Speech-to-Text, LLM, Text-to-Speech, Audio in an interaction model

퓨즈드 모델 구조

Audio processing flowchart: Audio > Combined System (STT, LLM, TTS, Tools) > Audio.

이미지: 캐스케이드 모델과 퓨즈드 모델 비교

현재 파이프라인을 구성하는 기술은 다음과 같습니다.

  • Scribe v2 Realtime: ElevenLabs의 자체 개발 STT 모델은 90개 이상의 언어에서 약 150ms 만에 음성을 텍스트로 변환하며, 배경 소음, 억양, 끼어들기, 웃음과 멈춤 같은 비언어적 요소에도 안정적으로 작동합니다. 의료 용어부터 금융 전문 용어까지, 도메인별 어휘도 처리하도록 설계되었습니다.
  • 예측 기반 턴 전환: 이 시스템은 고정된 침묵 임계값에 의존하는 대신 대화의 흐름을 읽어 말할지, 멈출지, 기다릴지를 결정합니다. 음성 활동 감지 모델을 개선해 배경 발화와 짧은 응답을 더 효과적으로 걸러내므로 턴 전환이 더욱 자연스럽습니다.
  • Eleven v3 Conversational: ElevenLabs의 가장 표현력 높은 TTS 모델로, 실시간 양방향 대화를 위해 만들어졌습니다. 대화의 감정적 온도를 턴 사이로 이어 가므로, 10번째 턴에서 에이전트가 전달하는 방식에는 가장 최근의 응답뿐 아니라 이전의 모든 맥락이 반영됩니다.
  • Expressive Mode: Eleven v3 Conversational 및 턴 전환 시스템을 기반으로 하는 Expressive Mode는 그 순간 에이전트의 음성을 제어합니다. 고객이 좌절했을 때는 상황을 완화하고, 혼란스러워할 때는 안심시키며, 명확성이 필요할 때는 직접적으로 전달합니다. 또한 표현 태그를 읽을 수 있어 [laughs], [whispers], [sighs] 같은 신호를 바탕으로 특정 순간의 전달 방식을 조정합니다.
  • Flash v2.5: ElevenLabs의 저지연 TTS 모델은 32개 언어를 지원하며 75ms 이내에 음성을 생성합니다. 지연 시간이 우선일 때 응답 시간을 자연스러운 사람의 대화 리듬 범위로 유지합니다.
  • Speech Engine: 스택을 하나로 연결하는 계층으로, 대화당 하나의 연결을 통해 WebSocket으로 서버를 ElevenLabs의 ElevenAPI에 연결합니다. ElevenLabs는 STT와 TTS를 처리하고 서버는 LLM을 실행하므로, 기술 팀은 자체 모델을 사용하고 대화 로직을 자체 인프라에 유지할 수 있습니다.

이 모델들은 지속적으로 개선되고 있으며, 새 버전도 정기적으로 출시됩니다. 새 릴리스가 나올 때마다 더 빠른 응답, 더 정확한 감정 인식, 더 많은 언어, 더 매끄러운 전달을 통해 소프트웨어와 대화하는 경험과 사람과 대화하는 경험의 격차가 줄어듭니다.

생각하면서 말하기

인터랙션 모델의 모든 부분이 엄격한 순서대로 실행될 필요는 없습니다. ElevenAgents는 질문과 답변 사이에 기본적으로 침묵하는 대신, 대화가 이어지는 동안에도 백그라운드에서 계속 작업할 수 있습니다. 

몇 가지 핵심 시스템이 함께 작동해 말하기와 생각하기를 동시에 가능하게 합니다.

  • 병렬 도구 호출: 에이전트는 데이터베이스를 조회하고, 도구를 실행하거나 말하는 중에도 주문 상태를 확인할 수 있어, 검색 과정이 대화 속 정적처럼 느껴지지 않습니다. 
  • 소프트 타임아웃: LLM이 응답을 생성하는 데 예상보다 오래 걸리면, 에이전트는 어색한 침묵을 남기는 대신 “생각해 볼게요” 또는 “음...” 같은 짧은 필러 문구를 말합니다. 소프트 타임아웃은 자연스러운 대화 흐름을 유지하고 끼어들기가 발생할 가능성을 줄여 줍니다. 
  • 끼어들기 무시 용어: 시스템은 고정된 침묵 임계값을 사용하는 대신, 말의 의미를 읽어 턴이 실제로 끝났는지 파악하려고 합니다. 마찬가지로 “네”나 “음-흠” 같은 짧은 긍정 표현은 전체 끼어들기를 유발하지 않도록 설정할 수 있으므로, 발신자가 짧게 끼어들 때마다 에이전트가 흐름을 잃지 않습니다.

이 시스템들은 함께 작동해 에이전트가 응답을 버퍼링하거나 로딩하는 것처럼 느껴지지 않게 합니다. 백그라운드에서 정보를 처리하고 생각을 정리하는 동시에, 사람이 하듯 자연스럽게 공백을 채우는 간결한 대화 엔진을 구성합니다.

ElevenLabs에서 대화가 실제로 작동하는 방식

위의 컴포넌트는 깔끔한 한 줄로 차례대로 실행되지 않습니다. 서로 겹쳐 작동합니다. 지원 통화 도중 발신자가 “제 주문은 이미 배송됐나요, 아니면 아직 처리 중인가요?”라고 물었을 때 ElevenLabs 에이전트가 어떻게 처리하는지 살펴보겠습니다.

  1. 발신자가 말합니다: 오디오는 WebSocket 연결을 통해 ElevenLabs로 스트리밍되고, Scribe는 음성보다 약 150ms 뒤에서 실시간으로 텍스트 변환을 시작합니다. 
  2. 시스템이 흐름을 읽습니다: Scribe가 아직 텍스트 변환 중인 동안에도 예측 기반 턴 전환 시스템은 발신자가 말을 마쳤는지, 아직 생각 중인지 이미 판단하고 있습니다. 문장 끝의 “아니면 아직 처리 중인가요?”는 멈춤이 아니라 다음 단계로 넘기는 신호로 읽히므로, 침묵 속에서 기다리지 않고 다음 단계가 실행됩니다.
  3. LLM이 맥락을 구성하고 응답합니다: 텍스트로 변환된 질문은 대화 기록, RAG를 통해 기업 자체 시스템에서 가져온 주문 기록, 통화 초반의 도구 출력, 시스템 프롬프트와 함께 LLM으로 전달됩니다. LLM은 이 모든 정보를 바탕으로 추론하여 일반적인 상태 메시지가 아니라 발신자의 실제 주문을 기반으로 한 응답을 생성합니다.
  4. Eleven v3가 응답을 합성합니다: 텍스트가 자연스러운 음성으로 변환됩니다. Expressive Mode가 활성화되어 있으면 응답에는 상황에 맞는 전달 신호가 반영되어, 일반적인 업데이트도 단조롭지 않고 편안하고 여유롭게 들립니다. 지연 시간이 우선일 때는 Flash가 75ms 이내에 합성을 처리합니다.
  5. 응답이 다시 스트리밍됩니다: 합성이 완료되기 전부터 오디오 재생이 시작되므로, 나머지 부분이 생성되는 동안 발신자는 답변의 시작을 들을 수 있습니다. 
  6. 주기가 반복됩니다: 새 턴마다 대화의 어조, 맥락, 기록이 계속 이어집니다.

이 빠른 과정 전반에서 대화는 자연스럽게 느껴집니다. 발신자는 더 이상 기계에 맞춰 말할 필요가 없습니다. 속도를 늦추거나, 과도하게 또박또박 말하거나, 신호음을 기다리지 않습니다. 그저 사람과 대화하듯 말합니다.

비즈니스 전반에 자연스러운 음성 에이전트 배포

여기서 설명한 모든 기능은 로드맵이 아니라 현재 실제 운영 환경에서 제공됩니다. 캐스케이드 아키텍처부터 1초 미만의 파이프라인까지, 전 세계 기업은 이미 ElevenAgents를 사용해 실제 고객 대화를 대규모로 처리하고 있습니다.

에이전트 아키텍처는 가드레일, 감사 로그, 규정 준수 제어 기능을 지원하므로 규제가 엄격하고 중요한 환경도 포함됩니다. ElevenLabs는 SOC 2 Type II, ISO 27001, HIPAA 및 PCI DSS Level 1 인증을 받았으며, 데이터가 특정 경계 안에 머물러야 하는 팀을 위해 Zero Retention Mode와 지역별 데이터 레지던시를 제공합니다.

에이전트를 업무에 투입할 준비가 되셨나요? 에이전트를 생성하고 콘솔에서 구축을 시작하거나, 영업팀에 문의하여 환경에 맞춘 배포를 논의할 수 있습니다.

인터랙션 모델 FAQ

유사한 기사

최고 품질의 AI 오디오로 창작하세요