콘텐츠로 건너뛰기

웨비나 요약: 자연스러운 AI 에이전트 만들기

작성자
Luigi Sambuy
게시일
최종 업데이트

듣기이 글 오디오로 듣기

대부분의 팀은 자연스럽게 들리는 에이전트를 만들고 싶어 합니다.

하지만 많은 팀이 마주하는 한계는 에이전트가 작업은 완료해도 맥락, 긴급성 또는 감정을 이해하지 못한다는 점입니다. 발신자가 이를 알아차리는 순간 신뢰는 떨어지고, 상호작용의 품질도 함께 낮아집니다.

최근 진행한 라이브 워크숍: 자연스럽게 들리는 AI 에이전트 구축하기에서 Luigi Sambuy(Forward Deployed Engineering)가 로봇처럼 들리는 에이전트와 진정으로 사람처럼 느껴지는 에이전트의 차이를 설명했습니다.

자연스럽게 들리는 일이 생각보다 어려운 이유

에이전트를 도입한 대부분의 팀은 이미 정확성 문제를 해결했습니다. 에이전트는 올바른 답을 제공하고, 정확한 테이블을 예약하며, 올바른 항공편을 취소합니다. 

더 어려운 것은 전달 방식을 제대로 구현하는 일입니다.

발신자의 감정을 반영하지 못하고, 긴급성을 파악하지 못하며, 모든 질문에 똑같이 단조로운 리듬으로 답하는 에이전트는 아무리 답변이 정확해도 인위적으로 느껴질 수밖에 없습니다. 고객은 단순히 문제가 해결되기를 바라는 것이 아니라, 해결되는 과정에서 자신의 이야기가 받아들여진다고 느끼고 싶어 합니다.

자연스럽게 들리는 에이전트의 4가지 특징

  1. 리듬과 흐름 - 단조롭게 읽는 대신 자연스러운 속도, 멈춤, 속도 변화 적용
  2. 미러링 - 불만을 느끼는 발신자에게는 공감을, 좋은 소식에는 따뜻함을 담아 응답
  3. 맥락 - 사용자 이력, 비즈니스 시스템, 문화적·지역적 단서를 활용해 답변이 일반론에 그치지 않도록 구성
  4. 정체성 - 기본 제공되는 음성이 아니라 브랜드에 맞춰 실제로 구축한 음성

데모: 자연스럽게 들리는 에이전트의 실제 작동 방식

시나리오: 고객이 Rosette Restaurant에 전화해 예약 시간을 변경하려고 합니다. 결혼 5주년인데 늦고 있는 상황입니다.

데모에서 확인한 내용:

  • 에이전트는 다른 작업에 앞서 결혼기념일을 언급하며 따뜻하게 대화를 시작했습니다.
  • 고객이 말한 예약 시간과 실제 예약된 시간 사이의 작은 불일치를 포착하고, 추측하지 않고 확인했습니다.
  • 요청받지 않았지만 예약을 오후 9시로 변경하고, 기념일을 위해 창가 자리를 먼저 제안했습니다.
  • 통화 내내 에이전트는 자연스러운 멈춤과 추임새를 사용하고, 안심시키면서도 따뜻하고 서두르지 않는 어조로 상황에 맞게 톤을 조절했습니다.

중요한 이유: 이 모든 것은 다른 모델이나 더 강력한 플랫폼에서 비롯된 것이 아닙니다. 프롬프트에서 비롯되었습니다. 시스템 프롬프트는 에이전트가 문장 중간에 스스로 수정하고, "무언가를 찾아보는" 동안 자연스럽게 말을 흐리며, 발신자에 맞춰 감정적 톤을 바꾸도록 했습니다. 오늘날 플랫폼에서 구축하는 모든 팀이 활용할 수 있는 동일한 기법입니다.

자연스러운 에이전트를 구축하는 7가지 요소

  1. 감정 태그 - v3 대화형 모델의 표현 모드에서 사용할 수 있으며, 톤 변화를 위한 가장 강력한 요소
  2. 배경 소음 - 더 친숙하고 인간적인 맥락을 만드는 사무실 분위기음, 도시 소리 또는 타이핑 소리
  3. 시스템 프롬프트의 톤 - 실질적인 차이의 대부분이 만들어지는 부분
  4. 응답 적극성 설정 (적극적 / 보통 / 여유 있음) - 상호작용에 필요한 시간에 맞춰 설정
  5. 발음 사전 / 키워드 - 에이전트가 잘못 발음할 수 있는 이름, 브랜드, 외국어 단어에 활용합니다. 
  6. 출력 설정 - 기존 컨택센터에서 전환한 고객은 약간 먹먹한 음색에 익숙하므로, 일부 팀은 깨끗한 오디오 대신 의도적으로 배경에 전화 벨소리를 추가합니다.
  7. 보이스 디자인 또는 음성 복제 - 기본 제공 음성을 고르는 대신 브랜드에 맞는 완전히 맞춤화된 음성을 구축합니다. 보이스 디자인을 사용하면 구체적인 음성을 프롬프트로 지정할 수 있습니다(예: "헤드셋을 통해 들리는 듯한 30대 남성"). 음성 복제는 즉석 복제(약 30초의 오디오)부터 프로페셔널 음성 복제(더 많은 자료, 더 높은 충실도)까지 지원합니다. 

자연스럽게 들리는 에이전트를 위한 모범 사례

톤을 시스템 프롬프트에 직접 작성하세요. 단조로운 에이전트와 자연스러운 에이전트의 실질적인 차이 대부분은 여기서 만들어집니다. 에이전트가 문장 중간에 스스로 수정하고("사람들이 실제로 말하는 방식"), 무언가를 찾는 동안 자연스럽게 말을 흐리며, 심각한 이야기를 들은 뒤에는 잠시 침묵한 후 답하도록 명시적으로 허용하세요.

감정 태그를 상황에 맞추세요. 심각하거나 위험한 상황에 "excited" 태그는 적절하지 않습니다. 대화에서 실제로 해당 감정이 나타날 위치에 태그를 의도적으로 배치하고, 통화가 진행됨에 따라 발신자의 감정 상태에 맞게 조정하세요(예: 불안한 발신자에게는 차분하고 안심시키는 톤, 급한 사람에게는 빠르면서도 따뜻한 톤).

응답 적극성을 의도적으로 설정하세요. 적극적 설정은 빠르고 정보량이 많은 대화에 적합하며, 여유 있음 설정은 문서나 번호를 찾을 시간이 필요할 때 적합합니다. 모든 상황에 적극적 설정을 기본으로 적용하면 자연스럽기보다 재촉하는 듯한 에이전트가 될 수 있습니다.

노드별로 LLM을 선택하세요. 간단한 라우팅 단계에는 가볍고 빠른 모델을, 실제 의사결정을 수행하는 노드에는 성능이 더 뛰어난 모델을 사용하세요. 

체감 지연 시간을 ‘자연스러움’의 일부로 다루세요. 모델 선택 외에도, 발신자가 아직 말하고 있는 동안 모델이 응답을 만들기 시작하게 하는 추정 턴 생성과 소프트 타임아웃 추임새는 실제 응답 시간이 바뀌지 않아도 멈춤이 느껴지는 시간을 줄여 줍니다.

번역보다 현지화에 집중하세요. 대상 언어로 실제 학습된 음성을 선택하고 발음 사전을 사용하세요. 단일 언어 사용 사례라면 성능 향상을 위해 프롬프트 자체를 해당 언어로 작성하는 것도 고려해 보세요. 여러 언어에서 빠른 지연 시간이 표현력의 범위보다 중요하다면 Multilingual v2도 여전히 탄탄한 선택지입니다.

에이전트를 모니터링하세요. 실제 통화 없이 에이전트를 검증하는 시뮬레이션 테스트, 통화 후 통과/실패 점수를 위한 평가 기준, 그리고 에이전트가 대화의 정확히 어느 지점에서 잘못된 톤을 사용했는지 파악하는 턴별 감정 분석을 활용하세요. 그런 다음 이 신호를 바탕으로 프롬프트를 조정하세요.

전체 세션 보기

전체 웨비나 시청 여기.

ElevenLabs workshop on building natural-sounding AI agents, hosted by Luigi Sambuy.

유사한 기사

최고 품질의 AI 오디오로 창작하세요