RAG란? 검색 증강 생성의 작동 방식
- 게시일
- 최종 업데이트
AI 모델은 학습 과정에서 배운 내용을 바탕으로 답변을 생성합니다. 즉, 학습 이후에 만들어진 기업의 정책, 제품 또는 기타 정보를 자동으로 알지는 못합니다. RAG(검색 증강 생성)는 응답하기 전에 관련 외부 정보를 검색해 모델에 제공함으로써 이 문제를 해결합니다.
RAG는 AI가 제공하는 답변을 기업의 실제 문서에 기반하도록 합니다. 고객 지원 에이전트가 RAG를 사용하면 답변 전에 최신 반품 정책이나 제품 사양을 가져올 수 있어 환각 위험을 낮출 수 있습니다.
이 가이드에서는 AI에서 RAG가 무엇을 의미하는지, 검색과 생성이 어떻게 함께 작동하는지, 그리고 RAG가 단독 LLM과 어떻게 다른지 설명합니다. 또한 RAG의 한계, 생성형 AI 애플리케이션에서 효과적인 활용 분야, 그리고 RAG가 AI 에이전트의 지식 검색을 지원하는 방법도 살펴봅니다.

요약
- RAG는 검색 시스템과 생성 모델을 결합해 모델이 학습 데이터 범위를 넘어선 정보를 활용할 수 있게 합니다.
- RAG가 검색하는 지식은 모델 외부에 있으므로 재학습 없이 업데이트할 수 있습니다.
- ElevenAgents는 지식 베이스가 너무 커서 모델 컨텍스트에 직접 담을 수 없을 때 자동으로 RAG를 사용하므로, 크고 복잡한 지식 베이스에서도 정확도를 유지하면서 빠르게 답변합니다.
AI에서 RAG란 무엇인가요?
RAG는 브랜드 가이드라인, 제품 매뉴얼, 지식 베이스 문서 또는 내부 데이터베이스 등의 외부 정보를 LLM에 제공하기 위해 LLM을 중심으로 구축된 시스템 아키텍처입니다. 이를 통해 AI는 비즈니스별 정보를 활용할 수 있으므로, 모델이 학습하지 않은 최신 정책, 비공개 지식 및 회사 세부 정보를 답변에 반영할 수 있습니다.
LLM은 컨텍스트 윈도우라고 하는 제한된 양의 정보만 한 번에 고려할 수 있습니다. 대규모 조직 지식 베이스는 이 한도를 빠르게 초과할 수 있으므로, RAG는 정보를 LLM 외부에 유지하고 현재 질문에 필요한 문단만 검색합니다.
이 이름은 정보가 시스템을 통해 이동하는 방식을 설명합니다.
- 검색: 사용자 요청과 일치하는 콘텐츠를 찾기 위해 정책 문서, 헬프데스크 로그 또는 재고 파일처럼 연결된 소스를 검색합니다.
- 증강: 검색된 문단 중 가장 관련성 높은 내용을 프롬프트 컨텍스트에 추가합니다.
- 생성: 사용자 요청과 검색된 컨텍스트를 활용해 답변을 생성합니다.
RAG는 답변을 생성할 때 사용할 관련 자료를 LLM에 제공함으로써 AI 응답을 특정 소스 정보에 연결하는 방식인 그라운딩도 지원합니다. 예를 들어 고객이 보증 정책에 관해 질문하면, RAG 시스템은 회사 문서에서 관련 조건을 검색하여 LLM이 이를 바탕으로 답변하도록 제공합니다.

검색 증강 생성은 어떻게 작동하나요?
RAG 시스템은 외부 지식을 검색할 수 있도록 준비하고, 사용자 질문과 가장 관련성 높은 정보를 검색한 뒤, 응답을 생성하기 전에 해당 정보를 컨텍스트로 LLM에 제공합니다.
RAG 구현은 복잡도가 다양합니다. 기본 RAG는 단순한 검색 및 생성 프로세스를 사용하며, 더 고급 접근 방식에는 쿼리 재작성, 필터링, 재순위화 또는 기타 검색 기법이 추가될 수 있습니다.
RAG 프로세스는 일반적으로 5단계를 따릅니다.
- 지식 준비: 문서를 더 작은 문단으로 나누고(이를 ‘청킹’이라고 합니다), 임베딩이라는 수학적 표현으로 변환한 후 검색 가능한 인덱스 또는 벡터 데이터베이스에 저장합니다.
- 쿼리 처리: 시스템이 사용자 질문을 해석하고, 더 고급 RAG 시스템에서는 검색 전에 질문을 재작성하거나 구체화합니다.
- 관련 문단 검색: 검색기가 인덱싱된 지식 베이스에서 요청과 가장 잘 일치하는 텍스트 청크를 찾습니다.
- 모델 요청에 컨텍스트 추가: 선택된 문단을 사용자 질문, 관련 지침 및 대화 기록과 함께 LLM에 전송합니다.
- 응답 생성: LLM은 검색된 자료를 컨텍스트의 일부로 활용해 답변을 생성합니다.
많은 RAG 시스템은 외부 도구로서 선택적으로 검색을 실행합니다. ElevenAgents에서는 에이전트 설정에서 지식 베이스에 RAG를 직접 활성화할 수 있으며, 시스템은 대화 후속 질문에서 이전 대화와 모호한 참조를 정확하고 독립적인 검색 쿼리로 바꾸기 위해 쿼리 재작성을 사용합니다.
적시에 응답할 수 있도록 ElevenLabs는 각 쿼리를 여러 재작성 모델에 병렬로 전송하고 가장 먼저 유효한 응답을 사용하는 모델 레이싱 아키텍처도 개발했습니다. 이 방식은RAG 중앙 지연 시간을 절반으로 줄였습니다. 326ms에서 155ms로 단축해, 대규모 지식 베이스로 인해 검색이 실행될 때도 자연스러운 대화 흐름을 유지할 만큼 빠른 검색을 제공합니다.

LLM과 RAG 모델의 차이점은 무엇인가요?
LLM은 언어를 이해하고 생성하는 모델입니다. RAG는 애플리케이션에 필요할 때 외부 정보를 검색하는 LLM 주변의 아키텍처입니다.
LLM을 RAG와 결합하면 다음과 같이 달라집니다.
기능 | LLM 단독 | RAG를 사용하는 LLM |
지식 | 학습 데이터 및 현재 컨텍스트 | 학습 데이터, 현재 컨텍스트 및 정책, 제품 문서, 지식 베이스 콘텐츠 등의 검색된 회사 정보 |
업데이트 | 새 정보는 컨텍스트 또는 모델 업데이트를 통해 제공해야 함 | 외부 지식을 모델과 별도로 업데이트할 수 있음 |
비공개 정보 | 제공되지 않으면 사용할 수 없음 | 승인된 비공개 소스에서 검색 가능 |
검색 | 기본 모델의 일부가 아님 | 주변 RAG 시스템이 추가함 |
‘RAG 모델’은 RAG 시스템 안에서 사용되는 LLM의 줄임말로 쓰이기도 합니다. 예를 들어 회사가 고객 지원에 ‘RAG 모델’을 사용한다고 말할 수 있지만, 실제 구성은 답변을 생성하기 전에 관련 고객센터 또는 정책 콘텐츠를 검색하는 LLM입니다.

실제 애플리케이션에서 RAG 모델의 한계
RAG는 LLM 외부에 저장된 관련 비즈니스 지식에 대한 접근성을 높이지만, 검색에는 자체적인 한계가 있으며 정확한 답변을 보장하지는 않습니다. 주요 한계는 시스템이 검색하는 내용, 모델에 전송하는 내용 및 모델의 응답 방식에서 나타납니다.
- 검색 품질: 시스템이 가장 관련성 높은 문단을 놓치면 LLM은 불완전하거나 부족한 컨텍스트에서 시작하게 됩니다. 부정확하게 작성된 쿼리, 약한 의미적 일치 또는 모호한 표현은 모두 검색을 잘못된 방향으로 이끌 수 있습니다.
- 소스 품질: 오래되었거나 상충되거나 불완전한 문서는 신뢰할 수 없는 답변으로 이어질 수 있습니다.
- 컨텍스트 선택: 부적절한 청킹이나 검색 선택으로 필요한 세부 정보가 빠지거나 관련 없는 정보가 포함될 수 있습니다.
- 추가 지연 시간: 생성 전에 검색과 쿼리 처리가 이루어지므로 실시간 애플리케이션에서 응답이 느려질 수 있습니다.
- 생성 오류: LLM은 여전히 검색된 정보를 잘못 해석하거나 근거 없는 주장을 추가할 수 있습니다.
RAG는 환각 위험을 낮출 수 있지만 완전히 없애지는 못합니다. 정확한 결과는 여전히 잘 관리된 소스, 효과적인 검색 및 최종 응답에 대한 제어에 달려 있습니다.

생성형 AI에서의 RAG: 실용적인 활용 사례와 이점
RAG는 AI 애플리케이션에 자주 변경되는 정보, 조직 소유의 정보 또는 모든 모델 요청에 포함하기에는 너무 방대한 정보가 필요할 때 가장 유용합니다.
RAG가 가장 큰 차이를 만드는 분야는 다음과 같습니다.
자주 업데이트되는 정보 반영
RAG는 AI 응답을 최신 제품 세부 정보, 가격, 정책 및 재고에 맞춰 유지하도록 돕습니다. 팀은 소스 정보를 독립적으로 업데이트할 수 있고, RAG는 질문이 들어올 때 관련 버전을 검색합니다. 예를 들어 리드 자격 평가 에이전트는 인바운드 발신자의 자격을 평가할 때 최신 가격이나 요금제 세부 정보를 가져올 수 있습니다.
비공개 또는 전문 지식 활용
내부 정책, 기술 문서 또는 특정 팀을 위한 지원 콘텐츠처럼 일부 지식은 공개 정보가 아니라 비공개이거나 전문적입니다. RAG를 사용하면 에이전트는 공개적으로 이용 가능하거나 모델에 내장된 정보에만 의존하지 않고 이러한 소스에서 직접 검색할 수 있습니다.
예를 들어 내부 IT 또는 HR 헬프데스크 에이전트는 해당 정보가 없는 공개 문서를 검색하는 대신, HR 전용 지식 베이스에서 검색하여 직원 복리후생 질문에 답변할 수 있습니다.
대규모 지식 베이스 검색
RAG는 회사가 LLM이 한 번의 요청에서 고려할 수 있는 양보다 훨씬 많은 문서를 보유한 경우에 유용합니다. 전체 컬렉션을 모델에 전송하는 대신 현재 질문과 관련된 문단만 검색합니다. 영업 환경에서는 기술 지원 도우미가 통화 중 제품 매뉴얼을 검색해 관련 요구 사항을 찾을 수 있습니다.
고급 RAG 솔루션을 위한 ElevenAgents 시작하기
ElevenAgents를 사용하면 노코드 웹 플랫폼을 통해서든, 에이전트를 자체 제품에 직접 통합하려는 팀을 위한 API를 통해서든 연결된 지식 소스와 RAG를 사용하는 AI 음성 및 채팅 에이전트를 구축할 수 있습니다.
RAG 지원 에이전트의 경우 팀은 지식 베이스에 문서, URL 또는 텍스트를 추가하고 각 쿼리와 관련된 정보만 검색할 수 있습니다.
ElevenLabs는 실시간 대화를 위해 검색도 최적화하여 ElevenAgents 아키텍처에서 RAG 중앙 지연 시간을 326ms에서 155ms로 줄였습니다. ElevenAgents로 구축하는 팀은 대시보드에서 에이전트를 구성하든 API를 통해 기반을 구축하든 이러한 검색 기능을 기본으로 이용할 수 있습니다.
구축 시작하기 ElevenAgents로 시작하거나팀에 문의하기를 통해 애플리케이션에 적합한 구성을 논의해 보세요.

