RAG란? 검색 증강 생성의 작동 방식
- 게시일
- 최종 업데이트
AI 모델은 학습 중에 배운 내용을 바탕으로 답변을 생성하므로, 학습 이후에 만들어진 회사의 정책, 제품 또는 기타 정보를 자동으로 알지는 못합니다. RAG(검색 증강 생성)는 응답하기 전에 관련 외부 정보를 검색해 모델에 제공함으로써 이 문제를 해결합니다.
RAG는 AI가 제공하는 답변을 기업의 실제 문서에 기반하도록 합니다. RAG를 사용하는 고객 지원 에이전트는 답변하기 전에 최신 반품 정책이나 제품 사양을 가져올 수 있어 환각 위험을 낮춥니다.
이 가이드에서는 AI에서 RAG가 무엇을 의미하는지, 검색과 생성이 어떻게 함께 작동하는지, RAG가 단독 LLM과 어떻게 다른지 설명합니다. 또한 RAG의 한계, 생성형 AI 애플리케이션에서 효과적인 활용 분야, RAG가 AI 에이전트의 지식 검색을 어떻게 지원하는지도 살펴봅니다.

요약
- RAG는 검색 시스템과 생성 모델을 결합해 모델이 학습 데이터 이상의 정보를 활용할 수 있게 합니다.
- RAG가 검색하는 지식은 모델 외부에 있으므로, 재학습 없이 업데이트할 수 있습니다.
- ElevenAgents는 지식 베이스가 너무 커서 모델의 컨텍스트에 직접 넣을 수 없을 때 자동으로 RAG를 사용하므로, 크고 복잡한 지식 베이스에서도 정확도를 유지하면서 빠르게 답변합니다.
AI에서 RAG란 무엇인가요?
RAG는 브랜드 가이드라인, 제품 매뉴얼, 지식 베이스 문서 또는 내부 데이터베이스 등의 외부 정보를 LLM에 제공하도록 설계된 시스템 아키텍처입니다. 이를 통해 AI는 비즈니스별 정보를 활용할 수 있어, 모델이 학습한 적 없는 최신 정책, 비공개 지식, 회사 세부 정보를 답변에 반영할 수 있습니다.
LLM은 한 번에 제한된 양의 정보만 고려할 수 있으며, 이를 컨텍스트 윈도우라고 합니다. 대규모 조직 지식 베이스는 이 한도를 빠르게 초과할 수 있으므로, RAG는 정보를 LLM 외부에 두고 현재 질문에 필요한 부분만 검색합니다.
이름은 정보가 시스템을 통과하는 방식을 설명합니다:
- 검색: 정책 문서, 헬프데스크 로그, 재고 파일 등 연결된 소스에서 사용자의 요청과 일치하는 콘텐츠를 찾습니다.
- 증강: 검색된 내용 중 가장 관련성 높은 부분을 프롬프트 컨텍스트에 추가합니다.
- 생성: 사용자의 요청과 검색된 컨텍스트를 활용해 답변을 생성합니다.
RAG는 답변을 생성할 때 사용할 관련 자료를 LLM에 제공하여, AI 응답을 특정 소스 정보에 연결하는 방식인 그라운딩도 지원합니다. 예를 들어 고객이 보증 정책에 관해 질문하면 RAG 시스템은 회사 문서에서 관련 조건을 검색해 LLM이 이를 바탕으로 답변할 수 있도록 제공합니다.

검색 증강 생성은 어떻게 작동하나요?
RAG 시스템은 검색할 수 있도록 외부 지식을 준비하고, 사용자 질문과 가장 관련성 높은 정보를 검색한 다음, 응답을 생성하기 전에 해당 정보를 컨텍스트로 LLM에 제공합니다.
RAG 구현의 복잡도는 다양합니다. 기본 RAG는 단순한 검색 및 생성 프로세스를 사용하지만, 더 고급 방식에는 쿼리 재작성, 필터링, 재순위 지정 또는 기타 검색 기법이 추가될 수 있습니다.
RAG 프로세스는 일반적으로 다음 5단계를 따릅니다:
- 지식 준비: 문서를 더 작은 부분으로 나누고(이를 '청킹'이라고 함), 임베딩이라는 수학적 표현으로 변환한 후 검색 가능한 인덱스나 벡터 데이터베이스에 저장합니다.
- 쿼리 처리: 시스템이 사용자의 질문을 해석하고, 더 고급 RAG 시스템에서는 검색 전에 질문을 재작성하거나 구체화합니다.
- 관련 부분 검색: 검색기가 색인된 지식 베이스에서 요청과 가장 잘 일치하는 텍스트 청크를 찾습니다.
- 모델 요청에 컨텍스트 추가: 선택된 부분을 사용자 질문, 관련 지침, 대화 기록과 함께 LLM에 보냅니다.
- 응답 생성: LLM은 검색된 자료를 컨텍스트의 일부로 활용해 답변을 생성합니다.
많은 RAG 시스템은 외부 도구로서 선택적으로 검색을 실행합니다. ElevenAgents에서는 에이전트 설정에서 지식 베이스에 RAG를 직접 활성화할 수 있으며, 시스템은 대화 후속 질문에서 이전 대화와 모호한 지시어를 정확하고 독립적인 검색 쿼리로 변환하기 위해 쿼리 재작성을 사용합니다.
신속한 응답을 보장하기 위해 ElevenLabs는 각 쿼리를 여러 재작성 모델에 병렬로 보내고 가장 먼저 유효한 응답을 사용하는 모델 레이싱 아키텍처도 개발했습니다. 이 방식은 RAG 중앙 지연 시간을 절반으로 줄였습니다. 326ms에서 155ms로 줄어들어, 대규모 지식 베이스로 인해 검색이 실행되는 경우에도 자연스러운 대화 흐름을 유지할 만큼 빠른 검색이 가능합니다.

LLM과 RAG 모델의 차이점은 무엇인가요?
LLM은 언어를 이해하고 생성하는 모델입니다. RAG는 애플리케이션에서 필요할 때 외부 정보를 검색하는, LLM을 둘러싼 아키텍처입니다.
LLM을 RAG와 결합하면 다음과 같이 달라집니다:
기능 | LLM 단독 | RAG와 함께 사용하는 LLM |
지식 | 학습 데이터와 현재 컨텍스트 | 학습 데이터, 현재 컨텍스트, 정책·제품 문서·지식 베이스 콘텐츠 등의 검색된 회사 정보 |
업데이트 | 새 정보는 컨텍스트 또는 모델 업데이트를 통해 제공해야 함 | 외부 지식을 모델과 별도로 업데이트할 수 있음 |
비공개 정보 | 제공되지 않으면 사용할 수 없음 | 승인된 비공개 소스에서 검색할 수 있음 |
검색 | 기본 모델의 일부가 아님 | 주변 RAG 시스템이 추가함 |
'RAG 모델'은 RAG 시스템 안에서 사용되는 LLM을 줄여 부르는 말로 쓰이기도 합니다. 예를 들어 회사는 고객 지원에 'RAG 모델'을 사용한다고 말할 수 있지만, 실제 구성은 답변을 생성하기 전에 관련 고객센터 또는 정책 콘텐츠를 검색하는 LLM입니다.

실제 애플리케이션에서 RAG 모델의 한계
RAG는 LLM 외부에 저장된 관련 비즈니스 지식에 대한 접근성을 높이지만, 검색에는 고유한 한계가 있으며 정답을 보장하지는 않습니다. 주요 한계는 시스템이 무엇을 검색하는지, 모델에 무엇을 보내는지, 모델이 어떻게 응답하는지에서 나타납니다:
- 검색 품질: 시스템이 가장 관련성 높은 부분을 놓치면 LLM은 불완전하거나 부족한 컨텍스트에서 시작하게 됩니다. 표현이 부정확한 쿼리, 약한 의미적 일치 또는 모호한 표현은 모두 검색을 잘못된 방향으로 이끌 수 있습니다.
- 소스 품질: 오래되었거나 서로 충돌하거나 불완전한 문서는 신뢰할 수 없는 답변으로 이어질 수 있습니다.
- 컨텍스트 선택: 부적절한 청킹 또는 검색 선택으로 필요한 세부 정보가 빠지거나 관련 없는 정보가 포함될 수 있습니다.
- 추가 지연 시간: 검색과 쿼리 처리는 생성 전에 이루어지므로 실시간 애플리케이션에서는 응답 속도가 느려질 수 있습니다.
- 생성 오류: LLM은 여전히 검색된 정보를 잘못 해석하거나 근거 없는 주장을 추가할 수 있습니다.
RAG는 환각 위험을 줄일 수 있지만 완전히 없애지는 못합니다. 정확한 결과를 얻으려면 잘 관리된 소스, 효과적인 검색, 최종 응답을 제어하는 장치가 여전히 필요합니다.

생성형 AI의 RAG: 실용적인 활용 사례와 이점
RAG는 AI 애플리케이션에 자주 변경되거나 조직에 속해 있거나 모든 모델 요청에 포함하기에는 너무 큰 정보가 필요할 때 가장 유용합니다.
RAG가 가장 큰 차이를 만드는 분야는 다음과 같습니다:
자주 업데이트되는 정보 최신 상태 유지
RAG는 AI 응답이 최신 제품 세부 정보, 가격, 정책 및 재고와 일치하도록 지원합니다. 팀은 소스 정보를 독립적으로 업데이트할 수 있고, 질문이 들어오면 RAG가 관련 버전을 검색합니다. 예를 들어 리드 검증 에이전트는 인바운드 발신자를 검증할 때 최신 가격이나 요금제 세부 정보를 가져올 수 있습니다.
비공개 또는 전문 지식 활용
내부 정책, 기술 문서 또는 특정 팀을 위한 지원 콘텐츠처럼 일부 지식은 공개 정보가 아니라 비공개 또는 전문 정보입니다. RAG를 사용하면 에이전트는 공개적으로 이용 가능한 정보나 모델에 내장된 정보에만 의존하지 않고 이러한 소스에서 직접 검색할 수 있습니다.
예를 들어 내부 IT 또는 HR 헬프데스크 에이전트는 해당 정보가 없는 공개 문서를 검색하는 대신 HR 전용 지식 베이스에서 검색하여 직원 복리후생 관련 질문에 답변할 수 있습니다.
대규모 지식 베이스 검색
RAG는 회사의 문서가 LLM이 한 번의 요청에서 고려할 수 있는 양보다 훨씬 많을 때 유용합니다. 전체 컬렉션을 모델에 보내는 대신 현재 질문과 관련된 부분만 검색합니다. 영업 상황에서는 기술 지원 담당자가 통화 중 관련 요구 사항을 찾기 위해 제품 매뉴얼을 검색할 수 있습니다.
고급 RAG 솔루션을 위한 ElevenAgents 시작하기
ElevenAgents를 사용하면 노코드 웹 플랫폼을 통해서든, 에이전트를 자체 제품에 직접 임베드하려는 팀을 위한 API를 통해서든, 연결된 지식 소스와 RAG를 사용하는 AI 음성 및 채팅 에이전트를 구축할 수 있습니다.
RAG가 활성화된 에이전트의 경우, 팀은 지식 베이스에 문서, URL 또는 텍스트를 추가하고 각 쿼리와 관련된 정보만 검색할 수 있습니다.
ElevenLabs는 실시간 대화에 맞춰 검색도 최적화하여 ElevenAgents 아키텍처에서 RAG 중앙 지연 시간을 326ms에서 155ms로 줄였습니다. 대시보드에서 에이전트를 구성하든 API를 통해 이를 기반으로 구축하든, ElevenAgents로 구축하는 팀은 이러한 검색 기능을 기본으로 이용할 수 있습니다.
구축 시작하기 ElevenAgents로 구축을 시작하거나팀에 문의하기를 통해 애플리케이션에 적합한 구성을 논의해 보세요.
RAG FAQ
Jack Limebear는 Growth 팀에서 블로그와 인사이트 페이지의 콘텐츠 작가이자 전략가로 활동하고 있습니다. ElevenLabs에 합류하기 전에는 빠르게 성장하는 SaaS 스타트업부터 포춘 500대 기업까지 다양한 조직에서 10년 넘게 콘텐츠 전략을 이끌었습니다. 케임브리지 대학교에서 영문학 석사 학위를 취득했습니다.



