Pular para o conteúdo

O que é RAG? Como funciona a Geração Aumentada por Recuperação

Escrito por
Jack Limebear
Publicado
Última atualização

OuvirOuça este artigo

Os modelos de IA geram respostas com base no que aprenderam durante o treinamento. Isso significa que eles não conhecem automaticamente as políticas, os produtos ou outras informações de uma empresa criadas após esse treinamento. O RAG (Geração Aumentada por Recuperação) resolve isso ao buscar informações externas relevantes e fornecê-las ao modelo antes que ele responda.

O RAG fundamenta as respostas dadas por uma IA nos documentos reais de uma empresa. Um agente de suporte ao cliente que usa RAG pode consultar a política de devolução ou a especificação do produto atual antes de responder, reduzindo o risco de alucinações.

Este guia explica o que RAG significa em IA, como recuperação e geração trabalham juntas e como o RAG difere de um LLM usado isoladamente. Também abordaremos as limitações do RAG, onde ele funciona bem em aplicações de IA generativa e como ele oferece suporte à recuperação de conhecimento em agentes de IA.

ElevenLabs Conversational AI demo introducing Retrieval-Augmented Generation (RAG).

Resumo

  • O RAG combina um sistema de recuperação com um modelo generativo para que o modelo possa usar informações além dos seus dados de treinamento.
  • O conhecimento recuperado pelo RAG fica fora do modelo, então pode ser atualizado sem necessidade de retreinamento.
  • O ElevenAgents usa RAG automaticamente quando uma base de conhecimento é grande demais para caber diretamente no contexto do modelo, mantendo as respostas rápidas sem comprometer a precisão em bases de conhecimento grandes e complexas.

O que é RAG em IA?

RAG é uma arquitetura de sistema construída em torno de um LLM para fornecer informações externas, como diretrizes de marca, manuais de produtos, artigos da base de conhecimento ou bancos de dados internos. Isso permite que a IA trabalhe com informações específicas da empresa, para que suas respostas reflitam políticas atuais, conhecimento privado e detalhes da empresa nos quais o modelo nunca foi treinado.

Um LLM também só consegue considerar uma quantidade limitada de informações por vez, conhecida como janela de contexto. Uma grande base de conhecimento organizacional pode ultrapassar esse limite rapidamente. Por isso, o RAG mantém as informações fora do LLM e recupera apenas os trechos necessários para a pergunta atual.

O nome descreve como as informações se movem pelo sistema:

  • Recuperação: busca em fontes conectadas, como documentos de políticas, registros da central de ajuda ou arquivos de inventário, conteúdo que corresponda à solicitação do usuário.
  • Aumentada: adiciona os trechos recuperados mais relevantes ao contexto do prompt.
  • Geração: usa a solicitação do usuário e o contexto recuperado para produzir a resposta.

O RAG também oferece suporte ao grounding, a prática de vincular uma resposta de IA a informações específicas da fonte, fornecendo ao LLM material relevante para usar ao gerar uma resposta. Por exemplo, se um cliente perguntar sobre uma política de garantia, o sistema RAG recupera os termos relevantes na documentação da empresa e os fornece ao LLM para que responda com base neles.

RAG retrieves relevant sources, augments prompts with context, and generates answers.

Como funciona a Geração Aumentada por Recuperação?

Um sistema RAG prepara conhecimento externo para pesquisa, recupera as informações mais relevantes para a pergunta do usuário e as fornece ao LLM como contexto antes de gerar uma resposta.

As implementações de RAG variam em complexidade. O RAG básico usa um processo direto de recuperar e gerar, enquanto abordagens mais avançadas podem incluir reescrita de consultas, filtragem, reranqueamento ou outras técnicas de recuperação.

O processo de RAG geralmente segue cinco etapas:

  1. Preparar o conhecimento: os documentos são divididos em trechos menores (um processo chamado “chunking”), convertidos em representações matemáticas chamadas embeddings e armazenados em um índice pesquisável ou banco de dados vetorial.

  2. Processar a consulta: o sistema interpreta a pergunta do usuário e, em sistemas RAG mais avançados, a reescreve ou refina antes de pesquisar.

  3. Recuperar trechos relevantes: o recuperador pesquisa na base de conhecimento indexada os blocos de texto que melhor correspondem à solicitação.

  4. Adicionar contexto à solicitação do modelo: os trechos selecionados são enviados ao LLM junto da pergunta do usuário, das instruções relevantes e do histórico da conversa.

  5. Gerar a resposta: o LLM produz uma resposta usando o material recuperado como parte do seu contexto.

Muitos sistemas RAG acionam a recuperação de forma seletiva como uma ferramenta externa. O ElevenAgents permite que as equipes ativem o RAG para uma base de conhecimento diretamente nas configurações do agente, e o sistema usa reescrita de consultas para transformar diálogos anteriores e referências vagas em uma consulta de pesquisa precisa e independente durante acompanhamentos na conversa.

Para garantir respostas rápidas, a ElevenLabs também desenvolveu uma arquitetura de corrida de modelos que envia cada consulta a vários modelos de reescrita em paralelo e usa a primeira resposta válida. Essa abordagem reduziu a latência mediana do RAG pela metade, de 326 ms para 155 ms, mantendo a recuperação rápida o suficiente para preservar um fluxo natural de conversa, mesmo quando uma base de conhecimento grande a aciona.

Five-step RAG workflow; model racing cuts median latency from 326 ms to 155 ms.

Qual é a diferença entre LLMs e modelos RAG?

Um LLM é um modelo que entende e gera linguagem. O RAG é uma arquitetura em torno do LLM que recupera informações externas quando a aplicação precisa delas.

Veja o que muda quando um LLM é combinado ao RAG:

Recurso

LLM isolado

LLM usado com RAG

Conhecimento

Dados de treinamento e contexto atual

Dados de treinamento, contexto atual e informações recuperadas da empresa, como políticas, documentação de produtos ou conteúdo da base de conhecimento

Atualizações

Novas informações devem ser fornecidas no contexto ou por meio de atualizações do modelo

O conhecimento externo pode ser atualizado separadamente do modelo

Informações privadas

Não disponíveis, a menos que sejam fornecidas

Pode recuperar informações de fontes privadas aprovadas

Recuperação

Não faz parte do modelo base

Adicionada pelo sistema RAG ao redor

“Modelo RAG” às vezes é usado como uma forma abreviada de se referir a um LLM usado dentro de um sistema RAG. Por exemplo, uma empresa pode dizer que usa um “modelo RAG” para suporte ao cliente quando, na verdade, a configuração é um LLM que recupera conteúdo relevante da central de ajuda ou de políticas antes de gerar uma resposta.

LLM alone vs. RAG: retrieval adds private company information without changing model weights.

Limitações dos modelos RAG em aplicações do mundo real

O RAG melhora o acesso ao conhecimento empresarial relevante armazenado fora do LLM, mas a recuperação traz suas próprias limitações e não garante uma resposta correta. As principais limitações aparecem no que o sistema recupera, no que envia ao modelo e na forma como o modelo responde:

  • Qualidade da recuperação: se o sistema não encontrar o trecho mais relevante, o LLM começa com um contexto incompleto ou fraco. Consultas mal formuladas, correspondências semânticas fracas ou termos ambíguos podem direcionar a recuperação para o caminho errado.
  • Qualidade das fontes: documentos desatualizados, conflitantes ou incompletos podem levar a respostas pouco confiáveis.
  • Seleção de contexto: escolhas inadequadas de chunking ou recuperação podem remover detalhes necessários ou introduzir informações irrelevantes.
  • Latência adicional: a recuperação e o processamento de consultas ocorrem antes da geração, o que pode tornar as respostas mais lentas em aplicações em tempo real.
  • Erros de geração: o LLM ainda pode interpretar incorretamente as informações recuperadas ou incluir alegações sem embasamento.

Embora o RAG possa reduzir o risco de alucinações, ele não o elimina completamente. Resultados precisos ainda dependem de fontes bem mantidas, recuperação eficaz e controles sobre a resposta final.

Slide lists five RAG limitations and says it reduces, but does not eliminate, hallucinations.

RAG em IA generativa: casos de uso práticos e benefícios

O RAG é mais útil quando uma aplicação de IA precisa de informações que mudam com frequência, pertencem à organização ou são grandes demais para serem incluídas em todas as solicitações ao modelo.

Veja onde o RAG faz mais diferença:

Acompanhando informações atualizadas com frequência

O RAG ajuda as equipes a manter as respostas da IA alinhadas aos detalhes atuais de produtos, preços, políticas e inventário. As equipes podem atualizar as informações de origem de forma independente, e o RAG recupera a versão relevante quando uma pergunta é feita. Por exemplo, um agente de qualificação de leads pode consultar os preços ou detalhes mais recentes dos planos ao qualificar uma pessoa que liga para a empresa.

Usando conhecimento privado ou especializado

Alguns conhecimentos são privados ou especializados, em vez de públicos, como políticas internas, documentação técnica ou conteúdo de suporte destinado a uma equipe específica. O RAG permite que um agente recupere diretamente dessas fontes, em vez de depender apenas do que está disponível publicamente ou incorporado ao modelo.

Por exemplo, um agente interno de helpdesk de TI ou RH pode recuperar informações de uma base de conhecimento específica de RH para responder a perguntas sobre benefícios dos funcionários, em vez de pesquisar documentação pública que não teria essas informações.

Pesquisando grandes bases de conhecimento

O RAG ajuda quando uma empresa tem muito mais documentação do que um LLM consegue considerar em uma única solicitação. Ele recupera apenas os trechos relevantes para a pergunta atual, em vez de enviar toda a coleção ao modelo. Em vendas, um assistente técnico pode pesquisar manuais de produtos para encontrar requisitos relevantes durante uma chamada.

Comece a usar o ElevenAgents para soluções RAG avançadas

O ElevenAgents permite que as equipes criem agentes de voz IA e chat que usam RAG com fontes de conhecimento conectadas, seja pela plataforma web sem código ou pela API, para equipes que querem incorporar agentes diretamente aos próprios produtos.

Para agentes com RAG ativado, as equipes podem adicionar documentos, URLs ou texto a uma base de conhecimento e recuperar apenas as informações relevantes para cada consulta.

A ElevenLabs também otimizou a recuperação para conversas em tempo real, reduzindo a latência mediana do RAG de 326 ms para 155 ms em sua arquitetura ElevenAgents. As equipes que criam com o ElevenAgents têm esses recursos de recuperação prontos para uso, seja configurando um agente pelo painel ou desenvolvendo sobre ele via API.

Comece a criar com o ElevenAgents ou fale com nossa equipe para discutir a configuração ideal para sua aplicação.

Perguntas frequentes sobre RAG

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade