~/questoes/agentes-de-ia
RAG (Retrieval-Augmented Generation) é uma arquitetura que combina buscas inteligentes em banco de dados com modelos de linguagem. Ao enviar apenas os trechos relevantes para a API, o sistema economiza tokens e reduz custos, já que não processa toda a base de conhecimento a cada pergunta.
A alternativa correta explica que RAG envia apenas o contexto relevante encontrado através de busca por similaridade no banco vetorizado. Isso significa que a IA recebe a pergunta do usuário junto com apenas os chunks mais pertinentes, não precisando processar documentos desnecessários, economizando tokens e recursos da API.
Limitar o número de perguntas por usuário é uma estratégia de controle de acesso, não uma técnica de otimização de tokens. Isso não resolve o problema de consumo desnecessário em cada consulta.
RAG não processa tudo localmente sem usar a API. Ele depende da OpenAI para gerar as respostas finais. O processamento local refere-se apenas à busca de similaridade no banco vetorizado, antes de enviar dados para a API.
Esta é a resposta correta. RAG busca no banco vetorizado apenas os chunks similares à pergunta e envia esses trechos contextualizados junto com a pergunta para a OpenAI. Assim, a API processa apenas informações relevantes, economizando tokens.
Armazenar respostas anteriores é um cache de resultados, não um mecanismo direto do RAG. Embora útil, não é como o sistema evita gastar tokens desnecessariamente em cada nova consulta.