~/questoes/inteligencia-artificial
RAG (Retrieval-Augmented Generation) é uma técnica que permite integrar documentos pessoais ao contexto de um modelo de IA local sem modificar seus pesos originais. Isso torna o modelo capaz de responder com base em informações específicas do seu acervo, mantendo a privacidade e eficiência.
RAG funciona recuperando trechos relevantes dos seus documentos e inserindo-os no contexto da pergunta antes de gerar a resposta. Diferente de fine-tuning, não altera o modelo; é uma abordagem prática para customização sem retreinamento complexo.
Fine-tuning realmente modifica os pesos do modelo através de retreinamento. Não é a técnica mais prática para usar documentos próprios localmente, pois é mais complexa e cara em recursos computacionais.
Cache de modelos armazena respostas anteriores para reutilização rápida, mas não resolve o problema de alimentar o modelo com novos documentos. Além disso, armazenar indefinidamente consome muita memória.
Prompt engineering ajusta instruções para melhorar respostas, mas não integra seus documentos ao modelo. Limitar respostas a tópicos específicos via prompts é frágil comparado a ter dados estruturados disponíveis.
RAG busca trechos relevantes dos seus documentos e os adiciona ao contexto da requisição, permitindo que o modelo responda com base em informações customizadas sem modificar sua estrutura interna.