~/questoes/agentes-de-ia
Vetorização é o processo de transformar textos em números (vetores) que representam o significado semântico dos documentos. No RAG, esses vetores permitem que o sistema compare e encontre documentos relevantes rapidamente, mesmo quando as palavras são diferentes mas o sentido é parecido.
A vetorização cria representações numéricas dos documentos que vivem em um espaço semântico. Quando você faz uma pergunta, ela também vira um vetor e o sistema compara proximidades entre vetores usando métricas como cosine similarity, retornando os documentos mais próximos semanticamente.
Essa é a função central da vetorização em RAG. Os embeddings criam vetores densos que permitem o similarity search funcionar. Em vez de buscar palavras exatas, o sistema entende significado e encontra documentos relevantes mesmo com variações de linguagem.
Vetorização de documentos existentes não treina novos modelos. Ela usa modelos de embedding já treinados para representar o conhecimento. O treinamento de LLMs é uma etapa completamente diferente e bem mais complexa.
Vetorização não é um método de criptografia. Os vetores são números que representam significado semântico, não segredo. Se você precisa proteger dados sensíveis, vai usar criptografia de verdade, não embeddings.
Na verdade, vetorização pode aumentar o tamanho total armazenado, pois você mantém tanto o documento original quanto seu vetor. O objetivo não é economizar espaço, mas sim criar uma forma de busca semântica eficiente.