~/questoes/agentes-de-ia
Similarity search é o mecanismo que permite um sistema RAG encontrar documentos relevantes comparando a proximidade entre vetores no espaço semântico. Quando você faz uma pergunta, ela é convertida em um vetor e comparada com os vetores dos documentos armazenados, retornando os mais parecidos semanticamente.
A alternativa C está correta porque similarity search realmente mede a proximidade entre vetores usando algoritmos matemáticos como cosine similarity. Esses algoritmos calculam o quão próximos dois vetores estão no espaço semântico, permitindo identificar qual documento é mais relevante para uma query específica.
Eliminar duplicatas é uma tarefa de pré-processamento de dados, não o objetivo principal do similarity search. Além disso, similarity search trabalha com vetores e similaridade semântica, não com detecção de duplicação exata de documentos.
Validar equivalência semântica entre respostas é um conceito diferente. Similarity search não compara respostas entre si, mas sim compara uma query com documentos armazenados para encontrar os mais relevantes para recuperação de contexto.
Esta é a definição correta. Similarity search mede a distância entre vetores usando algoritmos como cosine similarity, que calcula o ângulo entre dois vetores. Quanto menor o ângulo, maior a similaridade semântica e maior a relevância do documento.
Similarity search não é uma técnica de criptografia. Ele trabalha com operações matemáticas abertas para comparação vetorial, não com proteção ou codificação de dados. A segurança de vetores é uma preocupação separada, não o propósito do similarity search.