ANÚNCIO

~/questoes/agentes-de-ia

Para que serve o parâmetro score_threshold em um Retriever?

Responda, confira o feedback e use o resultado para orientar sua revisão.
Aula de referência Aula 16: Recuperadores no LangChain – Curso Completo para Iniciantes
Para fixar

Score Threshold em Retrievers: Filtrando Resultados Pouco Relevantes

Conceito central

O score_threshold é um parâmetro que funciona como filtro de qualidade em buscas. Ele descarta automaticamente documentos cuja pontuação de similaridade fica abaixo de um limite que você define, garantindo que apenas informações suficientemente relevantes chegue ao seu modelo.

Por que essa resposta faz sentido

O score_threshold filtra documentos com baixa similaridade, impedindo que o sistema retorne resultados marginalmente relevantes. Isso melhora a qualidade das respostas ao descartar ruído informacional que poderia prejudicar o contexto enviado ao LLM.

Armadilhas comuns

  • Confundir score_threshold com o parâmetro k: muitas pessoas acham que ambos controlam a quantidade de documentos, quando na verdade k define a quantidade e threshold define a qualidade mínima.
  • Usar um threshold muito alto que descarta documentos realmente úteis: é comum ser muito restritivo e perder contexto importante por exigir similaridade muito alta.
  • Pensar que o threshold elimina documentos duplicados ou melhora a diversidade: esse é o papel do MMR (Maximal Marginal Relevance), não do threshold simples.

Entenda as alternativas

A

Exatamente. O score_threshold estabelece um limite mínimo de similaridade. Qualquer documento com pontuação abaixo desse limite é automaticamente descartado dos resultados, funcionando como um filtro de qualidade.

B

Isso é função do parâmetro k (number of results), não do score_threshold. O k controla quantos documentos retornar, enquanto o threshold controla a qualidade mínima deles.

C

O score_threshold não tem relação com performance ou tempo de execução. Ele é um filtro de qualidade baseado em pontuação de similaridade, não um limite temporal.

D

Essa configuração pertence a outro nível da arquitetura (chain ou agent). O score_threshold é específico do retriever e controla apenas quais documentos são retornados da busca.

Dica prática: Na prática, comece com um score_threshold entre 0.5 e 0.7 em buscas semânticas. Se a qualidade das respostas cair (significado perdido), diminua o threshold. Se receber muito ruído, aumente. É um ajuste empírico que depende do seu caso de uso específico.

Revise pensando: Se você aumentar o score_threshold de 0.5 para 0.8, você terá mais documentos ou menos documentos nos resultados? Por quê?