ANÚNCIO

~/questoes/agentes-de-ia

O que é armazenado no atributo page_content de um objeto Document?

Responda, confira o feedback e use o resultado para orientar sua revisão.
Aula de referência Aula 9: Carregadores de Documento no LangChain – Curso Completo para Iniciantes
Para fixar

O Atributo page_content em Document Objects

Conceito central

Quando um Document Loader processa um arquivo no LangChain, ele retorna um objeto Document que separa o conteúdo do texto em um atributo chamado page_content, enquanto as informações extras (como origem, data, nome do arquivo) ficam armazenadas separadamente no atributo metadata. Essa divisão permite que você acesse facilmente tanto o texto principal quanto o contexto sobre o documento.

Por que essa resposta faz sentido

O atributo page_content armazena especificamente o conteúdo de texto processado do documento em si. Não inclui formatação original, metadados ou informações estruturais do arquivo — apenas o texto extraído e pronto para usar em chains e prompts do LangChain.

Armadilhas comuns

  • Confundir page_content com metadata — lembrar que metadata contém informações sobre o documento (origem, data, autor), enquanto page_content contém apenas o texto em si.
  • Esperar que page_content preserve toda a formatação original do arquivo — o atributo traz o texto limpo e processado, sem manter espaçamentos complexos ou estilos visuais.
  • Pensar que page_content é um dicionário ou objeto complexo — na verdade é uma string simples contendo o texto extraído do documento.

Entenda as alternativas

A

Informações sobre estrutura e formatação (como tipo de fonte, cores, espaçamento) não são armazenadas em page_content. O LangChain extrai principalmente o texto limpo, deixando detalhes de formatação original de lado.

B

Número de página, nome do arquivo e outros metadados são armazenados no atributo metadata, não em page_content. O page_content contém apenas o conteúdo de texto do documento.

C

URL de origem e data de criação são informações de contexto que ficam guardadas no atributo metadata. O page_content é exclusivamente o texto processado do documento, sem essas informações auxiliares.

D

Corretamente identificado: page_content armazena o conteúdo de texto processado do documento. É nesse atributo que você encontra o texto principal que será usado nas suas aplicações, enquanto metadados ficam separados.

Dica prática: Quando trabalhar com Document Loaders, sempre acesse document.page_content para obter o texto principal que será usado em prompts, e document.metadata quando precisar rastrear de onde o documento veio ou adicionar contexto sobre sua origem.

Revise pensando: Se você carregar um PDF e quiser acessar apenas o texto do documento (sem saber de qual página veio), qual atributo do objeto Document você usaria?