~/questoes/agentes-de-ia
Quando um Document Loader processa um arquivo no LangChain, ele retorna um objeto Document que separa o conteúdo do texto em um atributo chamado page_content, enquanto as informações extras (como origem, data, nome do arquivo) ficam armazenadas separadamente no atributo metadata. Essa divisão permite que você acesse facilmente tanto o texto principal quanto o contexto sobre o documento.
O atributo page_content armazena especificamente o conteúdo de texto processado do documento em si. Não inclui formatação original, metadados ou informações estruturais do arquivo — apenas o texto extraído e pronto para usar em chains e prompts do LangChain.
Informações sobre estrutura e formatação (como tipo de fonte, cores, espaçamento) não são armazenadas em page_content. O LangChain extrai principalmente o texto limpo, deixando detalhes de formatação original de lado.
Número de página, nome do arquivo e outros metadados são armazenados no atributo metadata, não em page_content. O page_content contém apenas o conteúdo de texto do documento.
URL de origem e data de criação são informações de contexto que ficam guardadas no atributo metadata. O page_content é exclusivamente o texto processado do documento, sem essas informações auxiliares.
Corretamente identificado: page_content armazena o conteúdo de texto processado do documento. É nesse atributo que você encontra o texto principal que será usado nas suas aplicações, enquanto metadados ficam separados.