Large Language Models para recuperação da informação em acervos históricos digitalizados

Conteúdo do artigo principal

Daiane Campos Procópio
https://orcid.org/0000-0002-9006-191X

Resumo

Os avanços tecnológicos que ampliaram o acesso à informação no meio digital impulsionaram a produção científica, técnica, artística e cultural. Contudo, o grande volume de informações disponíveis trouxe novos desafios, especialmente para a recuperação de conteúdos relevantes e acessíveis a pessoas com diferentes necessidades e capacidades. Entre esses desafios, destacam-se os documentos textuais digitalizados, comuns em acervos institucionais, que muitas vezes não possuem caracteres reconhecíveis por softwares de leitura, dificultando a recuperação e o uso das informações. Nesse contexto, os Large Language Models (LLMs) surgem como uma tecnologia promissora por sua capacidade de gerar, resumir, traduzir, interpretar e recuperar informações, mesmo em textos não estruturados. Diante desse cenário, esta pesquisa teve como objetivo investigar o potencial de utilização dos LLMs no processo de identificação e recuperação da informação em documentos textuais digitalizados de repositórios institucionais, utilizando como amostra teses do Repositório Institucional da Universidade Federal de Minas Gerais (RI-UFMG). A pesquisa é de natureza aplicada e exploratória, com abordagem quali-quantitativa, e abrange um estudo de caso. Foram analisadas quarenta teses, cinco de cada uma das oito grandes áreas do conhecimento, defendidas entre 1962 e 2009, período em que as teses do RI-UFMG foram digitalizadas. A seleção considerou os recursos disponíveis, o caráter exploratório do estudo e a diversidade estrutural dos documentos, o que possibilitou avaliar o comportamento dos modelos em contextos heterogêneos. Os três modelos analisados foram o Mistral 7B, Llama 3.2 e Qwen 2.5. Eles foram avaliados ao longo de setembro de 2025, utilizando um computador pessoal. A análise baseou-se em uma amostra composta por 40 documentos, a partir dos quais foram geradas 600 respostas (200 por modelo) para cinco perguntas padronizadas, contemplando tanto questões objetivas quanto interpretativas. Os resultados indicaram que o Mistral 7B apresentou o melhor desempenho geral, com maior número de respostas coerentes e menor incidência de alucinações, seguido pelo Llama 3.2, enquanto o Qwen 2.5 obteve o menor índice de coerência. Observou-se que a precisão das respostas diminui à medida que aumenta a complexidade semântica das perguntas, indicando que os LLMs são mais eficazes em tarefas de recuperação literal do que em interpretações conceituais. A análise qualitativa evidenciou, ainda, desafios computacionais na utilização dos modelos e a influência das diferenças estruturais dos documentos sobre a qualidade das respostas. Concluiu-se que os LLMs apresentam potencial para apoiar a recuperação da informação em acervos digitalizados, desde que seu uso ocorra de forma supervisionada, com infraestrutura adequada e critérios de validação das respostas. Ressalta-se que o estudo tem caráter exploratório e não busca generalizações estatísticas. Como contribuição, a pesquisa apresenta uma metodologia replicável e adaptável a outros contextos e aponta caminhos para futuros estudos voltados à integração entre inteligência artificial e gestão da informação, favorecendo o fortalecimento da ciência aberta e da democratização do conhecimento.

Detalhes do artigo

Seção

Resumo de Tese e Dissertação

Biografia do Autor

Daiane Campos Procópio, Universidade Federal de Minas Gerais

Doutoranda e mestra (2025) em Gestão e Organização do Conhecimento pela Universidade Federal de Minas Gerais (UFMG). Possui graduação em Biblioteconomia pela UFMG (2013) e em Análise e Desenvolvimento de Sistemas pela Pontifícia Universidade Católica de Minas Gerais (2024). Integrante do grupo de pesquisa Observatório de Dados Abertos. Atua nas áreas de Ciência da Informação, Biblioteconomia e Engenharia de Software, com interesse em gestão e recuperação da informação, dados abertos, inteligência artificial e desenvolvimento de soluções tecnológicas aplicadas à disseminação da informação.

Como Citar

CAMPOS PROCÓPIO, Daiane. Large Language Models para recuperação da informação em acervos históricos digitalizados. Múltiplos Olhares em Ciência da Informação, Belo Horizonte, v. 16, p. e064051, 2026. DOI: 10.35699/2237-6658.v16i.64051. Disponível em: https://periodicos.ufmg.br/index.php/moci/article/view/64051. Acesso em: 9 out. 2026.