Large Language Models para la recuperación de información en acervos históricosdigitalizados

Contenido principal del artículo

Daiane Campos Procópio
https://orcid.org/0000-0002-9006-191X

Resumen

Los avances tecnológicos que han ampliado el acceso a la información en el entorno digital han impulsado la producción científica, técnica, artística y cultural. Sin embargo, el gran volumen de información disponible ha traído nuevos desafíos, especialmente en lo que respecta a la recuperación de contenidos relevantes que sean accesibles para personas con diferentes necesidades y capacidades. Entre estos desafíos se encuentran los documentos textuales digitalizados, comunes en los acervos institucionales, que a menudo carecen de caracteres reconocibles por los programas de lectura, lo que dificulta la recuperación y el uso de la información. En este contexto, los Large Language Models (LLM) emergen como una tecnología prometedora debido a su capacidad para generar, resumir, traducir, interpretar y recuperar información, incluso a partir de textos no estructurados. Ante este escenario, el presente estudio tuvo como objetivo investigar el uso potencial de los LLM en el proceso de identificación y recuperación de información a partir de documentos textuales digitalizados en repositorios institucionales, utilizando como muestra tesis del Repositorio Institucional de la Universidad Federal de Minas Gerais (RI-UFMG). La investigación es de naturaleza aplicada y exploratoria, emplea un enfoque cualitativo-cuantitativo e incluye un estudio de caso. Se analizaron cuarenta tesis —cinco de cada una de las ocho grandes áreas del conocimiento— defendidas entre 1962 y 2009, período en el cual las tesis del RI-UFMG fueron digitalizadas. La selección consideró los recursos disponibles, el carácter exploratorio del estudio y la diversidad estructural de los documentos, lo que permitió evaluar el desempeño de los modelos en contextos heterogéneos. Los tres modelos analizados fueron Mistral 7B, Llama 3.2 y Qwen 2.5. Estos fueron evaluados durante septiembre de 2025 utilizando una computadora personal. El análisis se basó en una muestra de 40 documentos, a partir de los cuales se generaron 600 respuestas (200 por modelo) a cinco preguntas estandarizadas, que incluyeron ítems tanto objetivos como interpretativos. Los resultados indicaron que Mistral 7B obtuvo el mejor desempeño general, con un mayor número de respuestas coherentes y menos alucinaciones, seguido de Llama 3.2, mientras que Qwen 2.5 presentó la menor tasa de coherencia. Los hallazgos también mostraron que la precisión de las respuestas disminuye a medida que aumenta la complejidad semántica de las preguntas, lo que indica que los LLM son más eficaces en tareas que implican recuperación literal que en la interpretación conceptual. El análisis cualitativo destacó además los desafíos computacionales en el uso de los modelos y la influencia de las diferencias estructurales entre los documentos en la calidad de las respuestas. Se concluyó que los LLM tienen potencial para apoyar la recuperación de información en colecciones digitalizadas, siempre que su uso se realice de manera supervisada, con infraestructura adecuada y criterios para la validación de las respuestas. Es importante resaltar que se trata de un estudio exploratorio y que no tiene como objetivo la generalización estadística. Como contribución, la investigación presenta una metodología replicable y adaptable a otros contextos, y señala estudios futuros centrados en la integración entre la inteligencia artificial y la gestión de la información, fortaleciendo la ciencia abierta y la democratización del conocimiento.

Detalles del artículo

Sección

Resumo de Tese e Dissertação

Biografía del autor/a

Daiane Campos Procópio, Universidade Federal de Minas Gerais

Doutoranda e mestra (2025) em Gestão e Organização do Conhecimento pela Universidade Federal de Minas Gerais (UFMG). Possui graduação em Biblioteconomia pela UFMG (2013) e em Análise e Desenvolvimento de Sistemas pela Pontifícia Universidade Católica de Minas Gerais (2024). Integrante do grupo de pesquisa Observatório de Dados Abertos. Atua nas áreas de Ciência da Informação, Biblioteconomia e Engenharia de Software, com interesse em gestão e recuperação da informação, dados abertos, inteligência artificial e desenvolvimento de soluções tecnológicas aplicadas à disseminação da informação.

Cómo citar

CAMPOS PROCÓPIO, Daiane. Large Language Models para la recuperación de información en acervos históricosdigitalizados. Múltiplos Olhares em Ciência da Informação - ISSN 2237-6658, Belo Horizonte, v. 16, p. e064051, 2026. DOI: 10.35699/2237-6658.v16i.64051. Disponível em: https://periodicos.ufmg.br/index.php/moci/article/view/64051. Acesso em: 10 oct. 2026.