O modelo de OCR Early Portuguese Printing no Transkribus

sobre as inovações na transcrição de impressos históricos e os desafios da infraestrutura de pesquisa em linguística histórica e paleografia digital no Brasil

Autores

DOI:

https://doi.org/10.1590/1983-3652.2026.64127

Palavras-chave:

Humanidades digitais, Linguística histórica, Paleografia digital, Soberania digital, Inteligência artificial

Resumo

Este trabalho apresenta o modelo de Reconhecimento Óptico de Caracteres (OCR) Early Portuguese Printing (EPP), desenvolvido na plataforma Transkribus, e discute o potencial, os desafios e a história dessa ferramenta para a pesquisa com documentos históricos. O Transkribus, mantido pela cooperativa europeia READ-COOP, permite que pesquisadores treinem modelos de IA especializados nas características de seus próprios corpora. O modelo EPP foi treinado especificamente para a transcrição de impressos em língua portuguesa dos séculos 16 ao 19, utilizando um corpus de gramáticas e obras linguísticas do período. Com um training set de 142.606 palavras (745 páginas), o EPP alcançou uma Taxa de Erro de Caracteres (CER) de apenas 2,58%. Este resultado representa um avanço significativo, pois demonstra a potencialidade de ferramentas do tipo para a formação de corpora quantitativos históricos em maior escala e em menos tempo, mantendo a precisão da transcrição de diacríticos, símbolos tipográficos e caracteres gregos, elementos que frequentemente limitam a eficácia de ferramentas de OCR generalistas. Ademais, o EPP está disponibilizado como um modelo de base (base model) que pode ser adaptado por outros pesquisadores para diferentes acervos impressos, mediante fine-tuning. Contudo, além de divulgar o potencial da ferramenta, este trabalho problematiza sua natureza. Por pertencer a uma entidade privada europeia e ser um produto Software as a Service (SaaS), o uso do Transkribus levanta questões sobre a centralização de dados e a sustentabilidade de sua aplicação em projetos de pesquisa brasileiros de grande escala, considerando o futuro e o volume de nossos acervos históricos.

Downloads

Os dados de download ainda não estão disponíveis.

Referências

ALKENDI, Wissam; GECHTER, Franck; HEYBERGER, Laurent; GUYEUX, Christophe. Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey. Journal of Imaging, v. 10, n. 1, p. 1–18, 2024. DOI: 10.3390/jimaging10010018.

BARROS, João de. Grammatica da língua portuguesa com os mandamentos da santa madre igreja. Lisboa: Luís Rodrigues, 1539. Autor: João de Barros (1496–1570). Disponível em: http://acervo.bndigital.bn.br/sophia/index.asp?codigo_sophia=504. Acesso em: 4 set. 2025.

BARROS, João de. Grammatica da lingua portuguesa. Olyssipone: apud Lodouicum Rotorigiu[m], Typographum, 1540. Autor: João de Barros (1496–1570). Disponível em: https://purl.pt/12148. Acesso em: 4 set. 2025.

BAUDRY, Hervé; PEDRO, Susana Tavares. Humanidades digitais e documentos históricos: transcrever, catalogar. Cultura. Revista de História e Teoria das Ideias, Lisboa, n. 41–42, p. 235–246, 2023. Disponível em: https://revistas.fcsh.unl.pt/cultura/article/view/1223. Acesso em: 4 set. 2025.

BENGIO, Yoshua. Learning Deep Architectures for AI. Foundations and Trends in Machine Learning, Hanover, v. 2, n. 1, p. 1–127, 2009. DOI: 10.1561/2200000006.

BUESCU, Maria Leonor Carvalhão. A Gramática da Linguagem Portuguesa (Fernão de Oliveira, 1536): Introdução, leitura actualizada e notas. Lisboa: Imprensa Nacional-Casa da Moeda, 1975.

GOODFELLOW, Ian; BENGIO, Yoshua; COURVILLE, Aaron. Deep Learning. Cambridge: MIT Press, 2016.

HAUGEN, Odd Einar (ed.). MUFI Character Recommendation. 4.0. ed. Bergen: Medieval Unicode Font Initiative, 2015. Disponível em: https://nva.sikt.no/registration/0198f0c7becc-8aff5ed6-4690-4727-96bf-69e5d752c276. Acesso em: 2 jan. 2026.

LEÃO, Duarte Nunes de (fl. 1530–1608). Origem da Lingoa portuguesa. Lisboa: Pedro Crasbeeck, 1606. Disponível em: https://purl.pt/50. Acesso em: 4 set. 2025.

MACHADO, José Pedro (ed.). João de Barros: Gramática da Língua Portuguesa. 3. ed. Lisboa: Sociedade Astória, 1957.

MCENERY, Tony; HARDIE, Andrew. Corpus Linguistics: Method, Theory and Practice. Cambridge: Cambridge University Press, 2012.

NARANG, Sonika Rani; JINDAL, Munish Kumar; KUMAR, Munish. Ancient Text Recognition: A Review. Artificial Intelligence Review, v. 54, p. 1–28, 2021. DOI: 10.1007/s10462-020-09827-4.

NOCKELS, J.; GOODING, P.; TERRAS, M.; AMES, S. Understanding the Application of Handwritten Text Recognition Technology in Heritage Contexts: A Systematic Review of Transkribus in Published Research. Archival Science, v. 22, n. 3, p. 367–392, 2022. DOI: 10.1007/s10502-022-09397-0.

OLIVEIRA, Fernão de. Grammatica da lingoagem portuguesa. Lisboa: Germão Galharde, 1536. Autor: Fernão de Oliveira (c. 1507–1581). Disponível em: https://purl.pt/120. Acesso em: 4 set. 2025.

PACHECO ROCHA, Saulo Rogério. O Português das “Obras Proueitosas” e dos “Ilustres & Muito Reuerendos Senhores”: uma análise da mudança nos padrões de colocação pronominal clítica em gramáticas portuguesas do século 15 ao 19. 2025. f. 202. Dissertação (Mestrado em Linguística) – Universidade Federal de Santa Catarina, Florianópolis.

PUIGCERVER, Joan. PyLaia: Deep Learning-based Handwriting Recognition Toolkit. [S. l.: s. n.], 2017. Disponível em: https://github.com/jpuigcerver/PyLaia. Acesso em: 4 set. 2025.

PUIGCERVER, Joan. A Probabilistic Formulation of Keyword Spotting. 2018. Tese (Doutorado) – Universitat Politècnica de València, València.

READ-COOP SCE. Character Error Rate and Learning Curve. Innsbruck: [s. n.], 2025. Disponível em: https://help.transkribus.org/character-error-rate-and-learning-curve. Acesso em: 28 mar. 2026.

SPOLSKY, Joel. The Absolute Minimum Every Software Developer Absolutely, Positively Must Know About Unicode and Character Sets (No Excuses!) [S. l.: s. n.], out. 2003. Disponível em: https://www.joelonsoftware.com/2003/10/08/the-absolute-minimum-every-software-developer-absolutely-positively-must-know-about-unicode-and-character-sets-no-excuses/. Acesso em: 28 mar. 2026.

TERRAS, M. et al. The Artificial Intelligence Cooperative: READ-COOP, Transkribus, and the Benefits of Shared Community Infrastructure for Automated Text Recognition. Open Research Europe, v. 5, n. 16, 2025. DOI: 10.12688/openreseurope.18747.2.

WANG, Haifeng; PAN, Changzai; GUO, Xiao; JI, Chunlin; DENG, Ke. From Object Detection to Text Detection and Recognition: A Brief Evolution History of Optical Character Recognition. Wiley Interdisciplinary Reviews: Computational Statistics, 2021. DOI: 10.1002/wics.1547. Acesso em: 4 set. 2025.

WANG, Junmiao. A Study of the OCR Development History and Directions of Development. In: HIGHLIGHTS in Science, Engineering and Technology. [S. l.: s. n.], 2023. v. 72, p. 409. DOI: 10.54097/bm665j77. Acesso em: 4 set. 2025.

Downloads

Publicado

30-09-2026

Declaração de Disponibilidade de Dados

Os dados de pesquisa estão disponíveis em repositório.

Como Citar

PACHECO ROCHA, Saulo Rogério. O modelo de OCR Early Portuguese Printing no Transkribus: sobre as inovações na transcrição de impressos históricos e os desafios da infraestrutura de pesquisa em linguística histórica e paleografia digital no Brasil. Texto Livre, Belo Horizonte-MG, v. 19, p. e64127, 2026. DOI: 10.1590/1983-3652.2026.64127. Disponível em: https://periodicos.ufmg.br/index.php/textolivre/article/view/64127. Acesso em: 30 set. 2026.

Dados de financiamento