O modelo de OCR Early Portuguese Printing no Transkribus
sobre as inovações na transcrição de impressos históricos e os desafios da infraestrutura de pesquisa em linguística histórica e paleografia digital no Brasil
DOI:
https://doi.org/10.1590/1983-3652.2026.64127Palavras-chave:
Humanidades digitais, Linguística histórica, Paleografia digital, Soberania digital, Inteligência artificialResumo
Este trabalho apresenta o modelo de Reconhecimento Óptico de Caracteres (OCR) Early Portuguese Printing (EPP), desenvolvido na plataforma Transkribus, e discute o potencial, os desafios e a história dessa ferramenta para a pesquisa com documentos históricos. O Transkribus, mantido pela cooperativa europeia READ-COOP, permite que pesquisadores treinem modelos de IA especializados nas características de seus próprios corpora. O modelo EPP foi treinado especificamente para a transcrição de impressos em língua portuguesa dos séculos 16 ao 19, utilizando um corpus de gramáticas e obras linguísticas do período. Com um training set de 142.606 palavras (745 páginas), o EPP alcançou uma Taxa de Erro de Caracteres (CER) de apenas 2,58%. Este resultado representa um avanço significativo, pois demonstra a potencialidade de ferramentas do tipo para a formação de corpora quantitativos históricos em maior escala e em menos tempo, mantendo a precisão da transcrição de diacríticos, símbolos tipográficos e caracteres gregos, elementos que frequentemente limitam a eficácia de ferramentas de OCR generalistas. Ademais, o EPP está disponibilizado como um modelo de base (base model) que pode ser adaptado por outros pesquisadores para diferentes acervos impressos, mediante fine-tuning. Contudo, além de divulgar o potencial da ferramenta, este trabalho problematiza sua natureza. Por pertencer a uma entidade privada europeia e ser um produto Software as a Service (SaaS), o uso do Transkribus levanta questões sobre a centralização de dados e a sustentabilidade de sua aplicação em projetos de pesquisa brasileiros de grande escala, considerando o futuro e o volume de nossos acervos históricos.
Downloads
Referências
ALKENDI, Wissam; GECHTER, Franck; HEYBERGER, Laurent; GUYEUX, Christophe. Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey. Journal of Imaging, v. 10, n. 1, p. 1–18, 2024. DOI: 10.3390/jimaging10010018.
BARROS, João de. Grammatica da língua portuguesa com os mandamentos da santa madre igreja. Lisboa: Luís Rodrigues, 1539. Autor: João de Barros (1496–1570). Disponível em: http://acervo.bndigital.bn.br/sophia/index.asp?codigo_sophia=504. Acesso em: 4 set. 2025.
BARROS, João de. Grammatica da lingua portuguesa. Olyssipone: apud Lodouicum Rotorigiu[m], Typographum, 1540. Autor: João de Barros (1496–1570). Disponível em: https://purl.pt/12148. Acesso em: 4 set. 2025.
BAUDRY, Hervé; PEDRO, Susana Tavares. Humanidades digitais e documentos históricos: transcrever, catalogar. Cultura. Revista de História e Teoria das Ideias, Lisboa, n. 41–42, p. 235–246, 2023. Disponível em: https://revistas.fcsh.unl.pt/cultura/article/view/1223. Acesso em: 4 set. 2025.
BENGIO, Yoshua. Learning Deep Architectures for AI. Foundations and Trends in Machine Learning, Hanover, v. 2, n. 1, p. 1–127, 2009. DOI: 10.1561/2200000006.
BUESCU, Maria Leonor Carvalhão. A Gramática da Linguagem Portuguesa (Fernão de Oliveira, 1536): Introdução, leitura actualizada e notas. Lisboa: Imprensa Nacional-Casa da Moeda, 1975.
GOODFELLOW, Ian; BENGIO, Yoshua; COURVILLE, Aaron. Deep Learning. Cambridge: MIT Press, 2016.
HAUGEN, Odd Einar (ed.). MUFI Character Recommendation. 4.0. ed. Bergen: Medieval Unicode Font Initiative, 2015. Disponível em: https://nva.sikt.no/registration/0198f0c7becc-8aff5ed6-4690-4727-96bf-69e5d752c276. Acesso em: 2 jan. 2026.
LEÃO, Duarte Nunes de (fl. 1530–1608). Origem da Lingoa portuguesa. Lisboa: Pedro Crasbeeck, 1606. Disponível em: https://purl.pt/50. Acesso em: 4 set. 2025.
MACHADO, José Pedro (ed.). João de Barros: Gramática da Língua Portuguesa. 3. ed. Lisboa: Sociedade Astória, 1957.
MCENERY, Tony; HARDIE, Andrew. Corpus Linguistics: Method, Theory and Practice. Cambridge: Cambridge University Press, 2012.
NARANG, Sonika Rani; JINDAL, Munish Kumar; KUMAR, Munish. Ancient Text Recognition: A Review. Artificial Intelligence Review, v. 54, p. 1–28, 2021. DOI: 10.1007/s10462-020-09827-4.
NOCKELS, J.; GOODING, P.; TERRAS, M.; AMES, S. Understanding the Application of Handwritten Text Recognition Technology in Heritage Contexts: A Systematic Review of Transkribus in Published Research. Archival Science, v. 22, n. 3, p. 367–392, 2022. DOI: 10.1007/s10502-022-09397-0.
OLIVEIRA, Fernão de. Grammatica da lingoagem portuguesa. Lisboa: Germão Galharde, 1536. Autor: Fernão de Oliveira (c. 1507–1581). Disponível em: https://purl.pt/120. Acesso em: 4 set. 2025.
PACHECO ROCHA, Saulo Rogério. O Português das “Obras Proueitosas” e dos “Ilustres & Muito Reuerendos Senhores”: uma análise da mudança nos padrões de colocação pronominal clítica em gramáticas portuguesas do século 15 ao 19. 2025. f. 202. Dissertação (Mestrado em Linguística) – Universidade Federal de Santa Catarina, Florianópolis.
PUIGCERVER, Joan. PyLaia: Deep Learning-based Handwriting Recognition Toolkit. [S. l.: s. n.], 2017. Disponível em: https://github.com/jpuigcerver/PyLaia. Acesso em: 4 set. 2025.
PUIGCERVER, Joan. A Probabilistic Formulation of Keyword Spotting. 2018. Tese (Doutorado) – Universitat Politècnica de València, València.
READ-COOP SCE. Character Error Rate and Learning Curve. Innsbruck: [s. n.], 2025. Disponível em: https://help.transkribus.org/character-error-rate-and-learning-curve. Acesso em: 28 mar. 2026.
SPOLSKY, Joel. The Absolute Minimum Every Software Developer Absolutely, Positively Must Know About Unicode and Character Sets (No Excuses!) [S. l.: s. n.], out. 2003. Disponível em: https://www.joelonsoftware.com/2003/10/08/the-absolute-minimum-every-software-developer-absolutely-positively-must-know-about-unicode-and-character-sets-no-excuses/. Acesso em: 28 mar. 2026.
TERRAS, M. et al. The Artificial Intelligence Cooperative: READ-COOP, Transkribus, and the Benefits of Shared Community Infrastructure for Automated Text Recognition. Open Research Europe, v. 5, n. 16, 2025. DOI: 10.12688/openreseurope.18747.2.
WANG, Haifeng; PAN, Changzai; GUO, Xiao; JI, Chunlin; DENG, Ke. From Object Detection to Text Detection and Recognition: A Brief Evolution History of Optical Character Recognition. Wiley Interdisciplinary Reviews: Computational Statistics, 2021. DOI: 10.1002/wics.1547. Acesso em: 4 set. 2025.
WANG, Junmiao. A Study of the OCR Development History and Directions of Development. In: HIGHLIGHTS in Science, Engineering and Technology. [S. l.: s. n.], 2023. v. 72, p. 409. DOI: 10.54097/bm665j77. Acesso em: 4 set. 2025.
Downloads
Publicado
Declaração de Disponibilidade de Dados
Os dados de pesquisa estão disponíveis em repositório.
Edição
Seção
Licença
Copyright (c) 2026 Saulo Rogério Pacheco Rocha

Este trabalho está licenciado sob uma licença Creative Commons Attribution 4.0 International License.
Este é um artigo em acesso aberto que permite o uso irrestrito, a distribuição e reprodução em qualquer meio desde que o artigo original seja devidamente citado.
Como Citar
Dados de financiamento
-
Coordenação de Aperfeiçoamento de Pessoal de Nível Superior
Números do Financiamento 001








