O Arquivo Nacional da Suécia desenvolveu internamente um modelo de IA de reconhecimento de escrita manual, treinado através de um esforço de transcrição de ciência cidadã de três anos, para tornar pesquisáveis mais de um milhão de páginas de registos judiciais e de processos de feitiçaria dos séculos XVII e XVIII, disponibilizando os resultados como dados abertos.
~1.2 million pages
Páginas tornadas pesquisáveis em texto integral (as of the practice's reported period)
1 million+ documents
Lote inicial de documentos manuscritos processados (initial batch)
Detalhes
Maturidade
Em expansão
Promotor
Riksarkivet (Swedish National Archives)
Período
2022–2025
Região (NUTS)
SE11
Palavras-chave
cultural heritage, archives, digitization, handwritten text recognition
Contexto
O Arquivo Nacional da Suécia (Riksarkivet) opera a sua própria unidade de investigação em IA, a AIRA, que criou o 'Swedish Lion', um modelo de reconhecimento de texto manuscrito (HTR) treinado especificamente para ler caligrafia sueca de cerca de 1600 a 1900. Os dados de treino provieram do 'Transkriberingsnod Sverige', uma colaboração de três anos, financiada publicamente, na qual investigadores voluntários de genealogia transcreveram manualmente documentos históricos para construir o conjunto de dados de referência de que o modelo necessitava.
Objetivos
O projeto visa tornar grandes coleções de arquivo histórico pesquisáveis em texto integral, começando por duas coleções principais: o arquivo da Comissão da Bruxaria do século XVII e os protocolos do Tribunal de Recurso de Svea do século XVIII.
Atividades
O Riksarkivet publicou os textos interpretados por máquina como dados abertos, descarregáveis via API ou como ficheiros XML, tendo previamente disponibilizado como código aberto as suas ferramentas subjacentes de HTR/OCR, incluindo a framework 'HTRflow', para reutilização por outros arquivos e investigadores.
Resultados
O modelo tornou pesquisáveis em texto integral cerca de 1,2 milhões de páginas na Base de Dados do Arquivo Nacional, a partir de um lote inicial de mais de um milhão de documentos manuscritos. O Riksarkivet afirmou que serão processadas e publicadas progressivamente mais milhões de páginas de arquivo até 2025.
Conclusões
Como os materiais do próprio projeto não publicam um valor formal e verificado de forma independente para a precisão ou taxa de erro, a prática é sobretudo evidenciada pelo seu resultado entregue e publicamente verificável, e não por uma pontuação de precisão validada por referência.
Implementação
Custo indicativo
Médio (50 mil–500 mil €)
Tempo até resultados
Longo (> 3 anos) — Training data was built over a three-year citizen-science transcription project; the model has since been applied to two major historical collections, with further pages planned for release through 2025.
Equipa e competências
Riksarkivet's in-house AI research unit (AIRA), Volunteer genealogy researchers participating in Transkriberingsnod Sverige (Transcription Node Sweden)
Condições de sucesso
A large, high-quality ground-truth transcription dataset built through a multi-year citizen-science effort
Publishing outputs and tooling (HTRflow) as open data and open source to enable outside verification and reuse
Modos de falha comuns
No independently verified accuracy or error-rate figure has been published for the HTR model itself.
Onde se enquadra
Tipo de governação
national archive / cultural heritage institution
Escala
national
Nível de rendimento
high-income
Habitualmente financiado por
National / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Implementa esta prática?
Reivindique-a —
implementadores verificados obtêm um contacto público na página e podem propor correções.
Fontes de dados
De onde foi obtida a informação desta prática, e quando.