A Biblioteca da Dieta Nacional do Japão publicou um motor de OCR com IA que elevou a precisão em textos anteriores a 1945 de cerca de 40% para mais de 90%, usando-o para converter 2,47 milhões de obras digitalizadas em texto pesquisável.
0.9686
F-score médio nas 33 categorias de materiais
~40% to >90%
Precisão de reconhecimento de texto anterior a 1945
2.47 million items / 223 million page images
Itens digitalizados convertidos em texto no ano fiscal de 2021
Detalhes
Maturidade
Consolidada
Promotor
National Diet Library, with Morpho AI Solutions, Toppan Inc. and LINE Corporation
Período
2021–2022 (NDLOCR development); FY2021 conversion of 2.47 million items
Palavras-chave
libraries & archives, digital government, public administration
Contexto
Quase metade do acervo digitalizado da Biblioteca da Dieta Nacional é anterior a 1945, e o OCR comercial japonês tinha fraco desempenho nos kanji históricos, layouts mistos e escritas fonéticas desses documentos.
Atividades
A NDL encomendou à Morpho AI Solutions, com a Toppan Inc. na construção dos dados de treino, o NDLOCR: um motor de OCR de aprendizagem profunda treinado com cerca de 13 milhões de caracteres, lançado como código aberto em abril de 2022.
Resultados
A avaliação interna do NDL Lab obteve um F-score médio de 0,9686 face a um critério explícito de 0,86, superando-o em 32 das 33 categorias de materiais. A biblioteca contratou depois a LINE Corporation para aplicar o modelo em larga escala, convertendo cerca de 2,47 milhões de itens digitalizados (223 milhões de imagens de página) em texto no ano fiscal de 2021, elevando a precisão de reconhecimento pré-1945 de cerca de 40% para mais de 90%.
Conclusões
Os ganhos são reais mas limitados: uma das 33 categorias ficou aquém do critério e os números principais provêm da avaliação interna da própria NDL, não de uma auditoria externa independente.
Implementação
Custo indicativo
Médio (50 mil–500 mil €)
Tempo até resultados
Médio (1–3 anos)
Equipa e competências
Morpho AI Solutions (model development), Toppan Inc. (training-data construction), LINE Corporation (scaled application)
Condições de sucesso
large annotated training corpus (~13M characters)
explicit accuracy criteria per material type
Modos de falha comuns
one of 33 categories (1970s periodicals) fell short of the accuracy criterion
Habitualmente financiado por
National / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Implementa esta prática?
Reivindique-a —
implementadores verificados obtêm um contacto público na página e podem propor correções.
Fontes de dados
De onde foi obtida a informação desta prática, e quando.