evidoria

← Voltar à navegação

Boa prática Importada

NDLOCR — A Biblioteca da Dieta Nacional do Japão duplica a precisão do reconhecimento de textos históricos com IA

Japão · Tokyo · Ver o perfil de Japão · Ver o perfil de Tokyo

Evidência: Observacional / pré-pós Top 14% 80/100 · Pergunte a Evidence Copilot sobre esta prática

A Biblioteca da Dieta Nacional do Japão publicou um motor de OCR com IA que elevou a precisão em textos anteriores a 1945 de cerca de 40% para mais de 90%, usando-o para converter 2,47 milhões de obras digitalizadas em texto pesquisável.

0.9686
F-score médio nas 33 categorias de materiais
~40% to >90%
Precisão de reconhecimento de texto anterior a 1945
2.47 million items / 223 million page images
Itens digitalizados convertidos em texto no ano fiscal de 2021

Detalhes

Maturidade
Consolidada
Promotor
National Diet Library, with Morpho AI Solutions, Toppan Inc. and LINE Corporation
Período
2021–2022 (NDLOCR development); FY2021 conversion of 2.47 million items
Palavras-chave
libraries & archives, digital government, public administration

Contexto

Quase metade do acervo digitalizado da Biblioteca da Dieta Nacional é anterior a 1945, e o OCR comercial japonês tinha fraco desempenho nos kanji históricos, layouts mistos e escritas fonéticas desses documentos.

Atividades

A NDL encomendou à Morpho AI Solutions, com a Toppan Inc. na construção dos dados de treino, o NDLOCR: um motor de OCR de aprendizagem profunda treinado com cerca de 13 milhões de caracteres, lançado como código aberto em abril de 2022.

Resultados

A avaliação interna do NDL Lab obteve um F-score médio de 0,9686 face a um critério explícito de 0,86, superando-o em 32 das 33 categorias de materiais. A biblioteca contratou depois a LINE Corporation para aplicar o modelo em larga escala, convertendo cerca de 2,47 milhões de itens digitalizados (223 milhões de imagens de página) em texto no ano fiscal de 2021, elevando a precisão de reconhecimento pré-1945 de cerca de 40% para mais de 90%.

Conclusões

Os ganhos são reais mas limitados: uma das 33 categorias ficou aquém do critério e os números principais provêm da avaliação interna da própria NDL, não de uma auditoria externa independente.

Implementação

Custo indicativo
Médio (50 mil–500 mil €)
Tempo até resultados
Médio (1–3 anos)
Equipa e competências
Morpho AI Solutions (model development), Toppan Inc. (training-data construction), LINE Corporation (scaled application)

Condições de sucesso

  • large annotated training corpus (~13M characters)
  • explicit accuracy criteria per material type

Modos de falha comuns

  • one of 33 categories (1970s periodicals) fell short of the accuracy criterion

Habitualmente financiado por

National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis