La Bibliothèque de la Diète nationale du Japon a publié un moteur d'OCR fondé sur l'IA qui a fait passer la précision des textes antérieurs à 1945 d'environ 40 % à plus de 90 %, en l'utilisant pour convertir 2,47 millions d'ouvrages numérisés en texte consultable.
0.9686
F-score moyen sur les 33 catégories de matériaux
~40% to >90%
Précision de reconnaissance des textes d'avant 1945
2.47 million items / 223 million page images
Éléments numérisés convertis en texte, exercice 2021
Détails
Maturité
Établie
Promoteur
National Diet Library, with Morpho AI Solutions, Toppan Inc. and LINE Corporation
Période
2021–2022 (NDLOCR development); FY2021 conversion of 2.47 million items
Mots-clés
libraries & archives, digital government, public administration
Contexte
Près de la moitié du fonds numérisé de la Bibliothèque de la Diète nationale date d'avant 1945, et les OCR commerciaux japonais géraient mal les kanjis historiques, mises en page mixtes et écritures phonétiques de ces documents.
Activités
La NDL a chargé Morpho AI Solutions, avec Toppan Inc. pour la constitution des données d'entraînement, de créer NDLOCR : un moteur d'OCR par apprentissage profond entraîné sur environ 13 millions de caractères, publié en open source en avril 2022.
Résultats
L'évaluation interne du NDL Lab a obtenu un F-score moyen de 0,9686 face à un critère explicite de 0,86, le dépassant dans 32 des 33 catégories de matériaux. La bibliothèque a ensuite confié à LINE Corporation l'application du modèle à grande échelle, convertissant environ 2,47 millions d'éléments numérisés (223 millions d'images de pages) en texte lors de l'exercice 2021, faisant passer la précision de reconnaissance des textes d'avant 1945 d'environ 40 % à plus de 90 %.
Conclusions
Les gains sont réels mais limités : une des 33 catégories est restée en deçà du critère, et les chiffres phares proviennent de l'évaluation interne de la NDL elle-même, non d'un audit externe indépendant.
Mise en œuvre
Coût indicatif
Moyen (50 k€–500 k€)
Délai jusqu’aux résultats
Moyen (1–3 ans)
Personnel et compétences
Morpho AI Solutions (model development), Toppan Inc. (training-data construction), LINE Corporation (scaled application)
Conditions de réussite
large annotated training corpus (~13M characters)
explicit accuracy criteria per material type
Modes d’échec courants
one of 33 categories (1970s periodicals) fell short of the accuracy criterion
Habituellement financé par
National / regional programmes
Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.
Vous portez cette pratique ?
Revendiquez-la —
les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.
Sources de données
D'où proviennent les informations de cette pratique, et quand.