evidoria

← Volver al listado

Buena práctica Importada

NDLOCR — La Biblioteca de la Dieta Nacional de Japón duplica la precisión de reconocimiento de textos históricos con IA

Japón · Tokyo · Ver el perfil de Japón · Ver el perfil de Tokyo

Evidencia: Observacional / pre-post Top 14% 80/100 · Pregunte a Evidence Copilot sobre esta práctica

La Biblioteca de la Dieta Nacional de Japón publicó un motor de OCR con IA que elevó la precisión en textos anteriores a 1945 de cerca del 40% a más del 90%, usándolo para convertir 2,47 millones de obras digitalizadas en texto búscable.

0.9686
Puntuación F media en 33 categorías de materiales
~40% to >90%
Precisión de reconocimiento de texto anterior a 1945
2.47 million items / 223 million page images
Elementos digitalizados convertidos a texto, año fiscal 2021

Detalles

Madurez
Consolidada
Promotor
National Diet Library, with Morpho AI Solutions, Toppan Inc. and LINE Corporation
Período
2021–2022 (NDLOCR development); FY2021 conversion of 2.47 million items
Palabras clave
libraries & archives, digital government, public administration

Contexto

Casi la mitad de los fondos digitalizados de la Biblioteca de la Dieta Nacional son anteriores a 1945, y el OCR comercial japonés funcionaba mal con los kanji históricos, los diseños mixtos y las escrituras fonéticas de esos documentos.

Actividades

La NDL encargó a Morpho AI Solutions, con Toppan Inc. en la construcción de los datos de entrenamiento, crear NDLOCR: un motor de OCR de aprendizaje profundo entrenado con unos 13 millones de caracteres, publicado como código abierto en abril de 2022.

Resultados

La evaluación interna del NDL Lab obtuvo una puntuación F media de 0,9686 frente a un criterio explícito de 0,86, superándolo en 32 de las 33 categorías de materiales. La biblioteca contrató después a LINE Corporation para aplicar el modelo a gran escala, convirtiendo cerca de 2,47 millones de elementos digitalizados (223 millones de imágenes de página) en texto durante el año fiscal 2021, elevando la precisión de reconocimiento de textos anteriores a 1945 de aproximadamente el 40% a más del 90%.

Conclusiones

Las mejoras son reales pero limitadas: una de las 33 categorías quedó por debajo del criterio, y las cifras principales provienen de la propia evaluación interna de la NDL, no de una auditoría externa independiente.

Implementación

Coste indicativo
Medio (50 000–500 000 €)
Tiempo hasta resultados
Medio (1–3 años)
Personal y competencias
Morpho AI Solutions (model development), Toppan Inc. (training-data construction), LINE Corporation (scaled application)

Condiciones para el éxito

  • large annotated training corpus (~13M characters)
  • explicit accuracy criteria per material type

Modos de fallo comunes

  • one of 33 categories (1970s periodicals) fell short of the accuracy criterion

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Prácticas similares que pueden serle útiles