evidoria

← Volver al listado

Buena práctica Importada

NorHand — La Biblioteca Nacional de Noruega abre su IA de reconocimiento de escritura manuscrita a todo el sector

Noruega · Oslo · Ver el perfil de Noruega · Ver el perfil de Oslo

Evidencia: Descriptivo / autodeclarado Top 49% 60/100 · Pregunte a Evidence Copilot sobre esta práctica

La Biblioteca Nacional de Noruega creó NorHand, un modelo de IA de reconocimiento de escritura manuscrita publicado en abierto, entrenado con unas 400 grafías históricas (tasa de error de caracteres del 4,0%), que ya ha ayudado a digitalizar alrededor de una cuarta parte de su colección manuscrita digitalizada y ha sido adoptado por otras instituciones noruegas.

~400 hands
Caligrafías históricas utilizadas para entrenar el modelo NorHand
4.0 %
Tasa de error por carácter (CER) de NorHand
~25 %
Proporción de la colección manuscrita digitalizada ya procesada y publicada
6 billion parameters
Parámetros del modelo NB-GPT-J-6B

Detalles

Madurez
Consolidada
Promotor
Nasjonalbiblioteket (National Library of Norway)
Período
2023-2026
Palabras clave
cultural heritage, digitisation, public libraries, NLP

Contexto

La Biblioteca Nacional de Noruega (Nasjonalbiblioteket) lleva digitalizando por completo sus fondos desde 2005, y a mediados de la década de 2020 había digitalizado casi todos sus libros y más de la mitad de sus periódicos. Su laboratorio de IA (AI-Lab) ha publicado una familia de modelos en noruego con licencia abierta, entre ellos NB-BERT, NB-GPT-J-6B (con 6.000 millones de parámetros) y los modelos de voz NB-Whisper.

Objetivos

Crear un modelo abierto de reconocimiento de texto manuscrito (HTR) para digitalizar manuscritos históricos y hacerlos totalmente buscables en texto completo.

Actividades

En septiembre de 2023, la Biblioteca publicó NorHand, un modelo HTR construido sobre la plataforma Transkribus y entrenado con aproximadamente 400 caligrafías distintas, incluidos manuscritos de autores como Sigrid Undset. Tanto el modelo como sus datos de entrenamiento se publicaron de forma abierta.

Resultados

NorHand alcanza una tasa de error por carácter (CER) de aproximadamente el 4,0% y, en el momento de su lanzamiento, ya había ayudado a procesar y publicar alrededor de una cuarta parte de los documentos manuscritos digitalizados de la Biblioteca como elementos totalmente buscables en texto completo. La Biblioteca informa de que varias otras instituciones noruegas lo han adoptado desde entonces para sus propias necesidades de reconocimiento de escritura manuscrita.

Conclusiones

Estas cifras son autodeclaradas por la Biblioteca y su socio tecnológico, sin auditoría independiente; no se encontró ningún estudio de referencia externo ni evaluación académica de la precisión real de NorHand en las distintas instituciones; la afirmación de que "muchas" otras instituciones lo han adoptado no está, en sí misma, cuantificada.

Implementación

Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Medio (1–3 años)
Personal y competencias
National Library of Norway AI-Lab researchers and engineers

Condiciones para el éxito

  • an existing large digitised text/audio corpus to train and validate on
  • partnership with an established HTR platform (Transkribus)
  • open licensing of both model and training data to enable sector-wide reuse

Modos de fallo comunes

  • self-reported accuracy figures without independent audit or academic benchmark
  • scale of adoption by other institutions is not quantified

Dónde encaja

Tipo de gobernanza
national library / cultural heritage institution
Escala
national, with cross-institutional reuse
Nivel de ingresos
high-income

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

Kit de replicación

Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Prácticas similares que pueden serle útiles