El Archivo Nacional de Suecia desarrolló internamente un modelo de IA de reconocimiento de escritura manuscrita, entrenado mediante un esfuerzo de transcripción ciudadana de tres años, para hacer consultables más de un millón de páginas de registros judiciales y de procesos por brujería de los siglos XVII y XVIII, publicando los resultados como datos abiertos.
~1.2 million pages
Páginas hechas buscables a texto completo (as of the practice's reported period)
1 million+ documents
Lote inicial de documentos manuscritos procesados (initial batch)
Detalles
Madurez
En expansión
Promotor
Riksarkivet (Swedish National Archives)
Período
2022–2025
Región (NUTS)
SE11
Palabras clave
cultural heritage, archives, digitization, handwritten text recognition
Contexto
El Archivo Nacional de Suecia (Riksarkivet) opera su propia unidad de investigación en IA, AIRA, que desarrolló 'Swedish Lion', un modelo de reconocimiento de texto manuscrito (HTR) entrenado específicamente para leer escritura sueca de aproximadamente 1600 a 1900. Los datos de entrenamiento provinieron de 'Transkriberingsnod Sverige', una colaboración de tres años financiada con fondos públicos, en la que investigadores genealógicos voluntarios transcribieron manualmente documentos históricos para construir el conjunto de datos de referencia que el modelo necesitaba.
Objetivos
El proyecto busca hacer que grandes colecciones de archivo histórico sean buscables a texto completo, comenzando por dos colecciones principales: el archivo de la Comisión de Brujería del siglo XVII y los protocolos del Tribunal de Apelación de Svea del siglo XVIII.
Actividades
Riksarkivet ha publicado los textos interpretados por la máquina como datos abiertos, descargables vía API o como archivos XML, y previamente había liberado como código abierto sus herramientas subyacentes de HTR/OCR, incluido el marco 'HTRflow', para su reutilización por otros archivos e investigadores.
Resultados
El modelo ha hecho buscables a texto completo alrededor de 1,2 millones de páginas en la Base de Datos del Archivo Nacional, a partir de un lote inicial de más de un millón de documentos manuscritos. Riksarkivet ha declarado que se procesarán y publicarán progresivamente millones de páginas de archivo adicionales hasta 2025.
Conclusiones
Dado que los materiales propios del proyecto no publican una cifra formal y verificada de forma independiente sobre precisión o tasa de error, la práctica se sustenta principalmente en su resultado entregado y verificable públicamente, más que en una puntuación de precisión evaluada frente a una referencia.
Implementación
Coste indicativo
Medio (50 000–500 000 €)
Tiempo hasta resultados
Largo (> 3 años) — Training data was built over a three-year citizen-science transcription project; the model has since been applied to two major historical collections, with further pages planned for release through 2025.
Personal y competencias
Riksarkivet's in-house AI research unit (AIRA), Volunteer genealogy researchers participating in Transkriberingsnod Sverige (Transcription Node Sweden)
Condiciones para el éxito
A large, high-quality ground-truth transcription dataset built through a multi-year citizen-science effort
Publishing outputs and tooling (HTRflow) as open data and open source to enable outside verification and reuse
Modos de fallo comunes
No independently verified accuracy or error-rate figure has been published for the HTR model itself.
Dónde encaja
Tipo de gobernanza
national archive / cultural heritage institution
Escala
national
Nivel de ingresos
high-income
Habitualmente financiado por
National / regional programmes
Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.