Les Archives nationales suédoises ont développé en interne un modèle d'IA de reconnaissance d'écriture manuscrite, entraîné grâce à un effort de transcription participative de trois ans, afin de rendre consultables plus d'un million de pages d'archives judiciaires et de procès en sorcellerie des XVIIe et XVIIIe siècles, et a publié les résultats en données ouvertes.
~1.2 million pages
Pages rendues consultables en texte intégral (as of the practice's reported period)
1 million+ documents
Lot initial de documents manuscrits traités (initial batch)
Détails
Maturité
En expansion
Promoteur
Riksarkivet (Swedish National Archives)
Période
2022–2025
Région (NUTS)
SE11
Mots-clés
cultural heritage, archives, digitization, handwritten text recognition
Contexte
Les Archives nationales de Suède (Riksarkivet) exploitent leur propre unité de recherche en IA, AIRA, qui a développé « Swedish Lion », un modèle de reconnaissance d'écriture manuscrite (HTR) entraîné spécifiquement pour lire l'écriture suédoise d'environ 1600 à 1900. Les données d'entraînement proviennent de « Transkriberingsnod Sverige », une collaboration de trois ans, financée par des fonds publics, dans laquelle des généalogistes bénévoles ont transcrit manuellement des documents historiques pour constituer le jeu de données de référence nécessaire au modèle.
Objectifs
Le projet vise à rendre de vastes collections d'archives historiques consultables en texte intégral, en commençant par deux collections majeures : les archives de la Commission de sorcellerie du XVIIe siècle et les protocoles de la Cour d'appel de Svea du XVIIIe siècle.
Activités
Le Riksarkivet a publié les textes interprétés par la machine sous forme de données ouvertes, téléchargeables via API ou en fichiers XML, et avait déjà mis en open source ses outils HTR/OCR sous-jacents, dont le framework « HTRflow », pour réutilisation par d'autres archives et chercheurs.
Résultats
Le modèle a rendu environ 1,2 million de pages consultables en texte intégral dans la base de données des Archives nationales, à partir d'un lot initial de plus d'un million de documents manuscrits. Le Riksarkivet a annoncé que des millions de pages d'archives supplémentaires seraient traitées et publiées progressivement jusqu'en 2025.
Conclusions
Les documents du projet lui-même ne publiant pas de chiffre formel et vérifié de manière indépendante sur la précision ou le taux d'erreur, la pratique est principalement étayée par son résultat livré et vérifiable publiquement plutôt que par un score de précision comparé à une référence.
Mise en œuvre
Coût indicatif
Moyen (50 k€–500 k€)
Délai jusqu’aux résultats
Long (> 3 ans) — Training data was built over a three-year citizen-science transcription project; the model has since been applied to two major historical collections, with further pages planned for release through 2025.
Personnel et compétences
Riksarkivet's in-house AI research unit (AIRA), Volunteer genealogy researchers participating in Transkriberingsnod Sverige (Transcription Node Sweden)
Conditions de réussite
A large, high-quality ground-truth transcription dataset built through a multi-year citizen-science effort
Publishing outputs and tooling (HTRflow) as open data and open source to enable outside verification and reuse
Modes d’échec courants
No independently verified accuracy or error-rate figure has been published for the HTR model itself.
Où cela s’applique
Type de gouvernance
national archive / cultural heritage institution
Échelle
national
Niveau de revenu
high-income
Habituellement financé par
National / regional programmes
Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.
Vous portez cette pratique ?
Revendiquez-la —
les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.
Sources de données
D'où proviennent les informations de cette pratique, et quand.