Le ministère finlandais de la Justice, avec l'Université d'Helsinki, l'Université Aalto et Statistics Finland, a développé Anoppi — un outil de technologie du langage en source ouverte qui pseudonymise automatiquement les noms et données personnelles dans les décisions judiciaires et administratives avant leur publication en tant que données ouvertes.
Détails
Promoteur
Finnish Ministry of Justice, with the University of Helsinki (HELDIG), Aalto University and Statistics Finland
Période
2018–2020 (project); tool remains available as open-source software
Mots-clés
justice, data protection, open data, public administration
Description
En vertu des obligations du RGPD en Finlande, les décisions judiciaires et autres décisions officielles que les autorités publient à des fins de recherche et de contrôle public doivent d'abord voir leurs données personnelles retirées — une tâche de caviardage traditionnellement lente et manuelle. Le projet Anoppi (2018–2020), piloté par le ministère de la Justice avec le Helsinki Centre for Digital Humanities de l'Université d'Helsinki, le groupe de recherche en informatique sémantique de l'Université Aalto, Statistics Finland et l'éditeur Edita, a développé un outil de technologie du langage pour automatiser cette tâche sur des documents en finnois. Anoppi combine reconnaissance d'entités nommées statistique et fondée sur des règles avec une analyse morphologique afin de détecter et de remplacer les noms et autres identifiants par des marqueurs neutres (par exemple "Personne A"), tout en préservant la structure et la lisibilité du document ; il est proposé à la fois comme application web et comme API REST. Il a été présenté publiquement lors de la conférence sur l'IA du Conseil de l'Europe à Helsinki en février 2019 et publié en tant que code open source afin que d'autres autorités puissent le réutiliser au-delà des décisions judiciaires. L'évaluation par les pairs réalisée dans le cadre du projet a conclu qu'Anoppi "fonctionne bien avec différents types de documents", tout en signalant que sa reconnaissance d'entités nommées et sa désambiguïsation produisent encore des erreurs, et qu'"améliorer encore... renforcerait l'utilité du logiciel" — une reconnaissance honnête que la pseudonymisation automatisée n'est pas encore exempte d'erreurs, de sorte que les organismes qui l'utilisent devraient conserver une relecture humaine pour les documents hautement sensibles.
Mise en œuvre
Les détails de mise en œuvre (coût, calendrier, personnel, conditions de réussite) ne sont pas encore disponibles pour cette pratique.
Vous portez cette pratique ?
Revendiquez-la —
les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.
Sources de données
D'où proviennent les informations de cette pratique, et quand.