evidoria

← Retour à la liste

Bonne pratique Importée

L'anonymiseur automatique de décisions judiciaires du RIK — l'outil de ML estonien pour occulter les données personnelles dans près de 80 000 jugements

Estonie · Tallinn · Voir le profil de Estonie · Voir le profil de Tallinn

Preuves: Descriptif / auto-déclaré Top 15% 80/100 · Demandez à Evidence Copilot à propos de cette pratique

Le RIK estonien, avec l'entreprise TEXTA, a développé un outil de NER qui occulte automatiquement noms, identifiants et adresses dans les décisions de justice — utilisé pour anonymiser et republier près de 80 000 décisions historiques, sans audit de précision indépendant public.

nearly 80,000
Décisions de justice historiques anonymisées et republiées
+99 %
Noms de personnes supplémentaires identifiés par rapport à la référence EstNER
~3x
Noms d'organisations supplémentaires identifiés par rapport à la référence EstNER
L'anonymiseur automatique de décisions judiciaires du RIK — l'outil de ML estonien pour occulter les données personnelles dans près de 80 000 jugements

Détails

Maturité
Établie
Promoteur
Centre of Registers and Information Systems (RIK), Estonian Ministry of Justice and Digital Affairs, with TEXTA OÜ
Période
2022–2026
Région (NUTS)
EE001
Mots-clés
justice, data protection, natural language processing, court administration

Contexte

Les décisions des tribunaux estoniens doivent voir leurs données personnelles supprimées avant leur publication dans le Système d'information judiciaire public, mais l'anonymisation manuelle de jugements longs — certains dépassant 50 pages et contenant de multiples noms, numéros d'identification, dates de naissance, adresses, numéros de téléphone, IBAN et adresses email — est lente et sujette à erreurs. Le Centre des registres et systèmes d'information (RIK), l'agence gouvernementale informatique rattachée au ministère estonien de la Justice et des Affaires numériques, a chargé l'entreprise de technologie linguistique TEXTA OÜ d'automatiser ce processus.

Activités

TEXTA a construit un pipeline hybride combinant un modèle statistique de champs aléatoires conditionnels, un modèle neuronal de reconnaissance d'entités nommées Stanford Stanza, et des extracteurs à base de règles (regex) pour les identifiants structurés tels que les emails, IBAN et numéros d'identification, entraîné sur un corpus de textes judiciaires estoniens annoté sur mesure. Le RIK a utilisé l'outil pour anonymiser et republier près de 80 000 décisions de justice historiques dans le Système d'information judiciaire, un arriéré qu'il aurait été impossible de traiter manuellement.

Résultats

Dans son propre test comparatif, le modèle obtenu par TEXTA a identifié 99 % de noms de personnes en plus et environ trois fois plus de noms d'organisations que le modèle open source EstNER déjà utilisé en Estonie, sur le même jeu de données judiciaires. En janvier 2026, le portail Interoperable Europe de la Commission européenne a mis en avant l'outil dans sa collection Justice & AI Toolbox comme bonne pratique réutilisable pour d'autres États membres de l'UE construisant des systèmes similaires de transparence judiciaire.

Conclusions

Aucun audit de précision indépendant réalisé par un tiers sur le modèle d'anonymisation — portant par exemple sur son taux d'erreur pour les formats de noms rares ou les mises en page non standard — n'a été publié par le RIK, TEXTA ou le ministère, et les chiffres de précision/rappel rapportés proviennent uniquement du test comparatif interne de TEXTA, et non d'une évaluation ordonnée par un tribunal ; le risque résiduel qu'une donnée personnelle non caviardée se retrouve dans une décision publiée n'est donc pas quantifié de manière indépendante.

Mise en œuvre

Coût indicatif
Moyen (50 k€–500 k€) — Costs are not itemised in the source; the work was commissioned from an external vendor (TEXTA OÜ) rather than built in-house, implying a contracted-services cost, but no figure is disclosed.
Délai jusqu’aux résultats
Moyen (1–3 ans) — Developed and deployed 2022-2026, used to clear a nearly 80,000-document historic backlog and featured by the European Commission in January 2026.
Personnel et compétences
Centre of Registers and Information Systems (RIK), Estonian Ministry of Justice and Digital Affairs (commissioning agency), TEXTA OÜ (language-technology vendor and model developer)

Conditions de réussite

  • Hybrid modelling approach (CRF + neural NER + rule-based regex) tuned to the specific structured identifiers found in Estonian court texts
  • Custom-annotated training corpus of Estonian court documents rather than a generic off-the-shelf model
  • Statutory obligation to anonymise decisions before publication, giving a clear mandate and use case

Modes d’échec courants

  • No independent third-party accuracy audit has been published; reported performance comes only from the vendor's own internal benchmark
  • Miss rate on rare name formats or non-standard document layouts is not quantified

Où cela s’applique

Type de gouvernance
national government IT agency (RIK) with external vendor
Échelle
national (Estonian court system)
Niveau de revenu
high-income

Habituellement financé par

National / regional programmes

Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles