evidoria

← Retour à la liste

Bonne pratique Importée

Le modèle d'apprentissage automatique de la STT pour la fraude et la corruption dans les marchés publics

Lituanie · Vilnius · Voir le profil de Lituanie · Voir le profil de Vilnius

Preuves: Observationnel / avant-après Top 22% 73/100 · Demandez à Evidence Copilot à propos de cette pratique

La STT lituanienne, avec l'OCDE et le Government Transparency Institute (financé par l'UE), a construit une forêt aléatoire à distance de Hellinger sur 11 jeux de données. Le quart des contrats les plus à risque a capté 60 % des infractions pénales connues, contre 25 % au hasard.

60 %
Contracts with proven/suspected offences captured in top-risk quartile
25 %
Expected capture rate under random selection
about 5x
Known-case capture multiplier in top decile vs chance
11
Administrative datasets integrated into the analytical database
Le modèle d'apprentissage automatique de la STT pour la fraude et la corruption dans les marchés publics

Détails

Maturité
Pilote
Promoteur
Special Investigation Service of the Republic of Lithuania (STT)
Période
2024–2025
Région (NUTS)
LT01
Mots-clés
anti-corruption, public procurement, law-enforcement analytics

Contexte

Le Service spécial d'enquête de Lituanie (STT) a collaboré avec l'OCDE et le Government Transparency Institute, financés par l'instrument d'appui technique de la Commission européenne, pour construire un outil d'évaluation des risques par apprentissage automatique pour les marchés publics. L'équipe a intégré onze ensembles de données administratives — infractions pénales et administratives, registres d'entreprises, bénéficiaires effectifs, listes noires et données de projets financés par l'UE — dans une base de données analytique unique, restructurant les données de passation de marchés du niveau appel d'offres au niveau lot pour saisir la dynamique des offres.

Objectifs

L'objectif était d'aider les analystes du STT à concentrer l'attention des enquêteurs sur les marchés publics les plus susceptibles d'impliquer fraude ou corruption, tout en gardant chaque prédiction explicable afin qu'elle guide le jugement de l'enquêteur plutôt que de le remplacer.

Activités

Comme seule une faible part des contrats est liée à des infractions confirmées, l'équipe a utilisé une forêt aléatoire stratifiée par distance de Hellinger, une méthode conçue pour l'apprentissage positif-non étiqueté et un déséquilibre de classes sévère. Chaque prédiction est accompagnée de valeurs SHAP (SHapley Additive exPlanations) dans un tableau de bord interactif, permettant aux analystes de retracer les facteurs — schémas d'offres, concentration de propriété, position dans le réseau — à l'origine du score de risque d'un contrat.

Résultats

Lors des tests rétrospectifs, concentrer l'attention des enquêteurs sur le quartile de 25 % des contrats au risque prédit le plus élevé a permis de capter environ 60 % des contrats liés à des infractions pénales prouvées ou suspectées, contre 25 % attendus par sélection aléatoire, et le décile supérieur a capté environ cinq fois plus de cas connus que le hasard.

Conclusions

L'étude de cas publiée par l'OCDE précise explicitement qu'il s'agit d'une preuve de concept et non d'un système opérationnel : elle recommande une phase initiale de mises à jour annuelles appuyée par un pipeline de données stable avant un déploiement plus large, et souligne que l'outil est destiné à guider le jugement des enquêteurs, non à le remplacer.

Mise en œuvre

Coût indicatif
Moyen (50 k€–500 k€) — No published budget figure; the work was delivered as technical assistance funded by the European Commission's Technical Support Instrument, with OECD and Government Transparency Institute expertise rather than a large capital build.
Délai jusqu’aux résultats
Court (< 1 an) — Developed during 2024–2025 as a proof-of-concept; the OECD recommends an initial phase of annual model updates on a stable data pipeline before any wider operational rollout.
Personnel et compétences
STT (Special Investigation Service of Lithuania) analysts using the SHAP dashboard, OECD technical-assistance team, Government Transparency Institute researchers

Conditions de réussite

  • integration of eleven administrative datasets into a single analytical database
  • a Positive-Unlabelled learning method (Hellinger Distance Stratified Random Forest) suited to severe class imbalance in offence labels
  • SHAP-based explainability so investigators can trace and trust individual risk scores
  • a stable, regularly-updated data pipeline before wider operational deployment

Modes d’échec courants

  • remains a proof-of-concept without the annual-update data pipeline the OECD recommends before operational use
  • only a small share of contracts carry confirmed offence labels, limiting how confidently the model generalises.

Où cela s’applique

Type de gouvernance
national anti-corruption/law-enforcement agency
Échelle
national
Niveau de revenu
high-income

Kit de réplication

Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles