Une étude menée avec des données de l'Office des recettes du Rwanda a utilisé MiniLM, UMAP et HDBSCAN pour harmoniser 4,1 millions de noms de produits multilingues issus de registres EBM en 425 103 noms normalisés, révélant des anomalies de prix.
4,124,005
Enregistrements EBM et douaniers traités (FY2020-2022)
425,103
Noms de produits normalisés produits
6,295
Grappes HDBSCAN fines produites
167,085
Enregistrements signalés comme bruit (fautes/libellés rares)
73.8 %
Enregistrements de noms de produits non anglophones dans le jeu de données
Détails
Maturité
Pilote
Promoteur
Rwanda Revenue Authority (Strategy and Risk Analysis Department), research by Adventist University of Central Africa
Période
2020–2025
Mots-clés
tax administration, customs, fraud detection
Contexte
Depuis 2013, l'Office rwandais des recettes (RRA) numérise la facturation via des machines de facturation électronique (EBM), atteignant des données structurées au niveau des articles avec l'EBM v2.0/2.1. Mais la saisie manuelle et multilingue des noms de produits — le « sucre » enregistré indifféremment comme sucre, isukari ou sukari — rendait les registres incohérents et difficiles à analyser pour la détection de fraude.
Objectifs
Harmoniser des noms de produits multilingues et saisis de façon incohérente en catégories normalisées, afin que des produits identiques puissent être comparés entre langues pour l'analyse des prix et de la fraude.
Activités
Une étude de 2025 menée avec le Département stratégie et analyse des risques du RRA, qui a fourni les jeux de données et un appui technique, a construit un pipeline de nettoyage de texte, détection et traduction de langue, plongements de phrases MiniLM, réduction de dimensionnalité PCA/UMAP, et clustering KMeans puis HDBSCAN, traitant 4 124 005 enregistrements EBM et douaniers (guichet unique électronique) de l'exercice 2020-2022, dont 73,8 % en langue autre que l'anglais (kinyarwanda, français ou swahili).
Résultats
Le pipeline a produit 425 103 noms de produits normalisés, 20 catégories larges KMeans et 6 295 grappes fines HDBSCAN (plus 167 085 points signalés comme bruit, tels que fautes de frappe et libellés rares). Regrouper des produits identiques entre langues a permis aux chercheurs de comparer les valeurs d'importation/achat aux prix de vente d'un même article, révélant de réels écarts de prix — par exemple une grappe « papier a3 » allant de 1 000 à 15 000 francs rwandais, compatible avec une sous-facturation ou une déclaration erronée.
Conclusions
Il s'agit d'une étude de recherche évaluée par des pairs (un projet de mémoire de master) fondée sur des données administratives réelles du RRA, et non d'un déploiement en production confirmé. Les auteurs décrivent la conception modulaire du pipeline comme transposable à d'autres secteurs et langues au sein des systèmes de données publics.
Mise en œuvre
Coût indicatif
Faible (< 50 k€)
Délai jusqu’aux résultats
Court (< 1 an) — Processed FY2020-2022 administrative records; published as a peer-reviewed journal article in 2025.
Personnel et compétences
Rwanda Revenue Authority Strategy and Risk Analysis Department (data and technical input), Researcher(s) at Adventist University of Central Africa (MSc thesis project)
Conditions de réussite
Access to structured, item-level EBM v2.0/2.1 invoicing data
Language detection/translation capability to handle Kinyarwanda, French, Swahili and English product names
Modular pipeline design enabling reuse across other product categories and languages
Modes d’échec courants
167,085 records (about 4%) remained unresolved as noise points (typos, rare labels), requiring further cleaning
Not yet confirmed as a live production fraud-detection workflow inside RRA
Habituellement financé par
National / regional programmes
Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.
Kit de réplication
Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.