evidoria

← Retour à la liste

Bonne pratique Importée

L'INEGI déploie un codage par IA pour réduire la charge de classification manuelle dans les enquêtes auprès des ménages au Mexique

Mexique · Aguascalientes · Voir le profil de Mexique

Preuves: Observationnel / avant-après Top 25% 73/100 · Demandez à Evidence Copilot à propos de cette pratique

L'institut de statistique mexicain INEGI étend le codage par IA basé sur BERT/FastText de son enquête sur les revenus des ménages à l'enquête nationale sur l'emploi, avec un objectif formel de réduire jusqu'à 50 % la charge de codage manuel de l'occupation et de l'activité économique, sans perte de précision.

48.2 %
Cas de profession de l'ENIGH codés automatiquement avec un seuil de confiance de 50% (December 2024)
89.4 %
Concordance du codage automatique des professions de l'ENIGH avec les codeurs humains (December 2024)
84.8 %
Concordance des codes de profession de l'ENOE avec le codage manuel (2024-2025)
76.7 %
Concordance des codes d'activité économique de l'ENOE avec le codage manuel (2024-2025)
up to 50 %
Objectif de réduction de la charge de codage manuel (2025 target)
28 of 52 projects
Projets de recherche approuvés pour 2025, sur le total des propositions examinées (2025)

Détails

Maturité
En expansion
Promoteur
Instituto Nacional de Estadística y Geografía (INEGI)
Période
2022-2025
Mots-clés
official statistics, labour market, public administration

Contexte

L'institut national de statistique du Mexique, l'INEGI, mène trois grandes enquêtes auprès des ménages qui nécessitent de coder des réponses en texte libre selon des catégories normalisées de profession (SINCO) et d'activité économique (SCIAN/NAICS) : l'enquête trimestrielle sur les revenus et dépenses ENIGH (40 000 enregistrements, 260 codeurs), l'enquête sur l'emploi ENOE (30 000 enregistrements, 10 codeurs) et l'enquête intercensitaire quinquennale (plus d'un million d'enregistrements, 600 codeurs). L'INEGI décrit le codage manuel comme un processus intensif en main-d'œuvre, coûteux en ressources et sujet à l'erreur humaine.

Objectifs

En commençant par l'ENIGH, l'équipe data science de l'INEGI a cherché à réduire la charge de codage manuel des variables de profession et d'activité économique tout en maintenant la qualité obtenue par les méthodes traditionnelles.

Activités

L'équipe a construit un pipeline de codage combinant des algorithmes déterministes de correspondance de mots-clés avec des classificateurs d'apprentissage automatique (BERT et FastText), puis renvoyant les cas à faible confiance vers des codeurs humains pour validation qualité. Le programme annuel de recherche 2025 de l'INEGI, l'un des 28 projets approuvés sur 52 propositions examinées par son conseil de direction, étend formellement l'approche à l'ensemble de l'enquête ENOE.

Résultats

Avec un seuil de confiance de 50% sur l'ENIGH, présenté lors d'un atelier de la Division statistique de l'ONU en décembre 2024, les modèles ont codé automatiquement 48,2% des cas de profession, correspondant aux classifications des codeurs humains dans 89,4% des cas ; l'application du même pipeline à l'ensemble de l'enquête ENOE a atteint 84,8% de concordance sur les codes de profession et 76,7% sur les codes d'activité économique par rapport au codage manuel.

Conclusions

La présentation de l'INEGI elle-même met en garde sur le fait que la performance du modèle est « fortement liée à la qualité et à la curation des données d'entraînement », et l'étape suivante consiste à constituer une base de données de référence plus vaste et dédiée, puis à tester directement de grands modèles de langage, au-delà des classificateurs BERT/FastText utilisés jusqu'ici ; dans le cadre du programme 2025, l'INEGI a publié son objectif d'efficacité mais pas encore de chiffre de précision post-déploiement pour l'utilisation en production complète sur l'ENOE.

Mise en œuvre

Coût indicatif
Faible (< 50 k€)
Délai jusqu’aux résultats
Moyen (1–3 ans) — Piloted on the ENIGH survey, formally extended to the ENOE employment survey under INEGI's 2025 Annual Research Program, with a further large-language-model phase planned.
Personnel et compétences
INEGI's in-house data-science team, Human coders across ENIGH (260), ENOE (10) and the Intercensal Survey (600) who validate low-confidence cases

Conditions de réussite

  • Routing low-confidence cases to human coders rather than fully automating classification
  • A formal institutional research-approval process (the 2025 Annual Research Program) to fund and govern scale-up
  • Building a larger, dedicated ground-truth database before further scaling

Modes d’échec courants

  • INEGI's own presentation cautions that model performance is strongly linked to the quality and curation of the training data.
  • No post-rollout production accuracy figure has yet been published for full ENOE deployment.

Où cela s’applique

Type de gouvernance
national statistics institute
Échelle
national (three household surveys)
Niveau de revenu
upper-middle-income

Habituellement financé par

National / regional programmes

Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.

Kit de réplication

Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pratiques similaires qui pourraient vous être utiles