L'IGC et ZamStats utilisent des modèles GPT pour accélérer le codage de l'enquête sur la main-d'œuvre en Zambie
Zambie
L'agence nationale de statistique de la Zambie et l'IGC ont testé sept LLM sur 1 059 réponses de l'enquête sur …
Mexique · Aguascalientes · Voir le profil de Mexique
Preuves: Observationnel / avant-après Top 25% 73/100 · Demandez à Evidence Copilot à propos de cette pratique
L'institut de statistique mexicain INEGI étend le codage par IA basé sur BERT/FastText de son enquête sur les revenus des ménages à l'enquête nationale sur l'emploi, avec un objectif formel de réduire jusqu'à 50 % la charge de codage manuel de l'occupation et de l'activité économique, sans perte de précision.
L'institut national de statistique du Mexique, l'INEGI, mène trois grandes enquêtes auprès des ménages qui nécessitent de coder des réponses en texte libre selon des catégories normalisées de profession (SINCO) et d'activité économique (SCIAN/NAICS) : l'enquête trimestrielle sur les revenus et dépenses ENIGH (40 000 enregistrements, 260 codeurs), l'enquête sur l'emploi ENOE (30 000 enregistrements, 10 codeurs) et l'enquête intercensitaire quinquennale (plus d'un million d'enregistrements, 600 codeurs). L'INEGI décrit le codage manuel comme un processus intensif en main-d'œuvre, coûteux en ressources et sujet à l'erreur humaine.
En commençant par l'ENIGH, l'équipe data science de l'INEGI a cherché à réduire la charge de codage manuel des variables de profession et d'activité économique tout en maintenant la qualité obtenue par les méthodes traditionnelles.
L'équipe a construit un pipeline de codage combinant des algorithmes déterministes de correspondance de mots-clés avec des classificateurs d'apprentissage automatique (BERT et FastText), puis renvoyant les cas à faible confiance vers des codeurs humains pour validation qualité. Le programme annuel de recherche 2025 de l'INEGI, l'un des 28 projets approuvés sur 52 propositions examinées par son conseil de direction, étend formellement l'approche à l'ensemble de l'enquête ENOE.
Avec un seuil de confiance de 50% sur l'ENIGH, présenté lors d'un atelier de la Division statistique de l'ONU en décembre 2024, les modèles ont codé automatiquement 48,2% des cas de profession, correspondant aux classifications des codeurs humains dans 89,4% des cas ; l'application du même pipeline à l'ensemble de l'enquête ENOE a atteint 84,8% de concordance sur les codes de profession et 76,7% sur les codes d'activité économique par rapport au codage manuel.
La présentation de l'INEGI elle-même met en garde sur le fait que la performance du modèle est « fortement liée à la qualité et à la curation des données d'entraînement », et l'étape suivante consiste à constituer une base de données de référence plus vaste et dédiée, puis à tester directement de grands modèles de langage, au-delà des classificateurs BERT/FastText utilisés jusqu'ici ; dans le cadre du programme 2025, l'INEGI a publié son objectif d'efficacité mais pas encore de chiffre de précision post-déploiement pour l'utilisation en production complète sur l'ENOE.
National / regional programmes
Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.
Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.
Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.
D'où proviennent les informations de cette pratique, et quand.
Zambie
L'agence nationale de statistique de la Zambie et l'IGC ont testé sept LLM sur 1 059 réponses de l'enquête sur …
Royaume-Uni
Le Data Science Campus de l'ONS a testé le codage automatique par IA pour la classification SIC/SOC (73–85% de correspondance …
Belgique
Un pilote mené par Digitaal Vlaanderen auprès de 20 entités et 300 agents a testé Microsoft 365 Copilot : 41 …
Royaume-Uni
L'ONS britannique a créé ClassifAI, un paquet open source qui code le texte d'enquêtes en classifications officielles, divisant par deux …
Ouvrir le copilote complet Fondé sur des pratiques citées — vérifiez toujours les sources.