El IGC y ZamStats usan modelos GPT para acelerar la codificación de la Encuesta de Fuerza Laboral de Zambia
Zambia
La agencia nacional de estadística de Zambia y el IGC probaron siete LLM con 1.059 respuestas de la Encuesta de …
México · Aguascalientes · Ver el perfil de México
Evidencia: Observacional / pre-post Top 24% 73/100 · Pregunte a Evidence Copilot sobre esta práctica
El instituto de estadística de México, el INEGI, está ampliando la codificación por IA basada en BERT/FastText desde su encuesta de ingresos de los hogares hacia la encuesta nacional de empleo, con la meta formal de reducir hasta un 50% la carga de codificación manual de ocupación y actividad económica sin perder precisión.
El instituto nacional de estadística de México, el INEGI, realiza tres grandes encuestas de hogares que requieren codificar respuestas de texto libre en categorías estándar de ocupación (SINCO) y de actividad económica (SCIAN/NAICS): la encuesta trimestral de ingresos y gastos ENIGH (40.000 registros, 260 codificadores), la encuesta de empleo ENOE (30.000 registros, 10 codificadores) y la Encuesta Intercensal quinquenal (más de 1 millón de registros, 600 codificadores). El INEGI describe el proceso de codificación manual como intensivo en mano de obra, exigente en recursos y propenso al error humano.
Comenzando por la ENIGH, el equipo de ciencia de datos del INEGI buscó reducir la carga de codificación manual de las variables de ocupación y actividad económica manteniendo la calidad alcanzada por los métodos tradicionales.
El equipo construyó una canalización de codificación que combina algoritmos deterministas de coincidencia de palabras clave con clasificadores de aprendizaje automático (BERT y FastText), derivando después los casos de baja confianza a codificadores humanos para su validación de calidad. El Programa Anual de Investigación 2025 del INEGI, uno de los 28 proyectos aprobados de 52 propuestas evaluadas por su junta directiva, extiende formalmente el enfoque a toda la encuesta ENOE.
Con un umbral de confianza del 50% en la ENIGH, presentado en un taller de la División de Estadística de la ONU en diciembre de 2024, los modelos codificaron automáticamente el 48,2% de los casos de ocupación, coincidiendo con las clasificaciones de los codificadores humanos el 89,4% de las veces; al aplicar la misma canalización a toda la encuesta ENOE se alcanzó una concordancia del 84,8% en los códigos de ocupación y del 76,7% en los de actividad económica frente a la codificación manual.
La propia presentación del INEGI advierte que el desempeño del modelo está 'fuertemente ligado a la calidad y curación de los datos de entrenamiento', y su siguiente paso es construir una base de datos de referencia más amplia y dedicada, y probar directamente grandes modelos de lenguaje, más allá de los clasificadores BERT/FastText usados hasta ahora; en el marco del programa de 2025, el INEGI ha publicado su meta de eficiencia, pero todavía no una cifra de precisión posterior a la implementación para el uso en producción completa en la ENOE.
National / regional programmes
Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.
Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.
¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
De dónde se obtuvo la información de esta práctica, y cuándo.
Zambia
La agencia nacional de estadística de Zambia y el IGC probaron siete LLM con 1.059 respuestas de la Encuesta de …
Reino Unido
El Data Science Campus de la ONS probó codificación automática por IA para la clasificación SIC/SOC (73–85% de coincidencia en …
Bélgica
Un piloto de Digitaal Vlaanderen con 20 entidades y 300 funcionarios probó Microsoft 365 Copilot: el 41% se sintió más …
Reino Unido
La ONS británica creó ClassifAI, código abierto que codifica texto de encuestas en clasificaciones oficiales, reduciendo a la mitad el …
Abrir el copiloto completo Basado en prácticas citadas: comprueba siempre las fuentes.