evidoria

← Volver al listado

Buena práctica Importada

El INEGI implementa codificación por IA para reducir la carga de clasificación manual en las encuestas a hogares de México

México · Aguascalientes · Ver el perfil de México

Evidencia: Observacional / pre-post Top 24% 73/100 · Pregunte a Evidence Copilot sobre esta práctica

El instituto de estadística de México, el INEGI, está ampliando la codificación por IA basada en BERT/FastText desde su encuesta de ingresos de los hogares hacia la encuesta nacional de empleo, con la meta formal de reducir hasta un 50% la carga de codificación manual de ocupación y actividad económica sin perder precisión.

48.2 %
Casos de ocupación de la ENIGH codificados automáticamente con umbral de confianza del 50% (December 2024)
89.4 %
Concordancia de la codificación automática de ocupación de la ENIGH con codificadores humanos (December 2024)
84.8 %
Concordancia de códigos de ocupación de la ENOE con la codificación manual (2024-2025)
76.7 %
Concordancia de códigos de actividad económica de la ENOE con la codificación manual (2024-2025)
up to 50 %
Meta de reducción de la carga de codificación manual (2025 target)
28 of 52 projects
Proyectos de investigación aprobados para 2025, del total de propuestas evaluadas (2025)

Detalles

Madurez
En expansión
Promotor
Instituto Nacional de Estadística y Geografía (INEGI)
Período
2022-2025
Palabras clave
official statistics, labour market, public administration

Contexto

El instituto nacional de estadística de México, el INEGI, realiza tres grandes encuestas de hogares que requieren codificar respuestas de texto libre en categorías estándar de ocupación (SINCO) y de actividad económica (SCIAN/NAICS): la encuesta trimestral de ingresos y gastos ENIGH (40.000 registros, 260 codificadores), la encuesta de empleo ENOE (30.000 registros, 10 codificadores) y la Encuesta Intercensal quinquenal (más de 1 millón de registros, 600 codificadores). El INEGI describe el proceso de codificación manual como intensivo en mano de obra, exigente en recursos y propenso al error humano.

Objetivos

Comenzando por la ENIGH, el equipo de ciencia de datos del INEGI buscó reducir la carga de codificación manual de las variables de ocupación y actividad económica manteniendo la calidad alcanzada por los métodos tradicionales.

Actividades

El equipo construyó una canalización de codificación que combina algoritmos deterministas de coincidencia de palabras clave con clasificadores de aprendizaje automático (BERT y FastText), derivando después los casos de baja confianza a codificadores humanos para su validación de calidad. El Programa Anual de Investigación 2025 del INEGI, uno de los 28 proyectos aprobados de 52 propuestas evaluadas por su junta directiva, extiende formalmente el enfoque a toda la encuesta ENOE.

Resultados

Con un umbral de confianza del 50% en la ENIGH, presentado en un taller de la División de Estadística de la ONU en diciembre de 2024, los modelos codificaron automáticamente el 48,2% de los casos de ocupación, coincidiendo con las clasificaciones de los codificadores humanos el 89,4% de las veces; al aplicar la misma canalización a toda la encuesta ENOE se alcanzó una concordancia del 84,8% en los códigos de ocupación y del 76,7% en los de actividad económica frente a la codificación manual.

Conclusiones

La propia presentación del INEGI advierte que el desempeño del modelo está 'fuertemente ligado a la calidad y curación de los datos de entrenamiento', y su siguiente paso es construir una base de datos de referencia más amplia y dedicada, y probar directamente grandes modelos de lenguaje, más allá de los clasificadores BERT/FastText usados hasta ahora; en el marco del programa de 2025, el INEGI ha publicado su meta de eficiencia, pero todavía no una cifra de precisión posterior a la implementación para el uso en producción completa en la ENOE.

Implementación

Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Medio (1–3 años) — Piloted on the ENIGH survey, formally extended to the ENOE employment survey under INEGI's 2025 Annual Research Program, with a further large-language-model phase planned.
Personal y competencias
INEGI's in-house data-science team, Human coders across ENIGH (260), ENOE (10) and the Intercensal Survey (600) who validate low-confidence cases

Condiciones para el éxito

  • Routing low-confidence cases to human coders rather than fully automating classification
  • A formal institutional research-approval process (the 2025 Annual Research Program) to fund and govern scale-up
  • Building a larger, dedicated ground-truth database before further scaling

Modos de fallo comunes

  • INEGI's own presentation cautions that model performance is strongly linked to the quality and curation of the training data.
  • No post-rollout production accuracy figure has yet been published for full ENOE deployment.

Dónde encaja

Tipo de gobernanza
national statistics institute
Escala
national (three household surveys)
Nivel de ingresos
upper-middle-income

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

Kit de replicación

Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Prácticas similares que pueden serle útiles