evidoria

← Voltar à navegação

Boa prática Importada

O INEGI implementa codificação por IA para reduzir a carga de classificação manual nos inquéritos aos agregados familiares no México

México · Aguascalientes · Ver o perfil de México

Evidência: Observacional / pré-pós Top 24% 73/100 · Pergunte a Evidence Copilot sobre esta prática

O instituto de estatística do México, o INEGI, está a expandir a codificação por IA baseada em BERT/FastText do seu inquérito aos rendimentos das famílias para o inquérito nacional ao emprego, com a meta formal de reduzir até 50% a carga de codificação manual da ocupação e da atividade económica, sem perder precisão.

48.2 %
Casos de ocupação do ENIGH codificados automaticamente com limiar de confiança de 50% (December 2024)
89.4 %
Concordância da codificação automática de ocupação do ENIGH com codificadores humanos (December 2024)
84.8 %
Concordância dos códigos de ocupação do ENOE com a codificação manual (2024-2025)
76.7 %
Concordância dos códigos de atividade económica do ENOE com a codificação manual (2024-2025)
up to 50 %
Meta de redução da carga de codificação manual (2025 target)
28 of 52 projects
Projetos de investigação aprovados para 2025, do total de propostas avaliadas (2025)

Detalhes

Maturidade
Em expansão
Promotor
Instituto Nacional de Estadística y Geografía (INEGI)
Período
2022-2025
Palavras-chave
official statistics, labour market, public administration

Contexto

O instituto nacional de estatística do México, o INEGI, conduz três grandes inquéritos a agregados familiares que exigem a codificação de respostas em texto livre em categorias normalizadas de ocupação (SINCO) e de atividade económica (SCIAN/NAICS): o inquérito trimestral de rendimento e despesa ENIGH (40.000 registos, 260 codificadores), o inquérito de emprego ENOE (30.000 registos, 10 codificadores) e o Inquérito Intercensitário quinquenal (mais de 1 milhão de registos, 600 codificadores). O INEGI descreve o processo de codificação manual como intensivo em mão de obra, exigente em recursos e sujeito a erro humano.

Objetivos

Começando pelo ENIGH, a equipa de ciência de dados do INEGI procurou reduzir a carga de codificação manual das variáveis de ocupação e atividade económica, mantendo a qualidade alcançada pelos métodos tradicionais.

Atividades

A equipa construiu um pipeline de codificação que combina algoritmos determinísticos de correspondência de palavras-chave com classificadores de aprendizagem automática (BERT e FastText), encaminhando depois os casos de baixa confiança para codificadores humanos para validação de qualidade. O Programa Anual de Investigação de 2025 do INEGI, um de 28 projetos aprovados de 52 propostas avaliadas pelo seu conselho diretivo, alarga formalmente a abordagem a todo o inquérito ENOE.

Resultados

Com um limiar de confiança de 50% no ENIGH, apresentado num workshop da Divisão de Estatística da ONU em dezembro de 2024, os modelos codificaram automaticamente 48,2% dos casos de ocupação, coincidindo com as classificações dos codificadores humanos em 89,4% das vezes; aplicando o mesmo pipeline a todo o inquérito ENOE, alcançou-se uma concordância de 84,8% nos códigos de ocupação e de 76,7% nos códigos de atividade económica face à codificação manual.

Conclusões

A própria apresentação do INEGI alerta que o desempenho do modelo está 'fortemente ligado à qualidade e curadoria dos dados de treino', e o passo seguinte é construir uma base de dados de referência maior e dedicada, e testar diretamente grandes modelos de linguagem, para além dos classificadores BERT/FastText usados até agora; no âmbito do programa de 2025, o INEGI publicou a sua meta de eficiência, mas ainda não um valor de precisão pós-implementação para o uso em produção total no ENOE.

Implementação

Custo indicativo
Baixo (< 50 mil €)
Tempo até resultados
Médio (1–3 anos) — Piloted on the ENIGH survey, formally extended to the ENOE employment survey under INEGI's 2025 Annual Research Program, with a further large-language-model phase planned.
Equipa e competências
INEGI's in-house data-science team, Human coders across ENIGH (260), ENOE (10) and the Intercensal Survey (600) who validate low-confidence cases

Condições de sucesso

  • Routing low-confidence cases to human coders rather than fully automating classification
  • A formal institutional research-approval process (the 2025 Annual Research Program) to fund and govern scale-up
  • Building a larger, dedicated ground-truth database before further scaling

Modos de falha comuns

  • INEGI's own presentation cautions that model performance is strongly linked to the quality and curation of the training data.
  • No post-rollout production accuracy figure has yet been published for full ENOE deployment.

Onde se enquadra

Tipo de governação
national statistics institute
Escala
national (three household surveys)
Nível de rendimento
upper-middle-income

Habitualmente financiado por

National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Kit de replicação

Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis