A agência nacional de estatística da Zâmbia e o IGC testaram sete LLMs em 1.059 respostas do Inquérito à Força de Trabalho já codificadas por humanos: os melhores modelos superaram os enumeradores em até 17,8 pontos percentuais nos códigos de indústria, por menos de 10 USD por ano, com uma poupança estimada de mais de 170 dias de trabalho por ano.
1,059 responses
Dimensão da amostra do teste comparativo (2025)
11.8 percentage points
Ganho de precisão nos códigos de ocupação face aos enumeradores (melhores modelos) (2025)
up to 17.8 percentage points
Ganho de precisão nos códigos de setor face aos enumeradores (melhores modelos) (2025)
60-63 %
Precisão exata nos códigos de ocupação, melhores modelos (2025)
57-66 %
Precisão exata nos códigos de setor, melhores modelos (2025)
<10 USD
Custo para classificar uma amostra anual completa do LFS (GPT-5 Nano) (2025)
~43 working days/year
Poupança anual de tempo projetada, pessoal da sede da ZamStats (projected)
~130 working days/year
Poupança anual de tempo projetada, enumeradores de terreno (projected)
Detalhes
Maturidade
Piloto
Promotor
Zambia Statistics Agency (ZamStats) & International Growth Centre (IGC)
Período
2025
Palavras-chave
official statistics, labour market, public administration
Contexto
O Inquérito trimestral à Força de Trabalho da Zâmbia (LFS), conduzido pela Agência de Estatística da Zâmbia (ZamStats) com o Ministério do Trabalho e Segurança Social, inquire 10.400 agregados familiares por ano. Os enumeradores atribuem a cada inquirido um código de ocupação de quatro dígitos (436 códigos ISCO possíveis) e um código de setor de atividade (419 códigos ISIC possíveis) a partir de descrições verbais recolhidas no terreno, um processo que a equipa do inquérito descreve como moroso e sujeito a erros.
Objetivos
Em 2025, a ZamStats associou-se ao International Growth Centre (IGC) e à Universidade de Oxford para testar se grandes modelos de linguagem conseguiriam codificar estas respostas de forma melhor e mais rápida do que os enumeradores humanos.
Atividades
Os investigadores construíram um pipeline de geração aumentada por recuperação (RAG) com indicações de poucos exemplos e avaliaram sete LLM, incluindo o GPT-4 Turbo, o GPT-5 mini e o GPT-5 Nano, face a 1.059 respostas do LFS que a sede da ZamStats tinha codificado de forma independente como referência. A ZamStats e o IGC construíram ainda uma interface aberta, sem necessidade de programação, para o pipeline, com o objetivo de implementação total até ao final de 2025.
Resultados
Todos os LLM testados superaram os enumeradores humanos por uma margem estatisticamente significativa (p<0,001). Os modelos com melhor desempenho atingiram 60-63% de precisão exata nos códigos de ocupação (11,8 pontos percentuais acima dos enumeradores) e 57-66% nos códigos de setor de atividade (até 17,8 pontos percentuais acima dos enumeradores). Classificar uma amostra anual completa do LFS custa menos de 10 dólares com o GPT-5 Nano, e a equipa calcula que a abordagem poderia poupar cerca de 43 dias de trabalho por ano ao pessoal da sede e 130 dias de trabalho por ano aos enumeradores de terreno, com base em estimativas de tempo conservadoras.
Conclusões
Os autores assinalam limitações reais: a amostra de 1.059 respostas é demasiado pequena para comparar os LLM entre si com confiança estatística, a própria 'referência' dos enumeradores contém erros de codificação, e os resultados só foram demonstrados até agora para o LFS da Zâmbia, embora a equipa defenda que o método poderia ser alargado ao censo de quatro milhões de agregados da Zâmbia e a inquéritos ao trabalho de outros países.
Implementação
Custo indicativo
Baixo (< 50 mil €) — Classifying an entire annual LFS sample costs under $10 using GPT-5 Nano.
Tempo até resultados
Curto (< 1 ano) — Benchmarking conducted in 2025 with full implementation targeted for end of 2025; the team argues the method could scale to Zambia's four-million-household census and to other countries' labour surveys.
Equipa e competências
Zambia Statistics Agency (ZamStats) headquarters staff, Ministry of Labour and Social Security, International Growth Centre (IGC) and University of Oxford researchers, Field enumerators who collect the underlying verbal descriptions
Condições de sucesso
An independently ground-truthed benchmark dataset to validate model performance before rollout
A retrieval-augmented-generation pipeline with few-shot prompting tailored to the coding taxonomy (ISCO/ISIC)
An open, no-code interface so ZamStats staff can operate the pipeline without programming skills
Modos de falha comuns
The 1,059-response benchmark sample is too small to compare LLMs against each other with statistical confidence.
The enumerator 'ground truth' itself contains coding errors.
Results are demonstrated only for Zambia's LFS so far, not yet other surveys or countries.
Onde se enquadra
Tipo de governação
national statistics agency, with an external research partnership
Escala
national statistical survey (10,400 households/year)
Nível de rendimento
lower-middle-income
Habitualmente financiado por
National / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Kit de replicação
Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.