evidoria

← Volver al listado

Buena práctica Importada

El IGC y ZamStats usan modelos GPT para acelerar la codificación de la Encuesta de Fuerza Laboral de Zambia

Zambia · Lusaka · Ver el perfil de Zambia · Ver el perfil de Lusaka

Evidencia: Cuasiexperimental Top 24% 73/100 · Pregunte a Evidence Copilot sobre esta práctica

La agencia nacional de estadística de Zambia y el IGC probaron siete LLM con 1.059 respuestas de la Encuesta de Fuerza Laboral ya codificadas por humanos: los mejores modelos superaron a los enumeradores hasta en 17,8 puntos porcentuales en los códigos de industria, por menos de 10 USD al año, con un ahorro estimado de más de 170 días laborales al año.

1,059 responses
Tamaño de la muestra del análisis comparativo (2025)
11.8 percentage points
Ganancia de precisión en códigos de ocupación frente a encuestadores (mejores modelos) (2025)
up to 17.8 percentage points
Ganancia de precisión en códigos de sector frente a encuestadores (mejores modelos) (2025)
60-63 %
Precisión exacta en códigos de ocupación, mejores modelos (2025)
57-66 %
Precisión exacta en códigos de sector, mejores modelos (2025)
<10 USD
Coste de clasificar una muestra anual completa de la encuesta (GPT-5 Nano) (2025)
~43 working days/year
Ahorro anual de tiempo proyectado, personal de la sede de ZamStats (projected)
~130 working days/year
Ahorro anual de tiempo proyectado, encuestadores de campo (projected)
El IGC y ZamStats usan modelos GPT para acelerar la codificación de la Encuesta de Fuerza Laboral de Zambia El IGC y ZamStats usan modelos GPT para acelerar la codificación de la Encuesta de Fuerza Laboral de Zambia

Detalles

Madurez
Piloto
Promotor
Zambia Statistics Agency (ZamStats) & International Growth Centre (IGC)
Período
2025
Palabras clave
official statistics, labour market, public administration

Contexto

La Encuesta trimestral de Fuerza de Trabajo de Zambia (LFS), realizada por la Agencia de Estadística de Zambia (ZamStats) junto con el Ministerio de Trabajo y Seguridad Social, entrevista a 10.400 hogares al año. Los encuestadores asignan a cada persona un código de ocupación de cuatro dígitos (436 códigos ISCO posibles) y un código de sector de actividad (419 códigos ISIC posibles) a partir de descripciones verbales recogidas en el terreno, un proceso que el equipo de la encuesta describe como lento y propenso a errores.

Objetivos

En 2025, ZamStats se asoció con el International Growth Centre (IGC) y la Universidad de Oxford para probar si los grandes modelos de lenguaje podrían codificar estas respuestas mejor y más rápido que los encuestadores humanos.

Actividades

Los investigadores construyeron una canalización de generación aumentada por recuperación (RAG) con indicaciones de pocos ejemplos y evaluaron siete LLM, incluidos GPT-4 Turbo, GPT-5 mini y GPT-5 Nano, frente a 1.059 respuestas de la encuesta que el personal de la sede de ZamStats había codificado de forma independiente como referencia. ZamStats y el IGC también construyeron una interfaz abierta y sin código para la canalización, con el objetivo de una implementación completa para finales de 2025.

Resultados

Todos los LLM evaluados superaron a los encuestadores humanos por un margen estadísticamente significativo (p<0,001). Los modelos con mejor desempeño alcanzaron entre el 60 y el 63% de precisión exacta en los códigos de ocupación (11,8 puntos porcentuales por encima de los encuestadores) y entre el 57 y el 66% en los códigos de sector (hasta 17,8 puntos porcentuales por encima de los encuestadores). Clasificar una muestra anual completa de la encuesta cuesta menos de 10 dólares con GPT-5 Nano, y el equipo calcula que el enfoque podría ahorrar unos 43 días laborables al año al personal de la sede y 130 días laborables al año a los encuestadores de campo, usando estimaciones de tiempo conservadoras.

Conclusiones

Los autores señalan limitaciones reales: la muestra de 1.059 respuestas es demasiado pequeña para comparar los LLM entre sí con confianza estadística, la propia 'referencia' de los encuestadores contiene errores de codificación, y los resultados solo se han demostrado hasta ahora para la encuesta de Zambia, aunque el equipo sostiene que el método podría escalarse al censo de cuatro millones de hogares de Zambia y a encuestas de fuerza laboral de otros países.

Implementación

Coste indicativo
Bajo (< 50 000 €) — Classifying an entire annual LFS sample costs under $10 using GPT-5 Nano.
Tiempo hasta resultados
Corto (< 1 año) — Benchmarking conducted in 2025 with full implementation targeted for end of 2025; the team argues the method could scale to Zambia's four-million-household census and to other countries' labour surveys.
Personal y competencias
Zambia Statistics Agency (ZamStats) headquarters staff, Ministry of Labour and Social Security, International Growth Centre (IGC) and University of Oxford researchers, Field enumerators who collect the underlying verbal descriptions

Condiciones para el éxito

  • An independently ground-truthed benchmark dataset to validate model performance before rollout
  • A retrieval-augmented-generation pipeline with few-shot prompting tailored to the coding taxonomy (ISCO/ISIC)
  • An open, no-code interface so ZamStats staff can operate the pipeline without programming skills

Modos de fallo comunes

  • The 1,059-response benchmark sample is too small to compare LLMs against each other with statistical confidence.
  • The enumerator 'ground truth' itself contains coding errors.
  • Results are demonstrated only for Zambia's LFS so far, not yet other surveys or countries.

Dónde encaja

Tipo de gobernanza
national statistics agency, with an external research partnership
Escala
national statistical survey (10,400 households/year)
Nivel de ingresos
lower-middle-income

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

Kit de replicación

Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles