El abandono escolar en Malaui, como en muchos países de bajos ingresos, resulta de una acumulación de factores del hogar y de la escuela difíciles de desentrañar sin datos granulares, y los sistemas de recopilación y gestión de datos en estos contextos suelen tener limitaciones financieras y técnicas.
Los investigadores Hazal Colak Oz, Çiçek Güven y Gonzalo Nápoles (Universidad de Tilburg) utilizaron la Encuesta de Panel Integrado de Hogares (IHPS) de Malaui, representativa a nivel nacional, para construir y comparar cuatro enfoques de aprendizaje automático —bosque aleatorio, LASSO, regresión ridge y una red neuronal multicapa— con el fin de predecir qué niños corrían riesgo de abandonar la escuela. La aplicación de ponderaciones muestrales para corregir el diseño de la encuesta mejoró sustancialmente el recall: LASSO alcanzó un 80,6% y la red neuronal un 78,8%, entre 11 y 12 puntos porcentuales más que las versiones sin ponderar. Los autores utilizaron SHAP (SHapley Additive exPlanations) para interpretar la importancia de las variables, hallando que la participación del niño en el trabajo agrícola familiar y el nivel educativo del padre se encontraban entre los predictores más fuertes del riesgo de abandono.
El trabajo es un estudio metodológico de ciencia de datos, no una intervención implementada: no fue probado como herramienta operativa de alerta temprana dentro de las escuelas de Malaui ni del Ministerio de Educación, y el propio planteamiento de los autores se centra en mejorar la ciencia de la focalización, no en demostrar un impacto de política. Usar marcadores socioeconómicos del hogar, como el trabajo infantil, para señalar riesgo también conlleva un riesgo real de estigmatizar a las mismas familias pobres que se pretende ayudar, si tales indicadores llegaran a usarse de forma punitiva en lugar de activar intervenciones de apoyo.
De dónde se obtuvo la información de esta práctica, y cuándo.