El DANE de Colombia usa regresión Ridge sobre datos de Google Trends y noticias para estimar el PIB agrícola 30 días antes de la publicación oficial. El benchmark del T2 2022 alcanzó 8 188 miles de millones de COP, siendo Ridge el método con menor error de predicción.
8,188 billion COP
PIB agrícola estimado, segundo trimestre de 2022 (producido unos 30 días antes de la cifra oficial) (Q2 2022)
~30 days
Antelación respecto a la publicación de la cifra trimestral oficial
Details
Maturity
Pilot
Promoter
Departamento Administrativo Nacional de Estadística (DANE)
Period
2022–present
Keywords
statistics, economic forecasting, agriculture, data analytics
Context
El instituto nacional de estadística de Colombia, el DANE, desarrolló un modelo de nowcasting mediante aprendizaje automático que produce una estimación temprana del PIB del sector agrícola aproximadamente 30 días antes de que el equipo de cuentas nacionales publique la cifra trimestral oficial. La iniciativa se enmarca en el programa más amplio 'Data for Now' del DANE, que también aplica análisis de imágenes satelitales, datos de luces nocturnas y procesamiento de lenguaje natural para acelerar otras partes del proceso de producción estadística.
Objectives
Generar un indicador proxy oportuno del PIB agrícola antes de la publicación oficial, apoyando una señalización económica temprana relevante para la planificación de políticas fiscales y agrícolas.
Activities
El sistema procesa titulares de Google News, volúmenes de búsqueda de Google Trends y las propias series de datos administrativos del DANE, aplicando regresión Ridge y Clasificación Zero Shot (un método basado en transformadores) para generar la estimación temprana.
Results
En su primer punto de referencia publicado, el modelo estimó el PIB agrícola del segundo trimestre de 2022 en 8.188 miles de millones de pesos colombianos. Entre los métodos probados, la regresión Ridge logró el menor error medio de predicción, superando tanto al clasificador Zero Shot como a referencias más simples. El trabajo fue revisado por pares y publicado en la revista académica SciELO Estudios de Economía, y fue destacado por la Global Partnership for Sustainable Development Data como ejemplo de innovación estadística impulsada por aprendizaje automático.
Conclusions
La integración formal del indicador en las publicaciones estadísticas oficiales del DANE, así como su adopción por parte de otras oficinas nacionales de estadística, siguen siendo trabajos en curso.
Implementation
Indicative cost
Low (< €50k) — Uses low-cost, freely available external data sources (Google Trends, Google News) combined with DANE's existing administrative data; no dedicated infrastructure budget described.
Time to results
Medium (1–3 years) — Model developed and first benchmarked in 2022; part of an ongoing, multi-year 'Data for Now' programme with formal integration still in progress.
Staffing & skills
DANE national accounts team, DANE data science / 'Data for Now' programme staff
Conditions for success
Access to DANE's own administrative data series alongside free external signals (Google Trends, Google News)
Institutional backing via DANE's broader 'Data for Now' programme (also covering satellite imagery, night-lights and NLP)
Support from the Global Partnership for Sustainable Development Data
Common failure modes
Formal integration into official DANE statistical releases is still a work in progress
Uptake by other national statistics offices has not occurred
Where it fits
Governance type
national statistics office
Scale
national
Income level
upper-middle-income (Colombia)
Data sources
Where this practice's information was retrieved from, and when.
Mongolia's National Statistics Office piloted satellite-and-drone machine-learning models in Arkhangai province, identifying large livestock with 81.6% accuracy and traditional ger …
FAO and Timor-Leste's government built an XGBoost-corrected seasonal drought index that triggered the country's first Anticipatory Action protocol in October …