O DANE da Colômbia usa regressão Ridge sobre dados do Google Trends e notícias para estimar o PIB agrícola 30 dias antes da publicação oficial. O benchmark do 2.º trimestre de 2022 atingiu 8 188 mil milhões de COP, com a Ridge a obter o menor erro de previsão.
8,188 billion COP
PIB agrícola estimado, 2.º trimestre de 2022 (produzido cerca de 30 dias antes do valor oficial) (Q2 2022)
~30 days
Antecedência face à publicação do valor trimestral oficial
Details
Maturity
Pilot
Promoter
Departamento Administrativo Nacional de Estadística (DANE)
Period
2022–present
Keywords
statistics, economic forecasting, agriculture, data analytics
Context
O instituto nacional de estatística da Colômbia, o DANE, desenvolveu um modelo de nowcasting por aprendizagem automática que produz uma estimativa antecipada do PIB do setor agrícola cerca de 30 dias antes de a equipa de contas nacionais publicar o valor trimestral oficial. A iniciativa insere-se no programa mais amplo 'Data for Now' do DANE, que também aplica análise de imagens de satélite, dados de luzes noturnas e processamento de linguagem natural para acelerar outras partes do processo de produção estatística.
Objectives
Gerar um indicador proxy atempado do PIB agrícola antes da divulgação oficial, apoiando a sinalização económica precoce relevante para o planeamento de políticas fiscais e agrícolas.
Activities
O sistema processa manchetes do Google News, volumes de pesquisa do Google Trends e as próprias séries de dados administrativos do DANE, aplicando regressão Ridge e Classificação Zero Shot (um método baseado em transformadores) para gerar a estimativa antecipada.
Results
No seu primeiro benchmark publicado, o modelo estimou o PIB agrícola do segundo trimestre de 2022 em 8.188 mil milhões de pesos colombianos. Entre os métodos testados, a regressão Ridge alcançou o menor erro médio de previsão, superando tanto o classificador Zero Shot como referências mais simples. O trabalho foi revisto por pares e publicado na revista académica SciELO Estudios de Economía, tendo sido destacado pela Global Partnership for Sustainable Development Data como exemplo de inovação estatística orientada por aprendizagem automática.
Conclusions
A integração formal do indicador nas divulgações estatísticas oficiais do DANE, bem como a sua adoção por outros institutos nacionais de estatística, continuam a ser trabalhos em curso.
Implementation
Indicative cost
Low (< €50k) — Uses low-cost, freely available external data sources (Google Trends, Google News) combined with DANE's existing administrative data; no dedicated infrastructure budget described.
Time to results
Medium (1–3 years) — Model developed and first benchmarked in 2022; part of an ongoing, multi-year 'Data for Now' programme with formal integration still in progress.
Staffing & skills
DANE national accounts team, DANE data science / 'Data for Now' programme staff
Conditions for success
Access to DANE's own administrative data series alongside free external signals (Google Trends, Google News)
Institutional backing via DANE's broader 'Data for Now' programme (also covering satellite imagery, night-lights and NLP)
Support from the Global Partnership for Sustainable Development Data
Common failure modes
Formal integration into official DANE statistical releases is still a work in progress
Uptake by other national statistics offices has not occurred
Where it fits
Governance type
national statistics office
Scale
national
Income level
upper-middle-income (Colombia)
Data sources
Where this practice's information was retrieved from, and when.
Mongolia's National Statistics Office piloted satellite-and-drone machine-learning models in Arkhangai province, identifying large livestock with 81.6% accuracy and traditional ger …
FAO and Timor-Leste's government built an XGBoost-corrected seasonal drought index that triggered the country's first Anticipatory Action protocol in October …