Le DANE colombien utilise la régression Ridge sur des données Google Trends et de presse pour estimer le PIB agricole 30 jours avant la publication officielle. Le benchmark du T2 2022 a atteint 8 188 milliards COP, Ridge affichant la plus faible erreur de prévision.
8,188 billion COP
PIB agricole estimé, T2 2022 (produit environ 30 jours avant le chiffre officiel) (Q2 2022)
~30 days
Avance par rapport à la publication du chiffre trimestriel officiel
Détails
Maturité
Pilot
Promoteur
Departamento Administrativo Nacional de Estadística (DANE)
Période
2022–present
Mots-clés
statistics, economic forecasting, agriculture, data analytics
Contexte
L'institut national de statistique de la Colombie, le DANE, a développé un modèle de nowcasting par apprentissage automatique qui produit une estimation précoce du PIB du secteur agricole environ 30 jours avant que l'équipe des comptes nationaux ne publie le chiffre trimestriel officiel. L'initiative s'inscrit dans le programme plus large « Data for Now » du DANE, qui applique également l'analyse d'images satellite, les données de luminosité nocturne et le traitement du langage naturel pour accélérer d'autres étapes du processus de production statistique.
Objectifs
Générer un indicateur proxy rapide du PIB agricole avant la publication officielle, afin d'appuyer une signalisation économique précoce pertinente pour la planification des politiques budgétaires et agricoles.
Activités
Le système traite les titres de Google News, les volumes de recherche Google Trends et les propres séries de données administratives du DANE, en appliquant une régression Ridge et une classification Zero Shot (méthode fondée sur les transformeurs) pour produire l'estimation précoce.
Résultats
Dans son premier étalonnage publié, le modèle a estimé le PIB agricole du deuxième trimestre 2022 à 8 188 milliards de pesos colombiens. Parmi les méthodes testées, la régression Ridge a obtenu l'erreur de prévision moyenne la plus faible, devançant à la fois le classificateur Zero Shot et des références plus simples. Les travaux ont été évalués par des pairs et publiés dans la revue académique SciELO Estudios de Economía, et ont été mis en avant par le Global Partnership for Sustainable Development Data comme exemple d'innovation statistique fondée sur l'apprentissage automatique.
Conclusions
L'intégration formelle de l'indicateur dans les publications statistiques officielles du DANE, ainsi que son adoption par d'autres offices statistiques nationaux, restent des travaux en cours.
Mise en œuvre
Coût indicatif
Low (< €50k) — Uses low-cost, freely available external data sources (Google Trends, Google News) combined with DANE's existing administrative data; no dedicated infrastructure budget described.
Délai jusqu’aux résultats
Medium (1–3 years) — Model developed and first benchmarked in 2022; part of an ongoing, multi-year 'Data for Now' programme with formal integration still in progress.
Personnel et compétences
DANE national accounts team, DANE data science / 'Data for Now' programme staff
Conditions de réussite
Access to DANE's own administrative data series alongside free external signals (Google Trends, Google News)
Institutional backing via DANE's broader 'Data for Now' programme (also covering satellite imagery, night-lights and NLP)
Support from the Global Partnership for Sustainable Development Data
Modes d’échec courants
Formal integration into official DANE statistical releases is still a work in progress
Uptake by other national statistics offices has not occurred
Où cela s’applique
Type de gouvernance
national statistics office
Échelle
national
Niveau de revenu
upper-middle-income (Colombia)
Sources de données
D'où proviennent les informations de cette pratique, et quand.