evidoria

← Back to browse

Good practice

Pilote de prévision de l'inflation par IA — le test public de la Banque nationale tchèque face à son modèle principal

Czechia · Prague · See the Czechia profile

Dans une expérience publiée sur son blog, la Banque nationale tchèque a opposé des LLM généralistes (OpenAI o1, Grok 2) à son propre modèle d'inflation et aux analystes de marché : o1 a obtenu la plus faible erreur de prévision globale (RMSE 5,28 contre 5,48 pour le modèle de la banque), mais ce dernier l'a nettement emporté en 2023-2024.

5.28
RMSE, OpenAI o1 (échantillon complet T1 2020-T3 2024)
5.48
RMSE, modèle central de la ČNB (échantillon complet)
6.19
RMSE, Grok 2 (échantillon complet)
6.63
RMSE, analystes de marché (échantillon complet)
0.50
RMSE, modèle central de la ČNB (période de désinflation T2 2023-T3 2024)
1.81
RMSE, OpenAI o1 (période de désinflation T2 2023-T3 2024)
99.7%
Concordance de la classification automatisée des catégories de l'IPC (niveau le plus large du panier)
0.669
RMSE du modèle Quantile Regression Forest à un horizon de 3 mois
Pilote de prévision de l'inflation par IA — le test public de la Banque nationale tchèque face à son modèle principal

Details

Maturity
Pilot
Promoter
Czech National Bank (Česká národní banka, ČNB)
Period
Feb 2025 – Apr 2026
Keywords
central banking, monetary policy, inflation forecasting, large language models, generative AI

Context

Entre février 2025 et avril 2026, la Banque nationale tchèque, sous la direction du gouverneur Aleš Michl (coauteur de l'analyse publiée), a mené un test public visant à déterminer si des grands modèles de langage généralistes pouvaient prévoir l'inflation des prix à la consommation tchèque à un an par simple prompting, en comparant o1 d'OpenAI et Grok 2 de xAI au modèle de prévision central de la banque et à la prévision médiane des analystes de marché.

Activities

La comparaison a porté sur l'échantillon du T1 2020 au T3 2024. Dans une expérience complémentaire, des chercheurs de la ČNB ont utilisé des modèles d'embedding textuel d'OpenAI ainsi que ChatGPT-4o-mini pour classer automatiquement les prix de détaillants en ligne dans les catégories du panier de l'IPC, à des fins de nowcasting de l'inflation en temps réel. Séparément, un working paper évalué par des pairs à l'international (WP 09/2026) a construit un modèle Quantile Regression Forest doté d'un nouveau schéma de pondération variable dans le temps.

Results

Sur l'ensemble de l'échantillon, o1 d'OpenAI a produit l'erreur quadratique moyenne globale la plus faible (RMSE 5,28), devançant de peu le modèle central de la ČNB (5,48), les deux devançant nettement Grok 2 (6,19) et les analystes de marché (6,63). Le classement s'est inversé selon les sous-périodes : pendant la flambée inflationniste de 2021-2023, o1 (7,94) devançait encore légèrement le modèle central (8,41), mais lors de la désinflation vers la cible entre le T2 2023 et le T3 2024, le modèle central s'est révélé bien plus précis (RMSE 0,50) qu'o1 (1,81), Grok 2 (3,45) ou les analystes (2,31). La classification automatisée de l'IPC concordait avec l'attribution manuelle de la banque dans 99,7 % des cas au niveau le plus large du panier, descendant à 89,2 % et 80,1 % à des niveaux de détail plus fins. Le modèle Quantile Regression Forest évalué par des pairs a surpassé les référentiels de marche aléatoire, AR, ARIMA et d'ensemble à un horizon de 3 mois (RMSE 0,669 contre 0,896-0,739), une amélioration statistiquement significative confirmée par des tests de Diebold-Mariano.

Conclusions

La banque elle-même présente cette démarche comme 'un test et une démonstration' et 'un outil d'aide aux analystes,' et non comme un remplacement de son modèle central, en signalant explicitement le risque d'hallucination des LLM et la non-reproductibilité des résultats issus du prompting ; la presse spécialisée indépendante a fait écho à ces préoccupations de 'boîte noire.' Aucun processus de prévision en production n'a été modifié en conséquence.

Implementation

Indicative cost
Low (< €50k)
Time to results
Short (< 1 year)
Staffing & skills
Czech National Bank research economists (including Governor Aleš Michl as co-author)

Conditions for success

  • Rigorous backtesting against the bank's own core model and market analysts across multiple sub-periods
  • Transparent publication of methodology, comparison tables and explicit limitations

Common failure modes

  • LLM hallucination risk and non-reproducibility of prompted outputs flagged by the bank itself
  • Core model significantly outperformed LLMs during the 2023-24 disinflation period
  • Independent trade press raised 'black-box' concerns

Where it fits

Governance type
central bank
Scale
national research pilot
Income level
high-income

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful