Entre février 2025 et avril 2026, la Banque nationale tchèque, sous la direction du gouverneur Aleš Michl (coauteur de l'analyse publiée), a mené un test public visant à déterminer si des grands modèles de langage généralistes pouvaient prévoir l'inflation des prix à la consommation tchèque à un an par simple prompting, en comparant o1 d'OpenAI et Grok 2 de xAI au modèle de prévision central de la banque et à la prévision médiane des analystes de marché.
La comparaison a porté sur l'échantillon du T1 2020 au T3 2024. Dans une expérience complémentaire, des chercheurs de la ČNB ont utilisé des modèles d'embedding textuel d'OpenAI ainsi que ChatGPT-4o-mini pour classer automatiquement les prix de détaillants en ligne dans les catégories du panier de l'IPC, à des fins de nowcasting de l'inflation en temps réel. Séparément, un working paper évalué par des pairs à l'international (WP 09/2026) a construit un modèle Quantile Regression Forest doté d'un nouveau schéma de pondération variable dans le temps.
Sur l'ensemble de l'échantillon, o1 d'OpenAI a produit l'erreur quadratique moyenne globale la plus faible (RMSE 5,28), devançant de peu le modèle central de la ČNB (5,48), les deux devançant nettement Grok 2 (6,19) et les analystes de marché (6,63). Le classement s'est inversé selon les sous-périodes : pendant la flambée inflationniste de 2021-2023, o1 (7,94) devançait encore légèrement le modèle central (8,41), mais lors de la désinflation vers la cible entre le T2 2023 et le T3 2024, le modèle central s'est révélé bien plus précis (RMSE 0,50) qu'o1 (1,81), Grok 2 (3,45) ou les analystes (2,31). La classification automatisée de l'IPC concordait avec l'attribution manuelle de la banque dans 99,7 % des cas au niveau le plus large du panier, descendant à 89,2 % et 80,1 % à des niveaux de détail plus fins. Le modèle Quantile Regression Forest évalué par des pairs a surpassé les référentiels de marche aléatoire, AR, ARIMA et d'ensemble à un horizon de 3 mois (RMSE 0,669 contre 0,896-0,739), une amélioration statistiquement significative confirmée par des tests de Diebold-Mariano.
La banque elle-même présente cette démarche comme 'un test et une démonstration' et 'un outil d'aide aux analystes,' et non comme un remplacement de son modèle central, en signalant explicitement le risque d'hallucination des LLM et la non-reproductibilité des résultats issus du prompting ; la presse spécialisée indépendante a fait écho à ces préoccupations de 'boîte noire.' Aucun processus de prévision en production n'a été modifié en conséquence.
Where this practice's information was retrieved from, and when.