evidoria

← Back to browse

Good practice

Piloto de Previsão de Inflação com IA — o Teste Público do Banco Nacional Checo Contra o Seu Modelo Principal

Czechia · Prague · See the Czechia profile

Num experimento público em blogue, o Banco Nacional Checo colocou LLMs de uso geral (OpenAI o1, Grok 2) a competir com o seu próprio modelo de inflação e com analistas de mercado: o o1 obteve o menor erro de previsão global (RMSE 5,28 vs 5,48 do banco), mas o modelo do banco venceu claramente em 2023–24.

5.28
RMSE, OpenAI o1 (amostra completa T1 2020-T3 2024)
5.48
RMSE, modelo central do ČNB (amostra completa)
6.19
RMSE, Grok 2 (amostra completa)
6.63
RMSE, analistas de mercado (amostra completa)
0.50
RMSE, modelo central do ČNB (período de desinflação T2 2023-T3 2024)
1.81
RMSE, OpenAI o1 (período de desinflação T2 2023-T3 2024)
99.7%
Concordância da classificação automática de categorias do IPC (nível mais amplo do cabaz)
0.669
RMSE do modelo Quantile Regression Forest num horizonte de 3 meses
Piloto de Previsão de Inflação com IA — o Teste Público do Banco Nacional Checo Contra o Seu Modelo Principal

Details

Maturity
Pilot
Promoter
Czech National Bank (Česká národní banka, ČNB)
Period
Feb 2025 – Apr 2026
Keywords
central banking, monetary policy, inflation forecasting, large language models, generative AI

Context

Entre fevereiro de 2025 e abril de 2026, o Banco Nacional Checo, sob a liderança do Governador Aleš Michl (coautor da análise publicada), realizou um teste público sobre se modelos de linguagem de grande escala de uso geral conseguiriam prever a inflação dos preços no consumidor checa a um ano por simples prompting, comparando o o1 da OpenAI e o Grok 2 da xAI com o modelo central de previsão do próprio banco e com a previsão mediana de analistas de mercado financeiro.

Activities

A comparação abrangeu a amostra do 1.º trimestre de 2020 ao 3.º trimestre de 2024. Numa experiência complementar, investigadores do ČNB usaram modelos de text-embedding da OpenAI e o ChatGPT-4o-mini para classificar automaticamente preços de retalhistas online nas categorias do cabaz do IPC, para nowcasting da inflação em tempo real. Separadamente, um working paper com arbitragem internacional (WP 09/2026) construiu um modelo Quantile Regression Forest com um novo esquema de pesos variáveis no tempo.

Results

Na amostra completa, o o1 da OpenAI apresentou o menor erro quadrático médio global (RMSE 5,28), ligeiramente à frente do modelo central do ČNB (5,48), estando ambos claramente à frente do Grok 2 (6,19) e dos analistas de mercado (6,63). A classificação inverteu-se por subperíodo: durante o pico inflacionário de 2021-2023, o o1 (7,94) ainda superava ligeiramente o modelo central (8,41), mas na desinflação de volta à meta entre o 2.º trimestre de 2023 e o 3.º trimestre de 2024, o modelo central foi muito mais preciso (RMSE 0,50) do que o o1 (1,81), o Grok 2 (3,45) ou os analistas (2,31). A classificação automática de categorias do IPC concordou com a atribuição manual do banco em 99,7% dos casos ao nível mais amplo do cabaz, descendo para 89,2% e 80,1% em níveis de detalhe mais finos. O modelo Quantile Regression Forest com arbitragem superou os benchmarks de random walk, AR, ARIMA e ensemble num horizonte de 3 meses (RMSE 0,669 face a 0,896-0,739), uma melhoria estatisticamente significativa confirmada por testes de Diebold-Mariano.

Conclusions

O próprio banco enquadra este exercício como 'um teste e demonstração' e 'uma ferramenta de apoio para analistas,' não como substituto do seu modelo central, sinalizando explicitamente o risco de alucinação dos LLM e a não reprodutibilidade dos resultados obtidos por prompting; a cobertura independente da imprensa especializada fez eco destas preocupações de 'caixa negra.' Nenhum processo de previsão em produção foi alterado como resultado.

Implementation

Indicative cost
Low (< €50k)
Time to results
Short (< 1 year)
Staffing & skills
Czech National Bank research economists (including Governor Aleš Michl as co-author)

Conditions for success

  • Rigorous backtesting against the bank's own core model and market analysts across multiple sub-periods
  • Transparent publication of methodology, comparison tables and explicit limitations

Common failure modes

  • LLM hallucination risk and non-reproducibility of prompted outputs flagged by the bank itself
  • Core model significantly outperformed LLMs during the 2023-24 disinflation period
  • Independent trade press raised 'black-box' concerns

Where it fits

Governance type
central bank
Scale
national research pilot
Income level
high-income

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful