evidoria

← Back to browse

Good practice

Piloto de Previsión de Inflación con IA — la Prueba Pública del Banco Nacional Checo Frente a Su Modelo Principal

Czechia · Prague · See the Czechia profile

En un experimento público publicado en su blog, el Banco Nacional Checo enfrentó LLM de propósito general (OpenAI o1, Grok 2) con su propio modelo de inflación y con analistas de mercado: o1 obtuvo el menor error de previsión global (RMSE 5,28 frente a 5,48 del banco), pero el modelo del banco ganó claramente en 2023–24.

5.28
RMSE, OpenAI o1 (muestra completa T1 2020-T3 2024)
5.48
RMSE, modelo central del ČNB (muestra completa)
6.19
RMSE, Grok 2 (muestra completa)
6.63
RMSE, analistas de mercado (muestra completa)
0.50
RMSE, modelo central del ČNB (período de desinflación T2 2023-T3 2024)
1.81
RMSE, OpenAI o1 (período de desinflación T2 2023-T3 2024)
99.7%
Concordancia de la clasificación automática de categorías del IPC (nivel más amplio de la cesta)
0.669
RMSE del modelo Quantile Regression Forest en un horizonte de 3 meses
Piloto de Previsión de Inflación con IA — la Prueba Pública del Banco Nacional Checo Frente a Su Modelo Principal

Details

Maturity
Pilot
Promoter
Czech National Bank (Česká národní banka, ČNB)
Period
Feb 2025 – Apr 2026
Keywords
central banking, monetary policy, inflation forecasting, large language models, generative AI

Context

Entre febrero de 2025 y abril de 2026, el Banco Nacional Checo, bajo la dirección del gobernador Aleš Michl (coautor del análisis publicado), llevó a cabo una prueba pública para determinar si los grandes modelos de lenguaje de propósito general podían prever la inflación de precios al consumidor checa a un año mediante simples prompts, comparando o1 de OpenAI y Grok 2 de xAI con el modelo de previsión central del propio banco y con la previsión mediana de los analistas del mercado financiero.

Activities

La comparación abarcó la muestra del primer trimestre de 2020 al tercer trimestre de 2024. En un experimento complementario, los investigadores del ČNB utilizaron modelos de incrustación de texto de OpenAI junto con ChatGPT-4o-mini para clasificar automáticamente los precios de minoristas en línea en las categorías de la cesta del IPC, con fines de nowcasting de la inflación en tiempo real. Por separado, un working paper con arbitraje internacional (WP 09/2026) construyó un modelo Quantile Regression Forest con un nuevo esquema de ponderación variable en el tiempo.

Results

En la muestra completa, o1 de OpenAI produjo el menor error cuadrático medio global (RMSE 5,28), ligeramente por delante del modelo central del ČNB (5,48), y ambos claramente por delante de Grok 2 (6,19) y de los analistas de mercado (6,63). La clasificación se invirtió por subperíodo: durante el repunte inflacionario de 2021-2023, o1 (7,94) todavía superaba ligeramente al modelo central (8,41), pero en la desinflación de vuelta al objetivo entre el segundo trimestre de 2023 y el tercero de 2024, el modelo central fue mucho más preciso (RMSE 0,50) que o1 (1,81), Grok 2 (3,45) o los analistas (2,31). La clasificación automática del IPC coincidió con la asignación manual del banco en el 99,7 % de los casos en el nivel más amplio de la cesta, descendiendo al 89,2 % y al 80,1 % en niveles de detalle más finos. El modelo Quantile Regression Forest con arbitraje superó a los puntos de referencia de random walk, AR, ARIMA y ensemble en un horizonte de 3 meses (RMSE 0,669 frente a 0,896-0,739), una mejora estadísticamente significativa confirmada mediante pruebas de Diebold-Mariano.

Conclusions

El propio banco enmarca este ejercicio como 'una prueba y demostración' y 'una herramienta de apoyo para analistas,' no como un sustituto de su modelo central, señalando explícitamente el riesgo de alucinación de los LLM y la no reproducibilidad de los resultados obtenidos mediante prompting; la cobertura de la prensa especializada independiente se hizo eco de estas preocupaciones sobre la 'caja negra.' Ningún proceso de previsión en producción se ha modificado como resultado.

Implementation

Indicative cost
Low (< €50k)
Time to results
Short (< 1 year)
Staffing & skills
Czech National Bank research economists (including Governor Aleš Michl as co-author)

Conditions for success

  • Rigorous backtesting against the bank's own core model and market analysts across multiple sub-periods
  • Transparent publication of methodology, comparison tables and explicit limitations

Common failure modes

  • LLM hallucination risk and non-reproducibility of prompted outputs flagged by the bank itself
  • Core model significantly outperformed LLMs during the 2023-24 disinflation period
  • Independent trade press raised 'black-box' concerns

Where it fits

Governance type
central bank
Scale
national research pilot
Income level
high-income

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful