En un experimento público publicado en su blog, el Banco Nacional Checo enfrentó LLM de propósito general (OpenAI o1, Grok 2) con su propio modelo de inflación y con analistas de mercado: o1 obtuvo el menor error de previsión global (RMSE 5,28 frente a 5,48 del banco), pero el modelo del banco ganó claramente en 2023–24.
RMSE, modelo central del ČNB (período de desinflación T2 2023-T3 2024)
1.81
RMSE, OpenAI o1 (período de desinflación T2 2023-T3 2024)
99.7%
Concordancia de la clasificación automática de categorías del IPC (nivel más amplio de la cesta)
0.669
RMSE del modelo Quantile Regression Forest en un horizonte de 3 meses
Detalles
Madurez
Piloto
Promotor
Czech National Bank (Česká národní banka, ČNB)
Período
Feb 2025 – Apr 2026
Palabras clave
central banking, monetary policy, inflation forecasting, large language models, generative AI
Contexto
Entre febrero de 2025 y abril de 2026, el Banco Nacional Checo, bajo la dirección del gobernador Aleš Michl (coautor del análisis publicado), llevó a cabo una prueba pública para determinar si los grandes modelos de lenguaje de propósito general podían prever la inflación de precios al consumidor checa a un año mediante simples prompts, comparando o1 de OpenAI y Grok 2 de xAI con el modelo de previsión central del propio banco y con la previsión mediana de los analistas del mercado financiero.
Actividades
La comparación abarcó la muestra del primer trimestre de 2020 al tercer trimestre de 2024. En un experimento complementario, los investigadores del ČNB utilizaron modelos de incrustación de texto de OpenAI junto con ChatGPT-4o-mini para clasificar automáticamente los precios de minoristas en línea en las categorías de la cesta del IPC, con fines de nowcasting de la inflación en tiempo real. Por separado, un working paper con arbitraje internacional (WP 09/2026) construyó un modelo Quantile Regression Forest con un nuevo esquema de ponderación variable en el tiempo.
Resultados
En la muestra completa, o1 de OpenAI produjo el menor error cuadrático medio global (RMSE 5,28), ligeramente por delante del modelo central del ČNB (5,48), y ambos claramente por delante de Grok 2 (6,19) y de los analistas de mercado (6,63). La clasificación se invirtió por subperíodo: durante el repunte inflacionario de 2021-2023, o1 (7,94) todavía superaba ligeramente al modelo central (8,41), pero en la desinflación de vuelta al objetivo entre el segundo trimestre de 2023 y el tercero de 2024, el modelo central fue mucho más preciso (RMSE 0,50) que o1 (1,81), Grok 2 (3,45) o los analistas (2,31). La clasificación automática del IPC coincidió con la asignación manual del banco en el 99,7 % de los casos en el nivel más amplio de la cesta, descendiendo al 89,2 % y al 80,1 % en niveles de detalle más finos. El modelo Quantile Regression Forest con arbitraje superó a los puntos de referencia de random walk, AR, ARIMA y ensemble en un horizonte de 3 meses (RMSE 0,669 frente a 0,896-0,739), una mejora estadísticamente significativa confirmada mediante pruebas de Diebold-Mariano.
Conclusiones
El propio banco enmarca este ejercicio como 'una prueba y demostración' y 'una herramienta de apoyo para analistas,' no como un sustituto de su modelo central, señalando explícitamente el riesgo de alucinación de los LLM y la no reproducibilidad de los resultados obtenidos mediante prompting; la cobertura de la prensa especializada independiente se hizo eco de estas preocupaciones sobre la 'caja negra.' Ningún proceso de previsión en producción se ha modificado como resultado.
Implementación
Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Corto (< 1 año)
Personal y competencias
Czech National Bank research economists (including Governor Aleš Michl as co-author)
Condiciones para el éxito
Rigorous backtesting against the bank's own core model and market analysts across multiple sub-periods
Transparent publication of methodology, comparison tables and explicit limitations
Modos de fallo comunes
LLM hallucination risk and non-reproducibility of prompted outputs flagged by the bank itself
Core model significantly outperformed LLMs during the 2023-24 disinflation period
Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.
Investigadores del SARB pusieron a prueba rigurosamente modelos de aprendizaje automático (LASSO, XGBoost, redes neuronales) frente a las propias previsiones …