Entre febrero de 2025 y abril de 2026, el Banco Nacional Checo, bajo la dirección del gobernador Aleš Michl (coautor del análisis publicado), llevó a cabo una prueba pública para determinar si los grandes modelos de lenguaje de propósito general podían prever la inflación de precios al consumidor checa a un año mediante simples prompts, comparando o1 de OpenAI y Grok 2 de xAI con el modelo de previsión central del propio banco y con la previsión mediana de los analistas del mercado financiero.
La comparación abarcó la muestra del primer trimestre de 2020 al tercer trimestre de 2024. En un experimento complementario, los investigadores del ČNB utilizaron modelos de incrustación de texto de OpenAI junto con ChatGPT-4o-mini para clasificar automáticamente los precios de minoristas en línea en las categorías de la cesta del IPC, con fines de nowcasting de la inflación en tiempo real. Por separado, un working paper con arbitraje internacional (WP 09/2026) construyó un modelo Quantile Regression Forest con un nuevo esquema de ponderación variable en el tiempo.
En la muestra completa, o1 de OpenAI produjo el menor error cuadrático medio global (RMSE 5,28), ligeramente por delante del modelo central del ČNB (5,48), y ambos claramente por delante de Grok 2 (6,19) y de los analistas de mercado (6,63). La clasificación se invirtió por subperíodo: durante el repunte inflacionario de 2021-2023, o1 (7,94) todavía superaba ligeramente al modelo central (8,41), pero en la desinflación de vuelta al objetivo entre el segundo trimestre de 2023 y el tercero de 2024, el modelo central fue mucho más preciso (RMSE 0,50) que o1 (1,81), Grok 2 (3,45) o los analistas (2,31). La clasificación automática del IPC coincidió con la asignación manual del banco en el 99,7 % de los casos en el nivel más amplio de la cesta, descendiendo al 89,2 % y al 80,1 % en niveles de detalle más finos. El modelo Quantile Regression Forest con arbitraje superó a los puntos de referencia de random walk, AR, ARIMA y ensemble en un horizonte de 3 meses (RMSE 0,669 frente a 0,896-0,739), una mejora estadísticamente significativa confirmada mediante pruebas de Diebold-Mariano.
El propio banco enmarca este ejercicio como 'una prueba y demostración' y 'una herramienta de apoyo para analistas,' no como un sustituto de su modelo central, señalando explícitamente el riesgo de alucinación de los LLM y la no reproducibilidad de los resultados obtenidos mediante prompting; la cobertura de la prensa especializada independiente se hizo eco de estas preocupaciones sobre la 'caja negra.' Ningún proceso de previsión en producción se ha modificado como resultado.
Where this practice's information was retrieved from, and when.