Entre fevereiro de 2025 e abril de 2026, o Banco Nacional Checo, sob a liderança do Governador Aleš Michl (coautor da análise publicada), realizou um teste público sobre se modelos de linguagem de grande escala de uso geral conseguiriam prever a inflação dos preços no consumidor checa a um ano por simples prompting, comparando o o1 da OpenAI e o Grok 2 da xAI com o modelo central de previsão do próprio banco e com a previsão mediana de analistas de mercado financeiro.
A comparação abrangeu a amostra do 1.º trimestre de 2020 ao 3.º trimestre de 2024. Numa experiência complementar, investigadores do ČNB usaram modelos de text-embedding da OpenAI e o ChatGPT-4o-mini para classificar automaticamente preços de retalhistas online nas categorias do cabaz do IPC, para nowcasting da inflação em tempo real. Separadamente, um working paper com arbitragem internacional (WP 09/2026) construiu um modelo Quantile Regression Forest com um novo esquema de pesos variáveis no tempo.
Na amostra completa, o o1 da OpenAI apresentou o menor erro quadrático médio global (RMSE 5,28), ligeiramente à frente do modelo central do ČNB (5,48), estando ambos claramente à frente do Grok 2 (6,19) e dos analistas de mercado (6,63). A classificação inverteu-se por subperíodo: durante o pico inflacionário de 2021-2023, o o1 (7,94) ainda superava ligeiramente o modelo central (8,41), mas na desinflação de volta à meta entre o 2.º trimestre de 2023 e o 3.º trimestre de 2024, o modelo central foi muito mais preciso (RMSE 0,50) do que o o1 (1,81), o Grok 2 (3,45) ou os analistas (2,31). A classificação automática de categorias do IPC concordou com a atribuição manual do banco em 99,7% dos casos ao nível mais amplo do cabaz, descendo para 89,2% e 80,1% em níveis de detalhe mais finos. O modelo Quantile Regression Forest com arbitragem superou os benchmarks de random walk, AR, ARIMA e ensemble num horizonte de 3 meses (RMSE 0,669 face a 0,896-0,739), uma melhoria estatisticamente significativa confirmada por testes de Diebold-Mariano.
O próprio banco enquadra este exercício como 'um teste e demonstração' e 'uma ferramenta de apoio para analistas,' não como substituto do seu modelo central, sinalizando explicitamente o risco de alucinação dos LLM e a não reprodutibilidade dos resultados obtidos por prompting; a cobertura independente da imprensa especializada fez eco destas preocupações de 'caixa negra.' Nenhum processo de previsão em produção foi alterado como resultado.
Where this practice's information was retrieved from, and when.