Entre fevereiro de 2025 e abril de 2026, o Banco Nacional Checo, sob a liderança do Governador Aleš Michl (coautor da análise publicada), realizou um teste público sobre se modelos de linguagem de grande escala de uso geral conseguiriam prever a inflação dos preços no consumidor checa a um ano por simples prompting, comparando o o1 da OpenAI e o Grok 2 da xAI com o modelo central de previsão do próprio banco e com a previsão mediana de analistas de mercado financeiro.
A comparação abrangeu a amostra do 1.º trimestre de 2020 ao 3.º trimestre de 2024. Numa experiência complementar, investigadores do ČNB usaram modelos de text-embedding da OpenAI e o ChatGPT-4o-mini para classificar automaticamente preços de retalhistas online nas categorias do cabaz do IPC, para nowcasting da inflação em tempo real. Separadamente, um working paper com arbitragem internacional (WP 09/2026) construiu um modelo Quantile Regression Forest com um novo esquema de pesos variáveis no tempo.
Na amostra completa, o o1 da OpenAI apresentou o menor erro quadrático médio global (RMSE 5,28), ligeiramente à frente do modelo central do ČNB (5,48), estando ambos claramente à frente do Grok 2 (6,19) e dos analistas de mercado (6,63). A classificação inverteu-se por subperíodo: durante o pico inflacionário de 2021-2023, o o1 (7,94) ainda superava ligeiramente o modelo central (8,41), mas na desinflação de volta à meta entre o 2.º trimestre de 2023 e o 3.º trimestre de 2024, o modelo central foi muito mais preciso (RMSE 0,50) do que o o1 (1,81), o Grok 2 (3,45) ou os analistas (2,31). A classificação automática de categorias do IPC concordou com a atribuição manual do banco em 99,7% dos casos ao nível mais amplo do cabaz, descendo para 89,2% e 80,1% em níveis de detalhe mais finos. O modelo Quantile Regression Forest com arbitragem superou os benchmarks de random walk, AR, ARIMA e ensemble num horizonte de 3 meses (RMSE 0,669 face a 0,896-0,739), uma melhoria estatisticamente significativa confirmada por testes de Diebold-Mariano.
O próprio banco enquadra este exercício como 'um teste e demonstração' e 'uma ferramenta de apoio para analistas,' não como substituto do seu modelo central, sinalizando explicitamente o risco de alucinação dos LLM e a não reprodutibilidade dos resultados obtidos por prompting; a cobertura independente da imprensa especializada fez eco destas preocupações de 'caixa negra.' Nenhum processo de previsão em produção foi alterado como resultado.
De onde foi obtida a informação desta prática, e quando.