O PNLD testou uma rede neural convolucional que classifica imagens de livros como nítidas, desfocadas ou com desfoque de movimento, num estudo aleatorizado de dois braços 1:1 com 76 avaliadores. O braço com IA avaliou muito mais imagens com qualidade preservada; os ganhos entre pré-teste e pós-teste foram modestos.
76 analysts
Analistas de livros didáticos randomizados (1:1, com IA vs. controlo) (2025-2026)
Detalhes
Maturidade
Piloto
Promotor
Fundo Nacional de Desenvolvimento da Educação (FNDE) with NEES/Universidade Federal de Alagoas
O Programa Nacional do Livro e do Material Didático (PNLD), criado em 1937 e gerido pelo Fundo Nacional de Desenvolvimento da Educação (FNDE) em conjunto com o Ministério da Educação, avalia e distribui livros didáticos às escolas públicas do Brasil. O seu ciclo de avaliação pode demorar pelo menos dois anos e envolve centenas de profissionais em trabalho de revisão manual, incluindo a avaliação da qualidade técnica das imagens impressas nos livros candidatos.
Objetivos
Investigadores do Núcleo de Excelência em Tecnologias Sociais (NEES) da Universidade Federal de Alagoas, com coautores de várias universidades brasileiras e internacionais, construíram uma rede neuronal convolucional para classificar cada imagem de livro didático como nítida, desfocada por desfoque ótico ou desfocada por movimento, permitindo que os analistas se concentrem nos casos sinalizados pelo modelo.
Atividades
A equipa realizou um estudo paralelo de dois braços com randomização 1:1 e 76 analistas de livros didáticos, pessoas que efetivamente realizam o trabalho de avaliação do PNLD, e não uma amostra de conveniência. Os participantes fizeram um teste inicial e um teste final após a avaliação inicial; o desfecho primário foi a pontuação do teste final, e os desfechos secundários foram a produtividade dos analistas e a qualidade das suas avaliações.
Resultados
A componente de IA aumentou significativamente a produtividade: o grupo experimental avaliou substancialmente mais imagens do que o grupo de controlo, e a qualidade da avaliação foi preservada, em vez de ser trocada por velocidade. O desfecho primário foi mais fraco — a diferença entre o teste inicial e o final foi modesta —, embora os autores interpretem a direção do efeito como evidência de que trabalhar com a componente de IA melhorou a própria capacidade dos analistas de distinguir categorias de defeitos de imagem.
Conclusões
O ensaio testa uma componente restrita — a classificação de desfoque em imagens —, e não a avaliação pedagógica que está no centro do PNLD, pelo que o resultado de produtividade não deve ser lido como uma afirmação sobre o ciclo de avaliação como um todo. Um estudo aleatorizado de uma componente também não equivale a evidência de implementação em produção; o FNDE e o MEC têm em curso um esforço mais amplo de modernização do PNLD com o NEES, mas este ensaio específico estabelece eficácia, não implementação em escala. Uma avaliação aleatorizada de uma ferramenta de IA governamental, com os próprios funcionários públicos que a utilizam, publicada em acesso aberto e incluindo um desfecho primário quase nulo, é rara entre as afirmações de produtividade de IA no setor público.
Implementação
Custo indicativo
Baixo (< 50 mil €) — Supported by FNDE under TED 10320 and by Brazil's CNPq through the INCT IA.Edu institute (grant 408483/2024-5).
Tempo até resultados
Curto (< 1 ano) — Trial conducted in 2025-2026 and published in Scientific Reports on 10 August 2026; PNLD's own multi-year modernisation effort with NEES continues alongside it.
Equipa e competências
Fundo Nacional de Desenvolvimento da Educação (FNDE) with the Ministry of Education, NEES (Nucleus of Excellence in Social Technologies) at the Federal University of Alagoas, Co-authors at the Federal University of the Agreste of Pernambuco, the Federal Rural University of Pernambuco, the Harvard Graduate School of Education and the University of Pennsylvania, 76 serving PNLD textbook analysts as trial participants
Condições de sucesso
A randomised, controlled design run with actual public officials who do the assessment work, not a convenience sample
Baseline and post-test measurement of both productivity and assessment quality, not speed alone
Publishing the trial open access, including a modest primary-outcome result, rather than only favourable findings
Modos de falha comuns
The trial tests one narrow component, image blur classification, not the pedagogical evaluation at the heart of PNLD.
A randomised trial of a component is not the same as evidence of a full production rollout.
No algorithmic governance documentation, appeal route, or production oversight arrangement has been published.
Onde se enquadra
Tipo de governação
national education programme with a university research partnership
Escala
component-level trial (76 analysts)
Nível de rendimento
upper-middle-income
Habitualmente financiado por
National / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Kit de replicação
Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.