Um ensaio clínico aleatorizado revisado por pares em quatro universidades atribuiu aleatoriamente 3.080 respostas curtas a correção por GPT-4 ou por humanos. As notas foram estatisticamente indistinguíveis, e a IA permitiu que docentes dessem a turmas grandes um feedback equivalente ao de turmas um terço do tamanho.
-0.04
Diferença de precisão na correção, IA vs. humanos (não significativa) (2023-2024)
3,080
Respostas de estudantes atribuídas aleatoriamente a correção por IA ou humana (2023-2024)
~70 students given feedback depth typical of classes a third to a quarter the size
Dimensão de turma em que o feedback assistido por IA igualou turmas muito mais pequenas
Detalhes
Promotor
University of Houston, with University of South Carolina, University of Michigan & Academia Sinica (Taiwan)
Período
2023-2025
Palavras-chave
higher education, political science, AI-assisted grading, research
Contexto
Corrigir e dar feedback personalizado em perguntas de resposta curta é moroso, o que muitas vezes leva os docentes de turmas grandes a preferirem avaliações de escolha múltipla, reduzindo as oportunidades dos estudantes para desenvolver o pensamento crítico.
Objetivos
Testar se a assistência de um modelo de linguagem (GPT-4) consegue corrigir respostas curtas com a mesma precisão que corretores humanos, e permitir que os docentes deem a turmas grandes o tipo de feedback individualizado normalmente reservado a turmas muito mais pequenas.
Atividades
Investigadores liderados por Heinrich e colegas realizaram um ensaio controlado aleatorizado em quatro cursos de licenciatura em ciência política (Universidade de Houston, Universidade da Carolina do Sul, Universidade de Michigan e Academia Sinica, em Taiwan) em 2023-2024. Em 26 testes que abrangeram 271 estudantes, cerca de dez respostas de estudantes por pergunta de resposta curta foram aleatoriamente atribuídas a correção humana ou por GPT-4, com a IA orientada por grelhas de correção elaboradas pelos docentes e por respostas-modelo ("gold").
Resultados
O estudo, publicado na PLoS One em agosto de 2025, não encontrou diferença estatisticamente significativa na precisão da avaliação entre correção por IA e correção humana (diferença média de -0,04). Os pedidos de reavaliação foram apenas ligeiramente mais elevados para os trabalhos corrigidos por humanos, e o feedback humano foi classificado como "útil" cerca de dois pontos percentuais mais vezes do que o feedback da IA. O ganho mais claro foi de produtividade: a correção assistida por IA permitiu aos docentes dar a turmas de cerca de 70 estudantes um feedback individualizado com a profundidade normalmente reservada a turmas com um terço a um quarto desse tamanho.
Conclusões
Os autores são explícitos quanto às limitações: o ensaio mediu a precisão da correção e as classificações do feedback, não os ganhos reais de aprendizagem dos estudantes, os resultados variaram entre os quatro cursos, e a dependência de um único modelo proprietário (GPT-4) levanta preocupações de replicabilidade à medida que os modelos evoluem.
Implementação
Custo indicativo
Baixo (< 50 mil €)
Tempo até resultados
Médio (1–3 anos)
Equipa e competências
Course instructors building rubrics and gold-standard example answers, Research team (Heinrich et al.) administering random assignment and analysis
Condições de sucesso
Instructor-built rubrics and gold example answers to guide AI grading
Random assignment of responses across both AI and human graders for comparability
Multi-institution design across differing course contexts