evidoria

← Voltar à navegação

Boa prática Importada

Correção em Escala — Um Ensaio Aleatorizado de IA vs. Corretores Humanos em Quatro Programas de Ciência Política

Estados Unidos da América · Houston · Ver o perfil de Estados Unidos da América

Evidência: Ensaio controlado aleatorizado Top 17% 67/100 · Pergunte a Evidence Copilot sobre esta prática

Um ensaio clínico aleatorizado revisado por pares em quatro universidades atribuiu aleatoriamente 3.080 respostas curtas a correção por GPT-4 ou por humanos. As notas foram estatisticamente indistinguíveis, e a IA permitiu que docentes dessem a turmas grandes um feedback equivalente ao de turmas um terço do tamanho.

-0.04
Diferença de precisão na correção, IA vs. humanos (não significativa) (2023-2024)
3,080
Respostas de estudantes atribuídas aleatoriamente a correção por IA ou humana (2023-2024)
~70 students given feedback depth typical of classes a third to a quarter the size
Dimensão de turma em que o feedback assistido por IA igualou turmas muito mais pequenas
Correção em Escala — Um Ensaio Aleatorizado de IA vs. Corretores Humanos em Quatro Programas de Ciência Política

Detalhes

Promotor
University of Houston, with University of South Carolina, University of Michigan & Academia Sinica (Taiwan)
Período
2023-2025
Palavras-chave
higher education, political science, AI-assisted grading, research

Contexto

Corrigir e dar feedback personalizado em perguntas de resposta curta é moroso, o que muitas vezes leva os docentes de turmas grandes a preferirem avaliações de escolha múltipla, reduzindo as oportunidades dos estudantes para desenvolver o pensamento crítico.

Objetivos

Testar se a assistência de um modelo de linguagem (GPT-4) consegue corrigir respostas curtas com a mesma precisão que corretores humanos, e permitir que os docentes deem a turmas grandes o tipo de feedback individualizado normalmente reservado a turmas muito mais pequenas.

Atividades

Investigadores liderados por Heinrich e colegas realizaram um ensaio controlado aleatorizado em quatro cursos de licenciatura em ciência política (Universidade de Houston, Universidade da Carolina do Sul, Universidade de Michigan e Academia Sinica, em Taiwan) em 2023-2024. Em 26 testes que abrangeram 271 estudantes, cerca de dez respostas de estudantes por pergunta de resposta curta foram aleatoriamente atribuídas a correção humana ou por GPT-4, com a IA orientada por grelhas de correção elaboradas pelos docentes e por respostas-modelo ("gold").

Resultados

O estudo, publicado na PLoS One em agosto de 2025, não encontrou diferença estatisticamente significativa na precisão da avaliação entre correção por IA e correção humana (diferença média de -0,04). Os pedidos de reavaliação foram apenas ligeiramente mais elevados para os trabalhos corrigidos por humanos, e o feedback humano foi classificado como "útil" cerca de dois pontos percentuais mais vezes do que o feedback da IA. O ganho mais claro foi de produtividade: a correção assistida por IA permitiu aos docentes dar a turmas de cerca de 70 estudantes um feedback individualizado com a profundidade normalmente reservada a turmas com um terço a um quarto desse tamanho.

Conclusões

Os autores são explícitos quanto às limitações: o ensaio mediu a precisão da correção e as classificações do feedback, não os ganhos reais de aprendizagem dos estudantes, os resultados variaram entre os quatro cursos, e a dependência de um único modelo proprietário (GPT-4) levanta preocupações de replicabilidade à medida que os modelos evoluem.

Implementação

Custo indicativo
Baixo (< 50 mil €)
Tempo até resultados
Médio (1–3 anos)
Equipa e competências
Course instructors building rubrics and gold-standard example answers, Research team (Heinrich et al.) administering random assignment and analysis

Condições de sucesso

  • Instructor-built rubrics and gold example answers to guide AI grading
  • Random assignment of responses across both AI and human graders for comparability
  • Multi-institution design across differing course contexts

Habitualmente financiado por

Horizon Europe Erasmus+ National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis