evidoria

← Retour à la liste

Bonne pratique Importée

Correction à Grande Échelle — Un Essai Randomisé Comparant l'IA aux Correcteurs Humains dans Quatre Cursus de Science Politique

États-Unis d'Amérique · Houston · Voir le profil de États-Unis d'Amérique

Preuves: Essai contrôlé randomisé Top 17% 67/100 · Demandez à Evidence Copilot à propos de cette pratique

Un essai randomisé évalué par des pairs dans quatre universités a assigné aléatoirement 3 080 réponses courtes à une correction par GPT-4 ou humaine. Les notes étaient statistiquement indiscernables, et l'IA a permis aux enseignants d'offrir à de grandes classes un retour équivalent à celui de classes trois fois plus petites.

-0.04
Différence de précision de notation, IA vs humains (non significative) (2023-2024)
3,080
Réponses d'étudiants assignées aléatoirement à une correction par IA ou humaine (2023-2024)
~70 students given feedback depth typical of classes a third to a quarter the size
Taille de classe pour laquelle le retour assisté par IA a égalé des classes bien plus petites
Correction à Grande Échelle — Un Essai Randomisé Comparant l'IA aux Correcteurs Humains dans Quatre Cursus de Science Politique

Détails

Promoteur
University of Houston, with University of South Carolina, University of Michigan & Academia Sinica (Taiwan)
Période
2023-2025
Mots-clés
higher education, political science, AI-assisted grading, research

Contexte

Corriger et fournir un retour personnalisé sur des questions à réponse courte prend du temps, ce qui pousse souvent les enseignants de grandes classes vers des évaluations à choix multiples, réduisant les occasions pour les étudiants de développer leur esprit critique.

Objectifs

Tester si l'assistance d'un grand modèle de langage (GPT-4) peut corriger des réponses courtes avec une précision comparable à celle de correcteurs humains, et permettre aux enseignants de grandes classes de fournir le type de retour individualisé habituellement réservé à des classes bien plus petites.

Activités

Des chercheurs dirigés par Heinrich et ses collègues ont mené un essai contrôlé randomisé dans quatre programmes de licence en science politique (université de Houston, université de Caroline du Sud, université du Michigan et Academia Sinica à Taïwan) en 2023-2024. Sur 26 tests couvrant 271 étudiants, environ dix réponses d'étudiants par question à réponse courte ont été assignées aléatoirement à une correction humaine ou par GPT-4, l'IA étant guidée par des grilles de correction conçues par les enseignants et des réponses-modèles (« gold »).

Résultats

L'étude, publiée dans PLoS One en août 2025, n'a trouvé aucune différence statistiquement significative de précision de notation entre l'IA et les correcteurs humains (différence moyenne de -0,04). Les demandes de recorrection n'étaient que légèrement plus fréquentes pour les travaux corrigés par des humains, et le retour humain a été jugé « utile » environ deux points de pourcentage plus souvent que le retour de l'IA. Le gain le plus net a porté sur la productivité : la correction assistée par IA a permis aux enseignants de fournir à des classes d'environ 70 étudiants un retour individualisé d'une profondeur habituellement réservée à des classes trois à quatre fois plus petites.

Conclusions

Les auteurs sont explicites sur les limites : l'essai a mesuré la précision de la notation et l'appréciation du retour, non les gains d'apprentissage réels des étudiants ; les résultats ont varié selon les quatre cours, et la dépendance à un modèle propriétaire unique (GPT-4) soulève des inquiétudes de reproductibilité à mesure que les modèles évoluent.

Mise en œuvre

Coût indicatif
Faible (< 50 k€)
Délai jusqu’aux résultats
Moyen (1–3 ans)
Personnel et compétences
Course instructors building rubrics and gold-standard example answers, Research team (Heinrich et al.) administering random assignment and analysis

Conditions de réussite

  • Instructor-built rubrics and gold example answers to guide AI grading
  • Random assignment of responses across both AI and human graders for comparability
  • Multi-institution design across differing course contexts

Habituellement financé par

Horizon Europe Erasmus+ National / regional programmes

Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles