Rédiger une seule question à choix multiples de bonne qualité pour un examen de médecine peut prendre plus d'une heure et coûter entre 200 et plus de 2 000 dollars américains par item utilisable, ce qui rend coûteuse la constitution et la maintenance de grandes banques de questions.
L'essai AHEAD, mené par la Faculté de médecine de l'University of British Columbia (UBC) les 8 et 9 décembre 2024, a réparti aléatoirement 258 étudiants en médecine de première année, selon un ratio 1:1, vers un examen blanc à l'aveugle de 112 questions élaboré soit par des étudiants en médecine plus avancés (généré par des humains), soit par un pipeline ChatGPT-4 avec validation par Google Gemini (généré par IA), tous les indices d'auteur ayant été retirés avant la remise.
Les questions générées par IA ont pris 4,2 minutes chacune à produire, contre 19,6 minutes pour les questions rédigées par des humains — un gain d'efficacité de 5,6 fois (p<0,0001). Les scores globaux à l'examen étaient statistiquement similaires (73,4 % pour l'examen humain contre 71,0 % pour l'examen IA ; p=0,083), et l'acceptabilité évaluée par les étudiants ne différait que légèrement, favorisant l'examen humain sur quatre des neuf mesures, avec de petites tailles d'effet (d de Cohen ≤0,32). Les items rédigés par des humains avaient des indices de discrimination modestement mais significativement supérieurs à ceux générés par l'IA (effet faible), et aucun des deux examens n'a modifié de façon notable le sentiment de préparation des étudiants.
Une analyse exploratoire en sous-groupes, probablement sous-dimensionnée, a révélé que les étudiants masculins surpassaient les étudiantes sur l'examen généré par l'IA (rrb=0,26), mais pas sur l'examen généré par des humains (rrb=0,07) — un signal que les auteurs présentent comme nécessitant un suivi démographique plutôt que comme un effet confirmé. L'essai a été mené dans un seul centre, n'a porté que sur des étudiants de première année, les rédacteurs de questions étaient des étudiants avancés plutôt que des enseignants, et l'enregistrement a été effectué rétrospectivement — autant de limites signalées par les auteurs eux-mêmes.
D'où proviennent les informations de cette pratique, et quand.