evidoria

← Retour à la liste

Bonne pratique Importée

Essai AHEAD — Les questions d'examen médical générées par l'IA égalent celles rédigées par des humains sur la plupart des mesures, avec un écart d'équité signalé

Canada · Vancouver · Voir le profil de Canada · Voir le profil de Vancouver

Top 59% 47/100 · Demandez à Evidence Copilot à propos de cette pratique

Un essai randomisé en aveugle mené auprès de 258 étudiants en médecine de première année à l'UBC a montré que les questions d'examen générées par ChatGPT-4/Gemini étaient produites 5,6 fois plus vite que celles rédigées par des étudiants, avec des notes et une acceptabilité similaires, bien que les items humains discriminent légèrement mieux et qu'un écart selon le genre soit apparu uniquement sur l'examen généré par l'IA.

Essai AHEAD — Les questions d'examen médical générées par l'IA égalent celles rédigées par des humains sur la plupart des mesures, avec un écart d'équité signalé

Détails

Promoteur
University of British Columbia Faculty of Medicine
Période
December 2024 (published June 2026)
Mots-clés
higher education, medical education, assessment design, academic integrity

Description

Rédiger une seule question à choix multiples de bonne qualité pour un examen de médecine peut prendre plus d'une heure et coûter entre 200 et plus de 2 000 dollars américains par item utilisable, ce qui rend coûteuse la constitution et la maintenance de grandes banques de questions.
L'essai AHEAD, mené par la Faculté de médecine de l'University of British Columbia (UBC) les 8 et 9 décembre 2024, a réparti aléatoirement 258 étudiants en médecine de première année, selon un ratio 1:1, vers un examen blanc à l'aveugle de 112 questions élaboré soit par des étudiants en médecine plus avancés (généré par des humains), soit par un pipeline ChatGPT-4 avec validation par Google Gemini (généré par IA), tous les indices d'auteur ayant été retirés avant la remise.
Les questions générées par IA ont pris 4,2 minutes chacune à produire, contre 19,6 minutes pour les questions rédigées par des humains — un gain d'efficacité de 5,6 fois (p<0,0001). Les scores globaux à l'examen étaient statistiquement similaires (73,4 % pour l'examen humain contre 71,0 % pour l'examen IA ; p=0,083), et l'acceptabilité évaluée par les étudiants ne différait que légèrement, favorisant l'examen humain sur quatre des neuf mesures, avec de petites tailles d'effet (d de Cohen ≤0,32). Les items rédigés par des humains avaient des indices de discrimination modestement mais significativement supérieurs à ceux générés par l'IA (effet faible), et aucun des deux examens n'a modifié de façon notable le sentiment de préparation des étudiants.
Une analyse exploratoire en sous-groupes, probablement sous-dimensionnée, a révélé que les étudiants masculins surpassaient les étudiantes sur l'examen généré par l'IA (rrb=0,26), mais pas sur l'examen généré par des humains (rrb=0,07) — un signal que les auteurs présentent comme nécessitant un suivi démographique plutôt que comme un effet confirmé. L'essai a été mené dans un seul centre, n'a porté que sur des étudiants de première année, les rédacteurs de questions étaient des étudiants avancés plutôt que des enseignants, et l'enregistrement a été effectué rétrospectivement — autant de limites signalées par les auteurs eux-mêmes.

Mise en œuvre

Les détails de mise en œuvre (coût, calendrier, personnel, conditions de réussite) ne sont pas encore disponibles pour cette pratique.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles