La Faculté et l'Hôpital de stomatologie de l'Université de Wuhan ont réparti aléatoirement 187 étudiants de troisième année en dentisterie dans une unité de formation pratique d'une semaine, soit avec une instruction vidéo standard seule (témoin), soit avec la même instruction vidéo plus un accès à la demande à ChatGPT-3.5 comme formateur complémentaire (intervention).
Lors d'une évaluation pratique en aveugle, le groupe ChatGPT a obtenu un score significativement plus élevé que le groupe témoin (moyenne 73,12 contre 65,54, t=4,569, p<,001). Les mesures du diamètre pupillaire par eye-tracking ont montré une charge cognitive significativement plus faible dans le groupe ChatGPT (moyenne 0,137 contre 0,312, p<,001). Les étudiants ayant une faible capacité spatiale en ont le plus bénéficié (moyenne 70,20 contre 55,41, p<,001), et l'auto-efficacité (p=,04) ainsi que la motivation à apprendre (p=,02) auto-déclarées ont toutes deux favorisé le groupe ChatGPT.
L'essai s'est déroulé pendant une semaine dans une seule université, en utilisant un chatbot générique non ajusté plutôt qu'un tuteur d'IA conçu ou validé par l'établissement ; l'étude publiée ne décrit pas de mesures de gouvernance des données pour l'utilisation par les étudiants d'un chatbot commercial tiers hébergé aux États-Unis, ni n'évalue de composante destinée aux enseignants.
D'où proviennent les informations de cette pratique, et quand.