Redactar una sola pregunta de opción múltiple de buena calidad para un examen de medicina puede llevar más de una hora y costar entre 200 y más de 2000 dólares estadounidenses por ítem utilizable, lo que encarece la construcción y el mantenimiento de bancos de preguntas grandes.
El Ensayo AHEAD, realizado por la Facultad de Medicina de la University of British Columbia (UBC) los días 8 y 9 de diciembre de 2024, asignó aleatoriamente a 258 estudiantes de medicina de primer año, en una proporción 1:1, a un examen simulado ciego de 112 preguntas elaborado por estudiantes de medicina más avanzados (generadas por humanos) o por un flujo de ChatGPT-4 con validación de Google Gemini (generadas por IA), eliminando todo indicio de autoría antes de su entrega.
Las preguntas generadas por IA tardaron 4,2 minutos cada una en producirse, frente a 19,6 minutos de las preguntas escritas por humanos, una ganancia de eficiencia de 5,6 veces (p<0,0001). Las puntuaciones generales del examen fueron estadísticamente similares (73,4 % en el examen humano frente a 71,0 % en el examen de IA; p=0,083), y la aceptación evaluada por los estudiantes solo difirió ligeramente, favoreciendo al examen humano en cuatro de nueve medidas, con tamaños de efecto pequeños (d de Cohen ≤0,32). Los ítems escritos por humanos tuvieron índices de discriminación modesta pero significativamente superiores a los generados por IA (efecto pequeño), y ninguno de los dos exámenes cambió de forma relevante la percepción de preparación de los estudiantes.
Un análisis exploratorio de subgrupos, probablemente con poca potencia estadística, encontró que los estudiantes varones superaron a las estudiantes mujeres en el examen generado por IA (rrb=0,26), pero no en el examen generado por humanos (rrb=0,07); una señal que los autores marcan como necesitada de monitorización demográfica y no como un efecto confirmado. El ensayo se realizó en un único centro, incluyó solo a estudiantes de primer año, quienes redactaron las preguntas fueron estudiantes avanzados y no profesorado, y el registro se hizo de forma retrospectiva, limitaciones todas señaladas por los propios autores.
De dónde se obtuvo la información de esta práctica, y cuándo.