evidoria

← Volver al listado

Buena práctica Importada

Ensayo AHEAD — Las preguntas de examen médico generadas por IA igualan a las escritas por humanos en la mayoría de las medidas, con una brecha de equidad señalada

Canadá · Vancouver · Ver el perfil de Canadá · Ver el perfil de Vancouver

Top 59% 47/100 · Pregunte a Evidence Copilot sobre esta práctica

Un ECA cegado con 258 estudiantes de medicina de primer año de la UBC halló que las preguntas de examen generadas por ChatGPT-4/Gemini se produjeron 5,6 veces más rápido que las escritas por estudiantes, con notas y aceptación similares, aunque los ítems humanos discriminaron algo mejor y surgió una brecha de género solo en el examen de IA.

Ensayo AHEAD — Las preguntas de examen médico generadas por IA igualan a las escritas por humanos en la mayoría de las medidas, con una brecha de equidad señalada

Detalles

Promotor
University of British Columbia Faculty of Medicine
Período
December 2024 (published June 2026)
Palabras clave
higher education, medical education, assessment design, academic integrity

Descripción

Redactar una sola pregunta de opción múltiple de buena calidad para un examen de medicina puede llevar más de una hora y costar entre 200 y más de 2000 dólares estadounidenses por ítem utilizable, lo que encarece la construcción y el mantenimiento de bancos de preguntas grandes.
El Ensayo AHEAD, realizado por la Facultad de Medicina de la University of British Columbia (UBC) los días 8 y 9 de diciembre de 2024, asignó aleatoriamente a 258 estudiantes de medicina de primer año, en una proporción 1:1, a un examen simulado ciego de 112 preguntas elaborado por estudiantes de medicina más avanzados (generadas por humanos) o por un flujo de ChatGPT-4 con validación de Google Gemini (generadas por IA), eliminando todo indicio de autoría antes de su entrega.
Las preguntas generadas por IA tardaron 4,2 minutos cada una en producirse, frente a 19,6 minutos de las preguntas escritas por humanos, una ganancia de eficiencia de 5,6 veces (p<0,0001). Las puntuaciones generales del examen fueron estadísticamente similares (73,4 % en el examen humano frente a 71,0 % en el examen de IA; p=0,083), y la aceptación evaluada por los estudiantes solo difirió ligeramente, favoreciendo al examen humano en cuatro de nueve medidas, con tamaños de efecto pequeños (d de Cohen ≤0,32). Los ítems escritos por humanos tuvieron índices de discriminación modesta pero significativamente superiores a los generados por IA (efecto pequeño), y ninguno de los dos exámenes cambió de forma relevante la percepción de preparación de los estudiantes.
Un análisis exploratorio de subgrupos, probablemente con poca potencia estadística, encontró que los estudiantes varones superaron a las estudiantes mujeres en el examen generado por IA (rrb=0,26), pero no en el examen generado por humanos (rrb=0,07); una señal que los autores marcan como necesitada de monitorización demográfica y no como un efecto confirmado. El ensayo se realizó en un único centro, incluyó solo a estudiantes de primer año, quienes redactaron las preguntas fueron estudiantes avanzados y no profesorado, y el registro se hizo de forma retrospectiva, limitaciones todas señaladas por los propios autores.

Implementación

Los detalles de implementación (coste, plazo, personal, condiciones para el éxito) aún no están disponibles para esta práctica.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles