Un ensayo aleatorizado revisado por pares en cuatro universidades asignó al azar 3.080 respuestas cortas a corrección por GPT-4 o por humanos. Las notas fueron estadísticamente indistinguibles, y la IA permitió a los docentes dar a clases grandes una retroalimentación equivalente a la de clases un tercio de su tamaño.
-0.04
Diferencia de precisión en la calificación, IA vs. humanos (no significativa) (2023-2024)
3,080
Respuestas de estudiantes asignadas aleatoriamente a corrección por IA o humana (2023-2024)
~70 students given feedback depth typical of classes a third to a quarter the size
Tamaño de clase en el que la retroalimentación asistida por IA igualó a clases mucho más pequeñas
Detalles
Promotor
University of Houston, with University of South Carolina, University of Michigan & Academia Sinica (Taiwan)
Período
2023-2025
Palabras clave
higher education, political science, AI-assisted grading, research
Contexto
Corregir y ofrecer retroalimentación personalizada en preguntas de respuesta corta consume mucho tiempo, lo que a menudo lleva a los docentes de clases numerosas a preferir evaluaciones de opción múltiple, reduciendo las oportunidades de los estudiantes para desarrollar el pensamiento crítico.
Objetivos
Probar si la asistencia de un modelo de lenguaje (GPT-4) puede calificar respuestas cortas con la misma precisión que correctores humanos, y permitir que los docentes de clases numerosas ofrezcan el tipo de retroalimentación individualizada normalmente reservada a clases mucho más pequeñas.
Actividades
Investigadores liderados por Heinrich y colegas realizaron un ensayo controlado aleatorizado en cuatro programas de grado en ciencias políticas (Universidad de Houston, Universidad de Carolina del Sur, Universidad de Míchigan y Academia Sinica en Taiwán) en 2023-2024. En 26 pruebas que abarcaron a 271 estudiantes, alrededor de diez respuestas de estudiantes por pregunta de respuesta corta se asignaron aleatoriamente a corrección humana o por GPT-4, con la IA guiada por rúbricas elaboradas por los docentes y respuestas modelo ("gold").
Resultados
El estudio, publicado en PLoS One en agosto de 2025, no encontró diferencias estadísticamente significativas en la precisión de la calificación entre la IA y los correctores humanos (diferencia media de -0,04). Las solicitudes de recalificación fueron solo marginalmente más altas para los trabajos corregidos por humanos, y la retroalimentación humana se calificó como "útil" unos dos puntos porcentuales más a menudo que la de la IA. La ganancia más clara fue de productividad: la corrección asistida por IA permitió a los docentes ofrecer a clases de unos 70 estudiantes una retroalimentación individualizada con una profundidad normalmente reservada a clases de un tercio a un cuarto de ese tamaño.
Conclusiones
Los autores son explícitos sobre las limitaciones: el ensayo midió la precisión de la calificación y la valoración de la retroalimentación, no las ganancias reales de aprendizaje de los estudiantes; los resultados variaron entre los cuatro cursos, y la dependencia de un único modelo propietario (GPT-4) plantea preocupaciones de replicabilidad a medida que los modelos cambian.
Implementación
Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Medio (1–3 años)
Personal y competencias
Course instructors building rubrics and gold-standard example answers, Research team (Heinrich et al.) administering random assignment and analysis
Condiciones para el éxito
Instructor-built rubrics and gold example answers to guide AI grading
Random assignment of responses across both AI and human graders for comparability
Multi-institution design across differing course contexts
Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.