evidoria

← Volver al listado

Buena práctica Importada

Corrección a Gran Escala — Un Ensayo Aleatorizado de IA frente a Correctores Humanos en Cuatro Programas de Ciencia Política

Estados Unidos · Houston · Ver el perfil de Estados Unidos

Evidencia: Ensayo controlado aleatorizado Top 17% 67/100 · Pregunte a Evidence Copilot sobre esta práctica

Un ensayo aleatorizado revisado por pares en cuatro universidades asignó al azar 3.080 respuestas cortas a corrección por GPT-4 o por humanos. Las notas fueron estadísticamente indistinguibles, y la IA permitió a los docentes dar a clases grandes una retroalimentación equivalente a la de clases un tercio de su tamaño.

-0.04
Diferencia de precisión en la calificación, IA vs. humanos (no significativa) (2023-2024)
3,080
Respuestas de estudiantes asignadas aleatoriamente a corrección por IA o humana (2023-2024)
~70 students given feedback depth typical of classes a third to a quarter the size
Tamaño de clase en el que la retroalimentación asistida por IA igualó a clases mucho más pequeñas
Corrección a Gran Escala — Un Ensayo Aleatorizado de IA frente a Correctores Humanos en Cuatro Programas de Ciencia Política

Detalles

Promotor
University of Houston, with University of South Carolina, University of Michigan & Academia Sinica (Taiwan)
Período
2023-2025
Palabras clave
higher education, political science, AI-assisted grading, research

Contexto

Corregir y ofrecer retroalimentación personalizada en preguntas de respuesta corta consume mucho tiempo, lo que a menudo lleva a los docentes de clases numerosas a preferir evaluaciones de opción múltiple, reduciendo las oportunidades de los estudiantes para desarrollar el pensamiento crítico.

Objetivos

Probar si la asistencia de un modelo de lenguaje (GPT-4) puede calificar respuestas cortas con la misma precisión que correctores humanos, y permitir que los docentes de clases numerosas ofrezcan el tipo de retroalimentación individualizada normalmente reservada a clases mucho más pequeñas.

Actividades

Investigadores liderados por Heinrich y colegas realizaron un ensayo controlado aleatorizado en cuatro programas de grado en ciencias políticas (Universidad de Houston, Universidad de Carolina del Sur, Universidad de Míchigan y Academia Sinica en Taiwán) en 2023-2024. En 26 pruebas que abarcaron a 271 estudiantes, alrededor de diez respuestas de estudiantes por pregunta de respuesta corta se asignaron aleatoriamente a corrección humana o por GPT-4, con la IA guiada por rúbricas elaboradas por los docentes y respuestas modelo ("gold").

Resultados

El estudio, publicado en PLoS One en agosto de 2025, no encontró diferencias estadísticamente significativas en la precisión de la calificación entre la IA y los correctores humanos (diferencia media de -0,04). Las solicitudes de recalificación fueron solo marginalmente más altas para los trabajos corregidos por humanos, y la retroalimentación humana se calificó como "útil" unos dos puntos porcentuales más a menudo que la de la IA. La ganancia más clara fue de productividad: la corrección asistida por IA permitió a los docentes ofrecer a clases de unos 70 estudiantes una retroalimentación individualizada con una profundidad normalmente reservada a clases de un tercio a un cuarto de ese tamaño.

Conclusiones

Los autores son explícitos sobre las limitaciones: el ensayo midió la precisión de la calificación y la valoración de la retroalimentación, no las ganancias reales de aprendizaje de los estudiantes; los resultados variaron entre los cuatro cursos, y la dependencia de un único modelo propietario (GPT-4) plantea preocupaciones de replicabilidad a medida que los modelos cambian.

Implementación

Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Medio (1–3 años)
Personal y competencias
Course instructors building rubrics and gold-standard example answers, Research team (Heinrich et al.) administering random assignment and analysis

Condiciones para el éxito

  • Instructor-built rubrics and gold example answers to guide AI grading
  • Random assignment of responses across both AI and human graders for comparability
  • Multi-institution design across differing course contexts

Habitualmente financiado por

Horizon Europe Erasmus+ National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles