evidoria

← Volver al listado

Buena práctica Importada

Un estudio de Cambridge concluye que la IA aún no es fiable para calificar ensayos universitarios

Reino Unido · Cambridge · Ver el perfil de Reino Unido · Ver el perfil de Cambridge

Top 72% 40/100 · Pregunte a Evidence Copilot sobre esta práctica

Investigadores de la Universidad de Cambridge pusieron a prueba a Claude y ChatGPT calificando 750 ensayos reales de tres universidades británicas. Los sistemas solo coincidieron con la banda de nota de los examinadores humanos entre el 35 % y el 65 % de las veces, sobrevalorando la extensión y el vocabulario por encima del contenido.

Un estudio de Cambridge concluye que la IA aún no es fiable para calificar ensayos universitarios

Detalles

Promotor
University of Cambridge
Período
2026
Palabras clave
higher education, psychology, assessment research

Descripción

Un equipo liderado por la Universidad de Cambridge, formado por psicólogos y especialistas en IA, evaluó tres modelos de lenguaje de última generación —incluidas versiones recientes de Claude y ChatGPT (a abril de 2026)— en su capacidad para calificar trabajos reales de estudiantes universitarios. El equipo reunió un corpus de más de 750 ensayos de psicología presentados en tres universidades del Reino Unido y comparó las bandas de calificación asignadas por la IA (primera, 2:1, 2:2, etc.) con las otorgadas originalmente por examinadores humanos.
Los sistemas de IA solo coincidieron con la banda de calificación de los examinadores humanos entre el 35 % y el 65 % de las veces, según el modelo y el conjunto de ensayos, lejos de la fiabilidad necesaria para evaluaciones de alto riesgo. El equipo identificó un fallo concreto: los tres sistemas eran excesivamente sensibles a rasgos lingüísticos superficiales, premiando sistemáticamente la extensión del ensayo y la riqueza de vocabulario, independientemente de la solidez del argumento. Los calificadores de IA también infravaloraron con frecuencia ensayos que los humanos habían calificado como los mejores, y sobrevaloraron algunas de las entregas más débiles.
Cuando se les pidió generar comentarios escritos en lugar de solo una nota, los sistemas de IA produjeron comentarios de tres a ocho veces más largos que los de los evaluadores humanos originales: más extensos, pero no necesariamente más útiles para los estudiantes. La conclusión del equipo de Cambridge fue explícitamente cautelar: la IA 'todavía no es lo suficientemente buena' para calificar ensayos universitarios abiertos sin una supervisión humana significativa, una conclusión pensada para frenar a las universidades que consideran la calificación automatizada antes de contar con salvaguardas y validaciones más rigurosas.

Implementación

Los detalles de implementación (coste, plazo, personal, condiciones para el éxito) aún no están disponibles para esta práctica.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles