Evaluación 'two-lane' de la Universidad de Sídney para la era de la IA
Australia
En lugar de una carrera armamentista de detección de IA imposible de ganar, Sídney rediseñó la evaluación en dos carriles …
Reino Unido · Cambridge · Ver el perfil de Reino Unido · Ver el perfil de Cambridge
Top 72% 40/100 · Pregunte a Evidence Copilot sobre esta práctica
Investigadores de la Universidad de Cambridge pusieron a prueba a Claude y ChatGPT calificando 750 ensayos reales de tres universidades británicas. Los sistemas solo coincidieron con la banda de nota de los examinadores humanos entre el 35 % y el 65 % de las veces, sobrevalorando la extensión y el vocabulario por encima del contenido.
Un equipo liderado por la Universidad de Cambridge, formado por psicólogos y especialistas en IA, evaluó tres modelos de lenguaje de última generación —incluidas versiones recientes de Claude y ChatGPT (a abril de 2026)— en su capacidad para calificar trabajos reales de estudiantes universitarios. El equipo reunió un corpus de más de 750 ensayos de psicología presentados en tres universidades del Reino Unido y comparó las bandas de calificación asignadas por la IA (primera, 2:1, 2:2, etc.) con las otorgadas originalmente por examinadores humanos.
Los sistemas de IA solo coincidieron con la banda de calificación de los examinadores humanos entre el 35 % y el 65 % de las veces, según el modelo y el conjunto de ensayos, lejos de la fiabilidad necesaria para evaluaciones de alto riesgo. El equipo identificó un fallo concreto: los tres sistemas eran excesivamente sensibles a rasgos lingüísticos superficiales, premiando sistemáticamente la extensión del ensayo y la riqueza de vocabulario, independientemente de la solidez del argumento. Los calificadores de IA también infravaloraron con frecuencia ensayos que los humanos habían calificado como los mejores, y sobrevaloraron algunas de las entregas más débiles.
Cuando se les pidió generar comentarios escritos en lugar de solo una nota, los sistemas de IA produjeron comentarios de tres a ocho veces más largos que los de los evaluadores humanos originales: más extensos, pero no necesariamente más útiles para los estudiantes. La conclusión del equipo de Cambridge fue explícitamente cautelar: la IA 'todavía no es lo suficientemente buena' para calificar ensayos universitarios abiertos sin una supervisión humana significativa, una conclusión pensada para frenar a las universidades que consideran la calificación automatizada antes de contar con salvaguardas y validaciones más rigurosas.
Los detalles de implementación (coste, plazo, personal, condiciones para el éxito) aún no están disponibles para esta práctica.
¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
De dónde se obtuvo la información de esta práctica, y cuándo.
Australia
En lugar de una carrera armamentista de detección de IA imposible de ganar, Sídney rediseñó la evaluación en dos carriles …
Hong Kong
En junio de 2023, el Senado de la HKU nombró a la IA generativa "quinta alfabetizacion" y dio a todos …
Reino Unido
La University of Bedfordshire realizó una evaluación publicada comparando su servicio de escritura Studiosity, con tutores humanos, con una nueva …
Estados Unidos
Plataforma de IA que agrupa respuestas similares para corrección en lote; 3,2 M de estudiantes en 2 600+ universidades. Estudio …
Abrir el copiloto completo Basado en prácticas citadas: comprueba siempre las fuentes.