NAPLAN Automated Essay Scoring Trial — ACARA's Evidence-Based Decision to Keep Human Markers
Australia
ACARA found four AI essay-scoring systems scored NAPLAN writing as reliably as human markers, yet Australia's Education Council decided in …
Estonia · Tallinn · See the Estonia profile
Un estudio revisado por pares en 2026 probó la corrección con LLM y PLN estadístico de los ensayos de los exámenes nacionales de fin de secundaria de Estonia, en dos cohortes nacionales completas. Las notas de la IA quedaron dentro del rango de los evaluadores humanos en el 60% de los casos, manteniéndose la decisión final en manos humanas.
La Junta de Educación y Juventud de Estonia (Harno) está digitalizando los exámenes finales de primaria y secundaria del país, con exámenes digitales completos previstos a partir de 2027. Antes de ese cambio, Harno colaboró con investigadores, incluido un equipo de la Universidad de Tallin, para probar si los grandes modelos de lenguaje y el PLN estadístico podían apoyar la corrección de los exámenes nacionales de redacción en lengua materna y de fin de estudios.
El estudio comparó las puntuaciones generadas por máquina con las puntuaciones oficiales de un panel humano en dos cohortes nacionales completas de redacciones de prueba, utilizando la misma rúbrica curricular empleada por los correctores humanos. En el 60% de los casos, la puntuación del modelo de lenguaje se situó dentro del rango en que varían entre sí los evaluadores humanos, con la mayor concordancia en los criterios más objetivos, como el uso correcto de los textos fuente. El estudio también evaluó los modelos en cuanto a sesgos y vulnerabilidades de inyección de instrucciones.
Dado que las normas de la UE prohíben que las máquinas tomen decisiones vinculantes sobre los exámenes de los estudiantes, cualquier implementación mantiene a un evaluador humano como responsable de la decisión final, tratando la IA como apoyo a la decisión (por ejemplo, señalando el uso de textos fuente) en lugar de como sustituto del corrector. Harno todavía estaba revisando los resultados finales en el momento de la publicación, y criterios subjetivos como la calidad argumentativa siguen siendo una decisión humana.
Where this practice's information was retrieved from, and when.
Australia
ACARA found four AI essay-scoring systems scored NAPLAN writing as reliably as human markers, yet Australia's Education Council decided in …
Portugal
Portugal's 2026 rollout of digital correction for national secondary exams (81,000+ students) hit widespread login failures, lost and duplicated scripts, …
Australia
Instead of an unwinnable AI-detection arms race, Sydney redesigned assessment into two lanes — secure in-person assessment of core capability, …
United Kingdom
Free AI writing-feedback tool by Cambridge University Press & Assessment (Sept 2016); assigns CEFR A1–C2 levels to EFL essays and …
Open full copilot Grounded in cited practices — always check the sources.