Estonia's AI-Assisted Grading Trial for National School-Leaving Essay Exams
Estonia
A 2026 peer-reviewed study tested LLM and statistical-NLP grading of Estonia's national school-leaving essay exams across two full cohorts. AI …
Australia · Sydney · See the Australia profile
ACARA halló que cuatro sistemas de IA puntuaban redacciones del NAPLAN con fiabilidad comparable a la humana, pero el Consejo de Educación de Australia decidió, en dic. 2017, no usar IA en pruebas nacionales de alto riesgo, citando riesgos de sesgo y opacidad.
En 2015, la Australian Curriculum, Assessment and Reporting Authority (ACARA) evaluó sistemas de calificación automática de redacciones (AES) de cuatro proveedores — Measurement Incorporated, Pearson, Pacific Metrics y MetaMetrics — frente a textos persuasivos del NAPLAN corregidos por evaluadores humanos. Los sistemas se calibraron con 1.014 redacciones y luego se probaron con otras 339 redacciones. ACARA se había fijado el objetivo de lograr, para 2020, una evaluación de escritura del NAPLAN totalmente automatizada, manteniendo a los evaluadores humanos solo como verificación de respaldo, y esta evaluación se planteó como un paso hacia ese objetivo.
La evaluación de ACARA buscaba determinar si los sistemas de calificación por IA podían aproximarse lo suficiente a los evaluadores humanos, tanto en las puntuaciones globales como en los criterios individuales de escritura, para justificar la automatización de la evaluación nacional de escritura del NAPLAN, de alto riesgo. Defensores como el investigador educativo el profesor John Hattie sostuvieron que la calificación automática podría ser mucho más precisa y considerablemente más barata que la calificación humana.
Los cuatro sistemas de los proveedores fueron evaluados según su concordancia con los evaluadores humanos, tanto en las puntuaciones globales como en los criterios individuales de escritura, utilizando los conjuntos de redacciones de calibración y de prueba. Tras la evaluación técnica, los sindicatos de docentes manifestaron una oposición sostenida, argumentando que los algoritmos de calificación propietarios y no públicos no podían juzgar de forma fiable la creatividad, la ironía o la lógica de un argumento, y suponían un riesgo de sesgo contra determinados grupos de estudiantes. En diciembre de 2017, el Education Council de Australia, el organismo ministerial nacional responsable del NAPLAN, decidió formalmente no utilizar la AES para la evaluación de escritura del NAPLAN, deteniendo el avance hacia la automatización total.
Los cuatro sistemas de calificación automática de redacciones lograron una concordancia con los evaluadores humanos comparable, tanto en las puntuaciones globales como en los criterios individuales de escritura. A pesar de ello, el plan de ACARA para alcanzar la automatización total en 2020 fue abandonado tras la decisión del Education Council de Australia, en diciembre de 2017, en contra del uso de la AES para la evaluación de escritura del NAPLAN. Casi una década después, el comunicado oficial de resultados de ACARA del 27 de marzo de 2026 —que abarca cerca de 4,5 millones de pruebas en línea realizadas por aproximadamente 1,3 millones de estudiantes en más de 9.300 escuelas— señala que las respuestas de escritura siguen tardando sustancialmente más en procesarse y reportarse que los otros tres dominios evaluados, lo que es coherente con la continuidad de la dependencia de evaluadores humanos capacitados.
Se trata de un caso poco frecuente y bien documentado de un sistema educativo que puso a prueba la IA frente a un referente técnico riguroso, la consideró estadísticamente competitiva con los evaluadores humanos, y aun así optó por no implementarla en el nivel de mayor riesgo. El Education Council de Australia priorizó la transparencia, la posibilidad de impugnación y el juicio humano por encima de las ganancias de eficiencia y coste que prometía la automatización.
Where this practice's information was retrieved from, and when.
Estonia
A 2026 peer-reviewed study tested LLM and statistical-NLP grading of Estonia's national school-leaving essay exams across two full cohorts. AI …
South Korea
Seoul-based Riiid Inc. applies deep reinforcement learning to adaptive TOEIC prep: score predicted in 6–10 questions; 2.5 million users (TechCrunch …
Portugal
Portugal's 2026 rollout of digital correction for national secondary exams (81,000+ students) hit widespread login failures, lost and duplicated scripts, …
Australia
Instead of an unwinnable AI-detection arms race, Sydney redesigned assessment into two lanes — secure in-person assessment of core capability, …
Open full copilot Grounded in cited practices — always check the sources.