Estonia's AI-Assisted Grading Trial for National School-Leaving Essay Exams
Estonia
A 2026 peer-reviewed study tested LLM and statistical-NLP grading of Estonia's national school-leaving essay exams across two full cohorts. AI …
Australia · Sydney · See the Australia profile
L'ACARA a constaté que quatre systèmes d'IA notaient les rédactions du NAPLAN aussi fiablement que des correcteurs humains, mais l'Éducation Council australien a refusé, en déc. 2017, l'IA pour les tests nationaux à enjeux élevés, invoquant biais et opacité.
En 2015, l'Australian Curriculum, Assessment and Reporting Authority (ACARA) a évalué des systèmes de notation automatique des rédactions (AES) provenant de quatre fournisseurs — Measurement Incorporated, Pearson, Pacific Metrics et MetaMetrics — en les comparant à des textes argumentatifs du NAPLAN notés par des correcteurs humains. Les systèmes ont été calibrés sur 1 014 rédactions, puis testés sur 339 rédactions supplémentaires. L'ACARA visait une évaluation de l'écriture du NAPLAN entièrement automatisée d'ici 2020, les correcteurs humains n'étant conservés que comme vérification de secours, cette évaluation constituant une étape vers cet objectif.
L'évaluation de l'ACARA visait à déterminer si les systèmes de notation par IA pouvaient se rapprocher suffisamment des correcteurs humains, tant sur les scores globaux que sur les critères d'écriture individuels, pour justifier l'automatisation de l'évaluation nationale de l'écriture du NAPLAN, à enjeux élevés. Des défenseurs, comme le chercheur en éducation le professeur John Hattie, ont soutenu que la notation automatique pourrait être bien plus précise et nettement moins coûteuse que la notation humaine.
Les quatre systèmes des fournisseurs ont été évalués sur leur concordance avec les correcteurs humains, tant sur les scores globaux que sur les critères d'écriture individuels, à partir des ensembles de rédactions de calibration et de test. Après l'évaluation technique, les syndicats d'enseignants se sont opposés de manière soutenue, estimant que des algorithmes de notation propriétaires et non publics ne pouvaient pas juger de façon fiable la créativité, l'ironie ou la logique d'un argument, et présentaient un risque de biais envers certains groupes d'élèves. En décembre 2017, l'Education Council d'Australie, l'organe ministériel national supervisant le NAPLAN, a formellement décidé de ne pas utiliser l'AES pour l'évaluation de l'écriture du NAPLAN, mettant un terme à la trajectoire vers une automatisation complète.
Les quatre systèmes de notation automatique des rédactions ont obtenu une concordance avec les correcteurs humains comparable, tant sur les scores globaux que sur les critères d'écriture individuels. Malgré cela, le projet de l'ACARA d'atteindre une automatisation complète d'ici 2020 a été abandonné après la décision de l'Education Council d'Australie, en décembre 2017, contre l'utilisation de l'AES pour l'évaluation de l'écriture du NAPLAN. Près d'une décennie plus tard, le communiqué officiel de résultats de l'ACARA du 27 mars 2026 — portant sur environ 4,5 millions de tests en ligne passés par environ 1,3 million d'élèves dans plus de 9 300 écoles — indique que les réponses d'écriture continuent de prendre nettement plus de temps à traiter et à restituer que les trois autres domaines testés, ce qui est cohérent avec le maintien du recours à des correcteurs humains formés.
Il s'agit d'un cas rare et bien documenté d'un système éducatif ayant testé l'IA face à une référence technique rigoureuse, l'ayant jugée statistiquement compétitive par rapport aux correcteurs humains, et ayant malgré tout choisi de ne pas la déployer au niveau le plus critique. L'Education Council d'Australie a privilégié la transparence, la contestabilité et le jugement humain plutôt que les gains d'efficacité et de coût promis par l'automatisation.
Where this practice's information was retrieved from, and when.
Estonia
A 2026 peer-reviewed study tested LLM and statistical-NLP grading of Estonia's national school-leaving essay exams across two full cohorts. AI …
South Korea
Seoul-based Riiid Inc. applies deep reinforcement learning to adaptive TOEIC prep: score predicted in 6–10 questions; 2.5 million users (TechCrunch …
Portugal
Portugal's 2026 rollout of digital correction for national secondary exams (81,000+ students) hit widespread login failures, lost and duplicated scripts, …
Australia
Instead of an unwinnable AI-detection arms race, Sydney redesigned assessment into two lanes — secure in-person assessment of core capability, …
Open full copilot Grounded in cited practices — always check the sources.