evidoria

← Back to browse

Good practice

L'essai de correction assistée par IA de l'Estonie pour les examens nationaux de fin d'études secondaires

Estonia · Tallinn · See the Estonia profile

Une étude évaluée par les pairs en 2026 a testé la correction par IA (LLM et NLP statistique) des épreuves rédactionnelles des examens nationaux estoniens sur deux cohortes complètes. Les notes de l'IA se situaient dans la fourchette des correcteurs humains dans 60 % des cas, la décision finale restant humaine.

60 %
Notes de l'IA situées dans la fourchette d'accord entre évaluateurs humains (trial cohorts)
L'essai de correction assistée par IA de l'Estonie pour les examens nationaux de fin d'études secondaires

Details

Maturity
Pilot
Promoter
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Period
2024–2026 pilot; national e-exam rollout planned from 2027
Keywords
national exams, NLP, LLM grading, assessment pilot

Context

Le Conseil de l'éducation et de la jeunesse d'Estonie (Harno) numérise les examens de fin d'études du primaire et du secondaire du pays, avec des e-examens entièrement numériques prévus à partir de 2027. En amont de cette transition, Harno a collaboré avec des chercheurs, dont une équipe de l'université de Tallinn, pour tester si les grands modèles de langage et le TAL statistique pouvaient soutenir la correction des épreuves nationales de rédaction en langue maternelle et de fin d'études.

Results

L'étude a comparé les notes générées par la machine aux notes officielles d'un jury humain sur deux cohortes nationales complètes de rédactions d'essai, en utilisant la même grille fondée sur le programme que celle utilisée par les correcteurs humains. Dans 60 % des cas, la note du modèle de langage se situait dans la fourchette de variation habituelle entre évaluateurs humains, avec le meilleur accord sur les critères les plus objectifs, comme l'utilisation correcte des textes sources. L'étude a également testé les modèles quant aux biais et aux vulnérabilités d'injection de prompt.

Conclusions

Les règles de l'UE interdisant aux machines de prendre des décisions contraignantes sur les examens des élèves, tout déploiement conserve un évaluateur humain comme décideur final, l'IA étant traitée comme une aide à la décision (par exemple, en signalant l'utilisation des textes sources) plutôt que comme un correcteur de remplacement. Harno examinait encore les résultats finaux au moment du reportage, et des critères subjectifs comme la qualité de l'argumentation restent une appréciation humaine.

Implementation

Indicative cost
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Time to results
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Staffing & skills
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models

Conditions for success

  • Use of the same curriculum-based rubric as human graders
  • Explicit testing for bias and prompt-injection vulnerabilities
  • AI positioned as decision support, not a replacement for human judgement

Common failure modes

  • Subjective criteria such as argument quality still require human judgement
  • Final results still under review at time of reporting

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful