evidoria

← Retour à la liste

Good practice

L'essai de correction assistée par IA de l'Estonie pour les examens nationaux de fin d'études secondaires

Estonie · Tallinn · Voir le profil de Estonie

Une étude évaluée par les pairs en 2026 a testé la correction par IA (LLM et NLP statistique) des épreuves rédactionnelles des examens nationaux estoniens sur deux cohortes complètes. Les notes de l'IA se situaient dans la fourchette des correcteurs humains dans 60 % des cas, la décision finale restant humaine.

60 %
Notes de l'IA situées dans la fourchette d'accord entre évaluateurs humains (trial cohorts)
L'essai de correction assistée par IA de l'Estonie pour les examens nationaux de fin d'études secondaires

Détails

Maturité
Pilot
Promoteur
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Période
2024–2026 pilot; national e-exam rollout planned from 2027
Mots-clés
national exams, NLP, LLM grading, assessment pilot

Contexte

Le Conseil de l'éducation et de la jeunesse d'Estonie (Harno) numérise les examens de fin d'études du primaire et du secondaire du pays, avec des e-examens entièrement numériques prévus à partir de 2027. En amont de cette transition, Harno a collaboré avec des chercheurs, dont une équipe de l'université de Tallinn, pour tester si les grands modèles de langage et le TAL statistique pouvaient soutenir la correction des épreuves nationales de rédaction en langue maternelle et de fin d'études.

Résultats

L'étude a comparé les notes générées par la machine aux notes officielles d'un jury humain sur deux cohortes nationales complètes de rédactions d'essai, en utilisant la même grille fondée sur le programme que celle utilisée par les correcteurs humains. Dans 60 % des cas, la note du modèle de langage se situait dans la fourchette de variation habituelle entre évaluateurs humains, avec le meilleur accord sur les critères les plus objectifs, comme l'utilisation correcte des textes sources. L'étude a également testé les modèles quant aux biais et aux vulnérabilités d'injection de prompt.

Conclusions

Les règles de l'UE interdisant aux machines de prendre des décisions contraignantes sur les examens des élèves, tout déploiement conserve un évaluateur humain comme décideur final, l'IA étant traitée comme une aide à la décision (par exemple, en signalant l'utilisation des textes sources) plutôt que comme un correcteur de remplacement. Harno examinait encore les résultats finaux au moment du reportage, et des critères subjectifs comme la qualité de l'argumentation restent une appréciation humaine.

Mise en œuvre

Coût indicatif
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Délai jusqu’aux résultats
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Personnel et compétences
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models

Conditions de réussite

  • Use of the same curriculum-based rubric as human graders
  • Explicit testing for bias and prompt-injection vulnerabilities
  • AI positioned as decision support, not a replacement for human judgement

Modes d’échec courants

  • Subjective criteria such as argument quality still require human judgement
  • Final results still under review at time of reporting

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles