evidoria

← Back to browse

Good practice

El ensayo de corrección asistida por IA de Estonia para los exámenes nacionales de fin de secundaria

Estonia · Tallinn · See the Estonia profile

Un estudio revisado por pares en 2026 probó la corrección con LLM y PLN estadístico de los ensayos de los exámenes nacionales de fin de secundaria de Estonia, en dos cohortes nacionales completas. Las notas de la IA quedaron dentro del rango de los evaluadores humanos en el 60% de los casos, manteniéndose la decisión final en manos humanas.

60 %
Notas de la IA dentro del rango de concordancia entre evaluadores humanos (trial cohorts)
El ensayo de corrección asistida por IA de Estonia para los exámenes nacionales de fin de secundaria

Details

Maturity
Pilot
Promoter
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Period
2024–2026 pilot; national e-exam rollout planned from 2027
Keywords
national exams, NLP, LLM grading, assessment pilot

Context

La Junta de Educación y Juventud de Estonia (Harno) está digitalizando los exámenes finales de primaria y secundaria del país, con exámenes digitales completos previstos a partir de 2027. Antes de ese cambio, Harno colaboró con investigadores, incluido un equipo de la Universidad de Tallin, para probar si los grandes modelos de lenguaje y el PLN estadístico podían apoyar la corrección de los exámenes nacionales de redacción en lengua materna y de fin de estudios.

Results

El estudio comparó las puntuaciones generadas por máquina con las puntuaciones oficiales de un panel humano en dos cohortes nacionales completas de redacciones de prueba, utilizando la misma rúbrica curricular empleada por los correctores humanos. En el 60% de los casos, la puntuación del modelo de lenguaje se situó dentro del rango en que varían entre sí los evaluadores humanos, con la mayor concordancia en los criterios más objetivos, como el uso correcto de los textos fuente. El estudio también evaluó los modelos en cuanto a sesgos y vulnerabilidades de inyección de instrucciones.

Conclusions

Dado que las normas de la UE prohíben que las máquinas tomen decisiones vinculantes sobre los exámenes de los estudiantes, cualquier implementación mantiene a un evaluador humano como responsable de la decisión final, tratando la IA como apoyo a la decisión (por ejemplo, señalando el uso de textos fuente) en lugar de como sustituto del corrector. Harno todavía estaba revisando los resultados finales en el momento de la publicación, y criterios subjetivos como la calidad argumentativa siguen siendo una decisión humana.

Implementation

Indicative cost
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Time to results
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Staffing & skills
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models

Conditions for success

  • Use of the same curriculum-based rubric as human graders
  • Explicit testing for bias and prompt-injection vulnerabilities
  • AI positioned as decision support, not a replacement for human judgement

Common failure modes

  • Subjective criteria such as argument quality still require human judgement
  • Final results still under review at time of reporting

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful