evidoria

← Volver al listado

Good practice

El ensayo de corrección asistida por IA de Estonia para los exámenes nacionales de fin de secundaria

Estonia · Tallinn · Ver el perfil de Estonia

Un estudio revisado por pares en 2026 probó la corrección con LLM y PLN estadístico de los ensayos de los exámenes nacionales de fin de secundaria de Estonia, en dos cohortes nacionales completas. Las notas de la IA quedaron dentro del rango de los evaluadores humanos en el 60% de los casos, manteniéndose la decisión final en manos humanas.

60 %
Notas de la IA dentro del rango de concordancia entre evaluadores humanos (trial cohorts)
El ensayo de corrección asistida por IA de Estonia para los exámenes nacionales de fin de secundaria

Detalles

Madurez
Pilot
Promotor
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Período
2024–2026 pilot; national e-exam rollout planned from 2027
Palabras clave
national exams, NLP, LLM grading, assessment pilot

Contexto

La Junta de Educación y Juventud de Estonia (Harno) está digitalizando los exámenes finales de primaria y secundaria del país, con exámenes digitales completos previstos a partir de 2027. Antes de ese cambio, Harno colaboró con investigadores, incluido un equipo de la Universidad de Tallin, para probar si los grandes modelos de lenguaje y el PLN estadístico podían apoyar la corrección de los exámenes nacionales de redacción en lengua materna y de fin de estudios.

Resultados

El estudio comparó las puntuaciones generadas por máquina con las puntuaciones oficiales de un panel humano en dos cohortes nacionales completas de redacciones de prueba, utilizando la misma rúbrica curricular empleada por los correctores humanos. En el 60% de los casos, la puntuación del modelo de lenguaje se situó dentro del rango en que varían entre sí los evaluadores humanos, con la mayor concordancia en los criterios más objetivos, como el uso correcto de los textos fuente. El estudio también evaluó los modelos en cuanto a sesgos y vulnerabilidades de inyección de instrucciones.

Conclusiones

Dado que las normas de la UE prohíben que las máquinas tomen decisiones vinculantes sobre los exámenes de los estudiantes, cualquier implementación mantiene a un evaluador humano como responsable de la decisión final, tratando la IA como apoyo a la decisión (por ejemplo, señalando el uso de textos fuente) en lugar de como sustituto del corrector. Harno todavía estaba revisando los resultados finales en el momento de la publicación, y criterios subjetivos como la calidad argumentativa siguen siendo una decisión humana.

Implementación

Coste indicativo
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Tiempo hasta resultados
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Personal y competencias
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models

Condiciones para el éxito

  • Use of the same curriculum-based rubric as human graders
  • Explicit testing for bias and prompt-injection vulnerabilities
  • AI positioned as decision support, not a replacement for human judgement

Modos de fallo comunes

  • Subjective criteria such as argument quality still require human judgement
  • Final results still under review at time of reporting

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles