evidoria

← Back to browse

Good practice

O ensaio de correção assistida por IA da Estónia para os exames finais de conclusão do secundário

Estonia · Tallinn · See the Estonia profile

Um estudo revisto por pares em 2026 testou a correção de ensaios dos exames finais nacionais da Estónia com LLMs e NLP estatística, em duas coortes nacionais completas. As notas da IA ficaram dentro do intervalo dos avaliadores humanos em 60% dos casos, mantendo-se a decisão final com os avaliadores humanos.

60 %
Notas de IA dentro do intervalo de concordância entre avaliadores humanos (trial cohorts)
O ensaio de correção assistida por IA da Estónia para os exames finais de conclusão do secundário

Details

Maturity
Pilot
Promoter
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Period
2024–2026 pilot; national e-exam rollout planned from 2027
Keywords
national exams, NLP, LLM grading, assessment pilot

Context

A Direção da Educação e Juventude da Estónia (Harno) está a digitalizar os exames finais do ensino básico e secundário do país, com exames digitais completos previstos a partir de 2027. Antes dessa transição, a Harno trabalhou com investigadores, incluindo uma equipa da Universidade de Tallinn, para testar se grandes modelos de linguagem e PLN estatístico poderiam apoiar a correção dos exames nacionais de redação da língua materna e de fim de ciclo.

Results

O estudo comparou as pontuações geradas por máquina com as pontuações oficiais de um painel humano em duas coortes nacionais completas de redações de teste, utilizando a mesma grelha curricular usada pelos corretores humanos. Em 60% dos casos, a pontuação do modelo de linguagem situou-se dentro do intervalo em que os avaliadores humanos variam entre si, com a maior concordância nos critérios mais objetivos, como a utilização correta de textos-fonte. O estudo também testou os modelos quanto a enviesamentos e vulnerabilidades a injeção de prompts.

Conclusions

Como as regras da UE proíbem que máquinas tomem decisões vinculativas sobre exames de estudantes, qualquer implementação mantém um avaliador humano como decisor final, sendo a IA tratada como apoio à decisão (por exemplo, sinalizando a utilização de textos-fonte) e não como substituta do corretor. A Harno ainda estava a analisar os resultados finais no momento da reportagem, e critérios subjetivos como a qualidade do argumento continuam a ser uma decisão humana.

Implementation

Indicative cost
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Time to results
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Staffing & skills
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models

Conditions for success

  • Use of the same curriculum-based rubric as human graders
  • Explicit testing for bias and prompt-injection vulnerabilities
  • AI positioned as decision support, not a replacement for human judgement

Common failure modes

  • Subjective criteria such as argument quality still require human judgement
  • Final results still under review at time of reporting

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful