Um estudo revisto por pares em 2026 testou a correção de ensaios dos exames finais nacionais da Estónia com LLMs e NLP estatística, em duas coortes nacionais completas. As notas da IA ficaram dentro do intervalo dos avaliadores humanos em 60% dos casos, mantendo-se a decisão final com os avaliadores humanos.
60 %
Notas de IA dentro do intervalo de concordância entre avaliadores humanos (trial cohorts)
Detalhes
Maturidade
Pilot
Promotor
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Período
2024–2026 pilot; national e-exam rollout planned from 2027
Palavras-chave
national exams, NLP, LLM grading, assessment pilot
Contexto
A Direção da Educação e Juventude da Estónia (Harno) está a digitalizar os exames finais do ensino básico e secundário do país, com exames digitais completos previstos a partir de 2027. Antes dessa transição, a Harno trabalhou com investigadores, incluindo uma equipa da Universidade de Tallinn, para testar se grandes modelos de linguagem e PLN estatístico poderiam apoiar a correção dos exames nacionais de redação da língua materna e de fim de ciclo.
Resultados
O estudo comparou as pontuações geradas por máquina com as pontuações oficiais de um painel humano em duas coortes nacionais completas de redações de teste, utilizando a mesma grelha curricular usada pelos corretores humanos. Em 60% dos casos, a pontuação do modelo de linguagem situou-se dentro do intervalo em que os avaliadores humanos variam entre si, com a maior concordância nos critérios mais objetivos, como a utilização correta de textos-fonte. O estudo também testou os modelos quanto a enviesamentos e vulnerabilidades a injeção de prompts.
Conclusões
Como as regras da UE proíbem que máquinas tomem decisões vinculativas sobre exames de estudantes, qualquer implementação mantém um avaliador humano como decisor final, sendo a IA tratada como apoio à decisão (por exemplo, sinalizando a utilização de textos-fonte) e não como substituta do corretor. A Harno ainda estava a analisar os resultados finais no momento da reportagem, e critérios subjetivos como a qualidade do argumento continuam a ser uma decisão humana.
Implementação
Custo indicativo
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Tempo até resultados
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Equipa e competências
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models
Condições de sucesso
Use of the same curriculum-based rubric as human graders
Explicit testing for bias and prompt-injection vulnerabilities
AI positioned as decision support, not a replacement for human judgement
Modos de falha comuns
Subjective criteria such as argument quality still require human judgement
Final results still under review at time of reporting
Fontes de dados
De onde foi obtida a informação desta prática, e quando.