evidoria

← Voltar à navegação

Good practice

O ensaio de correção assistida por IA da Estónia para os exames finais de conclusão do secundário

Estónia · Tallinn · Ver o perfil de Estónia

Um estudo revisto por pares em 2026 testou a correção de ensaios dos exames finais nacionais da Estónia com LLMs e NLP estatística, em duas coortes nacionais completas. As notas da IA ficaram dentro do intervalo dos avaliadores humanos em 60% dos casos, mantendo-se a decisão final com os avaliadores humanos.

60 %
Notas de IA dentro do intervalo de concordância entre avaliadores humanos (trial cohorts)
O ensaio de correção assistida por IA da Estónia para os exames finais de conclusão do secundário

Detalhes

Maturidade
Pilot
Promotor
Estonian Education and Youth Board (Harno), with Tallinn University researchers
Período
2024–2026 pilot; national e-exam rollout planned from 2027
Palavras-chave
national exams, NLP, LLM grading, assessment pilot

Contexto

A Direção da Educação e Juventude da Estónia (Harno) está a digitalizar os exames finais do ensino básico e secundário do país, com exames digitais completos previstos a partir de 2027. Antes dessa transição, a Harno trabalhou com investigadores, incluindo uma equipa da Universidade de Tallinn, para testar se grandes modelos de linguagem e PLN estatístico poderiam apoiar a correção dos exames nacionais de redação da língua materna e de fim de ciclo.

Resultados

O estudo comparou as pontuações geradas por máquina com as pontuações oficiais de um painel humano em duas coortes nacionais completas de redações de teste, utilizando a mesma grelha curricular usada pelos corretores humanos. Em 60% dos casos, a pontuação do modelo de linguagem situou-se dentro do intervalo em que os avaliadores humanos variam entre si, com a maior concordância nos critérios mais objetivos, como a utilização correta de textos-fonte. O estudo também testou os modelos quanto a enviesamentos e vulnerabilidades a injeção de prompts.

Conclusões

Como as regras da UE proíbem que máquinas tomem decisões vinculativas sobre exames de estudantes, qualquer implementação mantém um avaliador humano como decisor final, sendo a IA tratada como apoio à decisão (por exemplo, sinalizando a utilização de textos-fonte) e não como substituta do corretor. A Harno ainda estava a analisar os resultados finais no momento da reportagem, e critérios subjetivos como a qualidade do argumento continuam a ser uma decisão humana.

Implementação

Custo indicativo
Medium (€50k–€500k) — No public budget figure found; cost_band set to medium, reflecting a national government research collaboration building toward system-wide digital exams.
Tempo até resultados
Medium (1–3 years) — Pilot ran 2024–2026 with full e-exam rollout planned from 2027; timeline_band set to medium.
Equipa e competências
Human assessors remain the final decision-makers, as required by EU rules, Tallinn University researchers built and tested the models

Condições de sucesso

  • Use of the same curriculum-based rubric as human graders
  • Explicit testing for bias and prompt-injection vulnerabilities
  • AI positioned as decision support, not a replacement for human judgement

Modos de falha comuns

  • Subjective criteria such as argument quality still require human judgement
  • Final results still under review at time of reporting

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis