evidoria

← Back to browse

Good practice

Ensayo de puntuación automática de redacciones del NAPLAN: la decisión de ACARA, basada en evidencias, de mantener correctores humanos

Australia · Sydney · See the Australia profile

ACARA halló que cuatro sistemas de IA puntuaban redacciones del NAPLAN con fiabilidad comparable a la humana, pero el Consejo de Educación de Australia decidió, en dic. 2017, no usar IA en pruebas nacionales de alto riesgo, citando riesgos de sesgo y opacidad.

1014 essays
Redacciones utilizadas para calibrar los sistemas de calificación por IA (2015)
339 essays
Redacciones utilizadas para probar los sistemas de calificación por IA (2015)
4.5 million tests
Pruebas en línea del NAPLAN completadas (2026)
1.3 million students
Estudiantes que realizaron el NAPLAN (2026)
9300 schools
Escuelas participantes en el NAPLAN (más de) (2026)
Ensayo de puntuación automática de redacciones del NAPLAN: la decisión de ACARA, basada en evidencias, de mantener correctores humanos

Details

Maturity
Discontinued
Promoter
Australian Curriculum, Assessment and Reporting Authority (ACARA)
Period
2015 evaluation; Dec 2017 policy decision; ongoing as of 2026
Keywords
K-12 assessment, standardised testing, automated essay scoring, national exams, education policy

Context

En 2015, la Australian Curriculum, Assessment and Reporting Authority (ACARA) evaluó sistemas de calificación automática de redacciones (AES) de cuatro proveedores — Measurement Incorporated, Pearson, Pacific Metrics y MetaMetrics — frente a textos persuasivos del NAPLAN corregidos por evaluadores humanos. Los sistemas se calibraron con 1.014 redacciones y luego se probaron con otras 339 redacciones. ACARA se había fijado el objetivo de lograr, para 2020, una evaluación de escritura del NAPLAN totalmente automatizada, manteniendo a los evaluadores humanos solo como verificación de respaldo, y esta evaluación se planteó como un paso hacia ese objetivo.

Objectives

La evaluación de ACARA buscaba determinar si los sistemas de calificación por IA podían aproximarse lo suficiente a los evaluadores humanos, tanto en las puntuaciones globales como en los criterios individuales de escritura, para justificar la automatización de la evaluación nacional de escritura del NAPLAN, de alto riesgo. Defensores como el investigador educativo el profesor John Hattie sostuvieron que la calificación automática podría ser mucho más precisa y considerablemente más barata que la calificación humana.

Activities

Los cuatro sistemas de los proveedores fueron evaluados según su concordancia con los evaluadores humanos, tanto en las puntuaciones globales como en los criterios individuales de escritura, utilizando los conjuntos de redacciones de calibración y de prueba. Tras la evaluación técnica, los sindicatos de docentes manifestaron una oposición sostenida, argumentando que los algoritmos de calificación propietarios y no públicos no podían juzgar de forma fiable la creatividad, la ironía o la lógica de un argumento, y suponían un riesgo de sesgo contra determinados grupos de estudiantes. En diciembre de 2017, el Education Council de Australia, el organismo ministerial nacional responsable del NAPLAN, decidió formalmente no utilizar la AES para la evaluación de escritura del NAPLAN, deteniendo el avance hacia la automatización total.

Results

Los cuatro sistemas de calificación automática de redacciones lograron una concordancia con los evaluadores humanos comparable, tanto en las puntuaciones globales como en los criterios individuales de escritura. A pesar de ello, el plan de ACARA para alcanzar la automatización total en 2020 fue abandonado tras la decisión del Education Council de Australia, en diciembre de 2017, en contra del uso de la AES para la evaluación de escritura del NAPLAN. Casi una década después, el comunicado oficial de resultados de ACARA del 27 de marzo de 2026 —que abarca cerca de 4,5 millones de pruebas en línea realizadas por aproximadamente 1,3 millones de estudiantes en más de 9.300 escuelas— señala que las respuestas de escritura siguen tardando sustancialmente más en procesarse y reportarse que los otros tres dominios evaluados, lo que es coherente con la continuidad de la dependencia de evaluadores humanos capacitados.

Conclusions

Se trata de un caso poco frecuente y bien documentado de un sistema educativo que puso a prueba la IA frente a un referente técnico riguroso, la consideró estadísticamente competitiva con los evaluadores humanos, y aun así optó por no implementarla en el nivel de mayor riesgo. El Education Council de Australia priorizó la transparencia, la posibilidad de impugnación y el juicio humano por encima de las ganancias de eficiencia y coste que prometía la automatización.

Implementation

Indicative cost
Medium (€50k–€500k)
Time to results
Long (> 3 years)

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful