El ensayo de corrección asistida por IA de Estonia para los exámenes nacionales de fin de secundaria
Estonia
Un estudio revisado por pares en 2026 probó la corrección con LLM y PLN estadístico de los ensayos de los …
Australia · Sydney · Ver el perfil de Australia
ACARA halló que cuatro sistemas de IA puntuaban redacciones del NAPLAN con fiabilidad comparable a la humana, pero el Consejo de Educación de Australia decidió, en dic. 2017, no usar IA en pruebas nacionales de alto riesgo, citando riesgos de sesgo y opacidad.
En 2015, la Australian Curriculum, Assessment and Reporting Authority (ACARA) evaluó sistemas de calificación automática de redacciones (AES) de cuatro proveedores — Measurement Incorporated, Pearson, Pacific Metrics y MetaMetrics — frente a textos persuasivos del NAPLAN corregidos por evaluadores humanos. Los sistemas se calibraron con 1.014 redacciones y luego se probaron con otras 339 redacciones. ACARA se había fijado el objetivo de lograr, para 2020, una evaluación de escritura del NAPLAN totalmente automatizada, manteniendo a los evaluadores humanos solo como verificación de respaldo, y esta evaluación se planteó como un paso hacia ese objetivo.
La evaluación de ACARA buscaba determinar si los sistemas de calificación por IA podían aproximarse lo suficiente a los evaluadores humanos, tanto en las puntuaciones globales como en los criterios individuales de escritura, para justificar la automatización de la evaluación nacional de escritura del NAPLAN, de alto riesgo. Defensores como el investigador educativo el profesor John Hattie sostuvieron que la calificación automática podría ser mucho más precisa y considerablemente más barata que la calificación humana.
Los cuatro sistemas de los proveedores fueron evaluados según su concordancia con los evaluadores humanos, tanto en las puntuaciones globales como en los criterios individuales de escritura, utilizando los conjuntos de redacciones de calibración y de prueba. Tras la evaluación técnica, los sindicatos de docentes manifestaron una oposición sostenida, argumentando que los algoritmos de calificación propietarios y no públicos no podían juzgar de forma fiable la creatividad, la ironía o la lógica de un argumento, y suponían un riesgo de sesgo contra determinados grupos de estudiantes. En diciembre de 2017, el Education Council de Australia, el organismo ministerial nacional responsable del NAPLAN, decidió formalmente no utilizar la AES para la evaluación de escritura del NAPLAN, deteniendo el avance hacia la automatización total.
Los cuatro sistemas de calificación automática de redacciones lograron una concordancia con los evaluadores humanos comparable, tanto en las puntuaciones globales como en los criterios individuales de escritura. A pesar de ello, el plan de ACARA para alcanzar la automatización total en 2020 fue abandonado tras la decisión del Education Council de Australia, en diciembre de 2017, en contra del uso de la AES para la evaluación de escritura del NAPLAN. Casi una década después, el comunicado oficial de resultados de ACARA del 27 de marzo de 2026 —que abarca cerca de 4,5 millones de pruebas en línea realizadas por aproximadamente 1,3 millones de estudiantes en más de 9.300 escuelas— señala que las respuestas de escritura siguen tardando sustancialmente más en procesarse y reportarse que los otros tres dominios evaluados, lo que es coherente con la continuidad de la dependencia de evaluadores humanos capacitados.
Se trata de un caso poco frecuente y bien documentado de un sistema educativo que puso a prueba la IA frente a un referente técnico riguroso, la consideró estadísticamente competitiva con los evaluadores humanos, y aun así optó por no implementarla en el nivel de mayor riesgo. El Education Council de Australia priorizó la transparencia, la posibilidad de impugnación y el juicio humano por encima de las ganancias de eficiencia y coste que prometía la automatización.
De dónde se obtuvo la información de esta práctica, y cuándo.
Estonia
Un estudio revisado por pares en 2026 probó la corrección con LLM y PLN estadístico de los ensayos de los …
Corea del Sur
Riiid Inc. (Seúl) aplica aprendizaje por refuerzo profundo al TOEIC: puntaje predicho en 6–10 preguntas; 2,5 millones de usuarios (TechCrunch …
Portugal
El despliegue en 2026 de la corrección digital de los exámenes nacionales de secundaria en Portugal (más de 81.000 estudiantes) …
Australia
En lugar de una carrera armamentista de detección de IA imposible de ganar, Sídney rediseñó la evaluación en dos carriles …
Abrir el copiloto completo Basado en prácticas citadas: comprueba siempre las fuentes.