Evaluación 'two-lane' de la Universidad de Sídney para la era de la IA
Australia
En lugar de una carrera armamentista de detección de IA imposible de ganar, Sídney rediseñó la evaluación en dos carriles …
Sudáfrica · Cape Town · Ver el perfil de Sudáfrica
Un equipo liderado por la Universidad de Ciudad del Cabo ajustó modelos de reconocimiento de voz de código abierto para calificar automáticamente la fluidez lectora oral en los primeros grados en xhosa, usando 14.971 grabaciones de alumnos de 1.º a 4.º grado en Sudáfrica, alcanzando cerca del 91% de eficiencia diagnóstica frente a datos etiquetados por humanos.
Las Evaluaciones de Lectura de Grados Iniciales (EGRA) —pruebas orales individuales que detectan qué niños se están quedando atrás— son la herramienta estándar para medir la alfabetización en países de ingresos bajos y medios, pero su aplicación requiere evaluadores humanos capacitados y rara vez se realiza en lenguas africanas distintas de las pocas que ya cuentan con soporte de reconocimiento de voz. Un equipo de investigación liderado por la Universidad de Ciudad del Cabo, junto con la Universidad de Pretoria, Western Sydney University, la Universidade Federal de Pernambuco y Macquarie University, se propuso automatizar la calificación de la EGRA para el xhosa, una de las lenguas oficiales de Sudáfrica.
A lo largo de un esfuerzo de recolección de datos de 8 meses, el equipo reunió 14.971 grabaciones EGRA (más de 19 horas de habla infantil) de alumnos de 1.º a 4.º grado en escuelas sudafricanas, con el apoyo de una beca Grand Challenges de la Fundación Gates. Tres evaluadores humanos independientes validaron primero el enfoque de calificación frente a un experto en EGRA, alcanzando un 85% de concordancia; los modelos de reconocimiento de voz ajustados se compararon después con esos datos etiquetados por humanos, alcanzando cerca del 91% de eficiencia diagnóstica.
La evaluación publicada es inusualmente franca sobre sus límites: los autores señalan que ninguna configuración del modelo minimizó simultáneamente las tasas de falsos positivos y falsos negativos, lo que significa que cualquier despliegue temprano cambiaría un tipo de clasificación errónea por otro. El trabajo sigue siendo una validación en fase de investigación, no un sistema de evaluación nacional en funcionamiento.
Los detalles de implementación (coste, plazo, personal, condiciones para el éxito) aún no están disponibles para esta práctica.
¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
De dónde se obtuvo la información de esta práctica, y cuándo.
Australia
En lugar de una carrera armamentista de detección de IA imposible de ganar, Sídney rediseñó la evaluación en dos carriles …
Reino Unido
Herramienta gratuita de Cambridge UP&A (sept. 2016) que asigna niveles MCER A1–C2 a textos de aprendices de inglés y señala …
Hong Kong
En junio de 2023, el Senado de la HKU nombró a la IA generativa "quinta alfabetizacion" y dio a todos …
Reino Unido
La University of Bedfordshire realizó una evaluación publicada comparando su servicio de escritura Studiosity, con tutores humanos, con una nueva …
Abrir el copiloto completo Basado en prácticas citadas: comprueba siempre las fuentes.