iFLYTEK — Evaluación por IA del inglés oral en los exámenes escolares de China
China
La IA de reconocimiento de voz de iFLYTEK evalúa el inglés oral en los exámenes zhongkao y gaokao de China, …
Filipinas · San Fernando (Pampanga) · Ver el perfil de Filipinas
Evidencia: Cuasiexperimental Top 73% 40/100 · Pregunte a Evidence Copilot sobre esta práctica
El piloto de 2022 de RTI (USAID/DepEd) evaluó la puntuación por voz con IA de la fluidez lectora oral en 42 escuelas filipinas. La IA subestimó las palabras por minuto en 21,8 (inglés) y 25,1 (filipino) vs. evaluadores humanos, y el DepEd canceló la ampliación.
CoBRA (Computer-Based Reading Assessment) fue una herramienta piloto del programa All Children Reading de USAID en Filipinas, que combinaba un complemento de grabación de voz, el Speech Recognition Engine de Google para filipino y un algoritmo de puntuación basado en aprendizaje automático para calcular las palabras correctas por minuto y la precisión lectora a partir de las grabaciones de lectura oral de los alumnos, tomando como referencia el estándar Phil-IRI. RTI International la desarrolló entre febrero y abril de 2022 y la probó en fase piloto con el DepEd entre junio y julio de 2022, en 42 escuelas.
Comprobar si la puntuación mediante reconocimiento de voz basado en IA podía sustituir a la evaluación humana de la fluidez lectora oral en inglés y filipino, a escala nacional.
El proyecto piloto evaluó a 1063 alumnos en inglés y 933 en filipino, de 4.º a 6.º curso, y formó u orientó a 145 docentes y 67 coordinadores de TIC. El informe final de RTI (presentado en noviembre de 2022) realizó un análisis de validez concurrente, recalificando de forma independiente y manual una submuestra de 346 evaluaciones en inglés y 345 en filipino, y comparándolas con las puntuaciones de la IA.
La IA subestimó las palabras correctas por minuto en una media de 21,8 en inglés y 25,1 en filipino con respecto a los recalificadores humanos, y marcó incorrectamente u omitió el 21% del texto en inglés y el 60% del texto en filipino que los alumnos realmente leyeron. La varianza de las puntuaciones por curso entre la IA y la evaluación humana osciló entre el 31-48% en inglés y el 37-64% en filipino, empeorando a medida que los pasajes se volvían más complejos. Más del 90% de los 81 docentes encuestados consideraron la herramienta fácil de administrar y percibieron que la puntuación era 'generalmente precisa', una percepción que los datos cuantitativos de validez no respaldaron.
El proyecto piloto de segunda fase, de mayor envergadura, previsto por el DepEd fue cancelado, atribuido oficialmente a una reorganización institucional y a unos costes de licencia insostenibles; el propio informe de RTI concluyó que la puntuación por IA 'no es lo bastante precisa ni fiable como para utilizarse como medio independiente de medir las competencias de fluidez lectora oral de los alumnos'. La práctica está catalogada como un hallazgo negativo evaluado con rigor y reportado con honestidad.
¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
De dónde se obtuvo la información de esta práctica, y cuándo.
China
La IA de reconocimiento de voz de iFLYTEK evalúa el inglés oral en los exámenes zhongkao y gaokao de China, …
Estados Unidos
Nuevo México exige la prueba de lectura por voz con IA de Amira a todo el alumnado de infantil a …
Australia
En lugar de una carrera armamentista de detección de IA imposible de ganar, Sídney rediseñó la evaluación en dos carriles …
Croacia
El proyecto BrAIn de CARNET, financiado por el FSE+, puso a prueba el primer currículo de IA de Croacia en …
Abrir el copiloto completo Basado en prácticas citadas: comprueba siempre las fuentes.