evidoria

← Volver al listado

Buena práctica Importada

CoBRA — El Proyecto Piloto de Reconocimiento de Voz con IA de RTI International para la Evaluación de la Lectura Oral en Filipinas

Filipinas · San Fernando (Pampanga) · Ver el perfil de Filipinas

Evidencia: Cuasiexperimental Top 73% 40/100 · Pregunte a Evidence Copilot sobre esta práctica

El piloto de 2022 de RTI (USAID/DepEd) evaluó la puntuación por voz con IA de la fluidez lectora oral en 42 escuelas filipinas. La IA subestimó las palabras por minuto en 21,8 (inglés) y 25,1 (filipino) vs. evaluadores humanos, y el DepEd canceló la ampliación.

1,063 Grades 4-6
Alumnos evaluados, inglés (Jun-Jul 2022)
933 Grades 4-6
Alumnos evaluados, filipino (Jun-Jul 2022)
21.8 avg words, vs human regraders
Subestimación por la IA de las palabras correctas por minuto, inglés
60%
Texto marcado/omitido incorrectamente, filipino
CoBRA — El Proyecto Piloto de Reconocimiento de Voz con IA de RTI International para la Evaluación de la Lectura Oral en Filipinas

Detalles

Madurez
Descontinuada
Promotor
RTI International; USAID All Children Reading (ACR)–Philippines; Philippines Department of Education (DepEd)
Período
February–November 2022 (development Feb–Apr; pilot Jun–Jul; final report Nov 2022)
Palabras clave
primary education, reading assessment, speech recognition, EdTech evaluation

Contexto

CoBRA (Computer-Based Reading Assessment) fue una herramienta piloto del programa All Children Reading de USAID en Filipinas, que combinaba un complemento de grabación de voz, el Speech Recognition Engine de Google para filipino y un algoritmo de puntuación basado en aprendizaje automático para calcular las palabras correctas por minuto y la precisión lectora a partir de las grabaciones de lectura oral de los alumnos, tomando como referencia el estándar Phil-IRI. RTI International la desarrolló entre febrero y abril de 2022 y la probó en fase piloto con el DepEd entre junio y julio de 2022, en 42 escuelas.

Objetivos

Comprobar si la puntuación mediante reconocimiento de voz basado en IA podía sustituir a la evaluación humana de la fluidez lectora oral en inglés y filipino, a escala nacional.

Actividades

El proyecto piloto evaluó a 1063 alumnos en inglés y 933 en filipino, de 4.º a 6.º curso, y formó u orientó a 145 docentes y 67 coordinadores de TIC. El informe final de RTI (presentado en noviembre de 2022) realizó un análisis de validez concurrente, recalificando de forma independiente y manual una submuestra de 346 evaluaciones en inglés y 345 en filipino, y comparándolas con las puntuaciones de la IA.

Resultados

La IA subestimó las palabras correctas por minuto en una media de 21,8 en inglés y 25,1 en filipino con respecto a los recalificadores humanos, y marcó incorrectamente u omitió el 21% del texto en inglés y el 60% del texto en filipino que los alumnos realmente leyeron. La varianza de las puntuaciones por curso entre la IA y la evaluación humana osciló entre el 31-48% en inglés y el 37-64% en filipino, empeorando a medida que los pasajes se volvían más complejos. Más del 90% de los 81 docentes encuestados consideraron la herramienta fácil de administrar y percibieron que la puntuación era 'generalmente precisa', una percepción que los datos cuantitativos de validez no respaldaron.

Conclusiones

El proyecto piloto de segunda fase, de mayor envergadura, previsto por el DepEd fue cancelado, atribuido oficialmente a una reorganización institucional y a unos costes de licencia insostenibles; el propio informe de RTI concluyó que la puntuación por IA 'no es lo bastante precisa ni fiable como para utilizarse como medio independiente de medir las competencias de fluidez lectora oral de los alumnos'. La práctica está catalogada como un hallazgo negativo evaluado con rigor y reportado con honestidad.

Implementación

Coste indicativo
Medio (50 000–500 000 €)
Tiempo hasta resultados
Corto (< 1 año)
Personal y competencias
RTI International development and evaluation team, 145 trained teachers and 67 ICT coordinators (DepEd)

Condiciones para el éxito

  • Benchmarking against an established national reading-assessment standard (Phil-IRI)
  • Independent human re-grading of a representative subsample for validity testing

Modos de fallo comunes

  • Substantial undercounting and misflagging of text vs human graders
  • Teacher perception of accuracy not supported by the quantitative validity data
  • Second-phase pilot cancelled due to reorganisation and unsustainable licensing costs

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles