evidoria

← Retour à la liste

Bonne pratique Importée

CoBRA — Le Projet Pilote de Reconnaissance Vocale par IA de RTI International pour l'Évaluation de la Lecture Orale aux Philippines

Philippines · San Fernando (Pampanga) · Voir le profil de Philippines

Preuves: Quasi expérimental Top 73% 40/100 · Demandez à Evidence Copilot à propos de cette pratique

Le pilote 2022 de RTI (USAID/DepEd) a testé la notation vocale par IA de la fluidité de lecture orale dans 42 écoles philippines. L'IA sous-estimait les mots/minute de 21,8 (anglais) et 25,1 (filipino) vs correcteurs humains ; le DepEd a annulé le déploiement.

1,063 Grades 4-6
Élèves testés, anglais (Jun-Jul 2022)
933 Grades 4-6
Élèves testés, filipino (Jun-Jul 2022)
21.8 avg words, vs human regraders
Sous-estimation par l'IA du nombre de mots corrects par minute, anglais
60%
Texte signalé/omis à tort, filipino
CoBRA — Le Projet Pilote de Reconnaissance Vocale par IA de RTI International pour l'Évaluation de la Lecture Orale aux Philippines

Détails

Maturité
Abandonnée
Promoteur
RTI International; USAID All Children Reading (ACR)–Philippines; Philippines Department of Education (DepEd)
Période
February–November 2022 (development Feb–Apr; pilot Jun–Jul; final report Nov 2022)
Mots-clés
primary education, reading assessment, speech recognition, EdTech evaluation

Contexte

CoBRA (Computer-Based Reading Assessment) était un outil pilote du programme All Children Reading de l'USAID aux Philippines, combinant un module d'enregistrement vocal, le Speech Recognition Engine de Google pour le filipino et un algorithme de notation basé sur l'apprentissage automatique pour calculer le nombre de mots corrects par minute et la précision de lecture à partir des enregistrements de lecture orale des élèves, en référence à la norme Phil-IRI. RTI International l'a développé de février à avril 2022 et l'a testé en projet pilote avec le DepEd de juin à juillet 2022, dans 42 écoles.

Objectifs

Tester si la notation par reconnaissance vocale basée sur l'IA pouvait remplacer l'évaluation humaine de la fluidité de lecture orale en anglais et en filipino, à l'échelle nationale.

Activités

Le projet pilote a testé 1063 élèves en anglais et 933 en filipino, de la 4e à la 6e année, et a formé ou sensibilisé 145 enseignants et 67 coordinateurs TIC. Le rapport final de RTI (soumis en novembre 2022) a mené une analyse de validité concourante, en réévaluant de manière indépendante et manuelle un sous-échantillon de 346 évaluations en anglais et 345 en filipino, puis en les comparant aux scores de l'IA.

Résultats

L'IA a sous-estimé le nombre de mots corrects par minute de 21,8 en moyenne en anglais et de 25,1 en filipino par rapport aux réévaluateurs humains, et a signalé ou omis à tort 21 % du texte anglais et 60 % du texte filipino réellement lu par les élèves. L'écart de notation entre l'IA et l'évaluation humaine, selon le niveau scolaire, variait de 31 à 48 % en anglais et de 37 à 64 % en filipino, s'aggravant à mesure que les passages devenaient plus complexes. Plus de 90 % des 81 enseignants interrogés ont jugé l'outil facile à utiliser et ont estimé que la notation était 'globalement fiable' -- une perception que les données quantitatives de validité ne confirmaient pas.

Conclusions

Le projet pilote de deuxième phase, plus vaste, prévu par le DepEd a été annulé, officiellement en raison d'une réorganisation institutionnelle et de coûts de licence insoutenables ; le rapport de RTI lui-même a conclu que la notation par IA 'n'est pas suffisamment précise ni fiable pour être utilisée comme moyen indépendant de mesurer les compétences de fluidité de lecture orale des élèves'. Cette pratique est cataloguée comme un résultat négatif rigoureusement évalué et rapporté en toute honnêteté.

Mise en œuvre

Coût indicatif
Moyen (50 k€–500 k€)
Délai jusqu’aux résultats
Court (< 1 an)
Personnel et compétences
RTI International development and evaluation team, 145 trained teachers and 67 ICT coordinators (DepEd)

Conditions de réussite

  • Benchmarking against an established national reading-assessment standard (Phil-IRI)
  • Independent human re-grading of a representative subsample for validity testing

Modes d’échec courants

  • Substantial undercounting and misflagging of text vs human graders
  • Teacher perception of accuracy not supported by the quantitative validity data
  • Second-phase pilot cancelled due to reorganisation and unsustainable licensing costs

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles