Évaluation 'two-lane' de l'Université de Sydney pour l'ère de l'IA
Australie
Au lieu d'une course aux armements IA-détection qu'on ne peut pas gagner, Sydney a restructuré l'évaluation en deux voies — …
Afrique du Sud · Cape Town · Voir le profil de Afrique du Sud
Une équipe dirigée par l'université du Cap a affiné des modèles de reconnaissance vocale open source pour noter automatiquement la fluidité de lecture orale des petites classes en xhosa, à partir de 14 971 enregistrements d'élèves de la 1re à la 4e année en Afrique du Sud, atteignant environ 91 % d'efficacité diagnostique par rapport aux données annotées par des humains.
Les évaluations de lecture des premières années (EGRA) — des tests oraux individuels qui signalent les enfants prenant du retard — sont l'outil standard pour mesurer l'alphabétisation dans les pays à revenu faible ou intermédiaire, mais leur administration nécessite des évaluateurs humains formés et se fait rarement dans des langues africaines autres que celles déjà prises en charge par la reconnaissance vocale. Une équipe de recherche dirigée par l'université du Cap, avec l'université de Pretoria, la Western Sydney University, l'Universidade Federal de Pernambuco et la Macquarie University, a entrepris d'automatiser la notation EGRA pour le xhosa, l'une des langues officielles d'Afrique du Sud.
Au cours d'un effort de collecte de données de 8 mois, l'équipe a rassemblé 14 971 enregistrements EGRA (plus de 19 heures de parole d'enfants) auprès d'élèves de la 1re à la 4e année dans des écoles sud-africaines, avec le soutien d'une subvention Grand Challenges de la Fondation Gates. Trois évaluateurs humains indépendants ont d'abord validé l'approche de notation par rapport à un expert EGRA, atteignant 85 % d'accord ; les modèles de reconnaissance vocale affinés ont ensuite été comparés à ces données annotées par des humains, atteignant environ 91 % d'efficacité diagnostique.
L'évaluation publiée est particulièrement franche sur ses limites : les auteurs notent qu'aucune configuration de modèle n'a minimisé simultanément les taux de faux positifs et de faux négatifs, ce qui signifie que tout déploiement précoce échangerait un type d'erreur de classification contre un autre. Ce travail reste une validation au stade de la recherche, et non un système d'évaluation national déployé.
Les détails de mise en œuvre (coût, calendrier, personnel, conditions de réussite) ne sont pas encore disponibles pour cette pratique.
Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.
D'où proviennent les informations de cette pratique, et quand.
Australie
Au lieu d'une course aux armements IA-détection qu'on ne peut pas gagner, Sydney a restructuré l'évaluation en deux voies — …
Royaume-Uni
Outil gratuit de Cambridge UP&A (sept. 2016) attribuant des niveaux CECRL A1–C2 aux textes d'apprenants et signalant les erreurs ; …
Hong Kong
En juin 2023, le Sénat de HKU a désigné l'IA générative « cinquième littératie » et offert à tous un …
Royaume-Uni
L'Université de Bedfordshire a mené une évaluation publiée comparant son service d'écriture Studiosity, avec tuteurs humains, à une nouvelle version …
Ouvrir le copilote complet Fondé sur des pratiques citées — vérifiez toujours les sources.