evidoria

← Retour à la liste

Bonne pratique Importée

L'outil de présélection par apprentissage automatique de la NYU Grossman School of Medicine pour les candidatures en médecine

États-Unis d'Amérique · New York · Voir le profil de États-Unis d'Amérique · Voir le profil de New York

Preuves: Essai contrôlé randomisé Top 77% 40/100 · Demandez à Evidence Copilot à propos de cette pratique

La NYU Grossman a entraîné un outil d'apprentissage automatique sur 14 555 candidatures passées afin de repérer les candidats à convoquer en entretien ; un essai randomisé de 2019 portant sur 3 700 candidatures a montré que ses recommandations étaient statistiquement indissociables de celles des évaluateurs humains dans l'ensemble, mais qu'il recommandait les candidats économiquement défavorisés pour un entretien à un taux significativement inférieur à celui des évaluateurs (P=,048).

14,555
Candidatures utilisées pour entraîner le modèle (2013–2017)
6,000+ hours/year
Heures de tri du corps enseignant auparavant nécessaires par an
2,910
Candidatures en validation rétrospective
2,715
Candidatures en validation prospective (cycle 2018) (2018)
3,700
Candidatures dans l'essai randomisé (cycle 2019) (2019)
61/65 vs 70/71 (P=.14)
Candidats sous-représentés en médecine recommandés (algorithme vs corps enseignant)
220/227 vs 224/229 (P=.55)
Candidates recommandées (algorithme vs corps enseignant)
25/156 vs 44/178 (P=.048)
Candidats économiquement défavorisés recommandés (algorithme vs corps enseignant)

Détails

Maturité
Établie
Promoteur
NYU Grossman School of Medicine
Période
2013–2019
Mots-clés
admissions, higher education administration, machine learning screening, medical education

Contexte

La NYU Grossman School of Medicine a développé un outil d'apprentissage automatique pour aider à trier les quelque 14 500 candidatures reçues à chaque cycle d'admission, un processus qui mobilisait auparavant plus de 6 000 heures de travail du corps enseignant par an. Le modèle a été entraîné sur 14 555 candidatures de 2013-2017 et les décisions de tri humaines prises par le corps enseignant sur celles-ci.

Objectifs

L'outil visait à réduire la charge de tri du corps enseignant tout en produisant des recommandations d'entretien statistiquement comparables à celles des évaluateurs humains, sans remplacer le jugement humain dans les décisions finales.

Activités

Le modèle est passé par une validation par étapes : validation rétrospective sur 2 910 candidatures, validation prospective sur 2 715 candidatures lors du cycle 2018, puis enfin un essai randomisé formel lors du cycle 2019 répartissant 3 700 candidatures entre un tri par le seul corps enseignant et un tri assisté par algorithme. Il ne lit que des données structurées — pas les lettres de motivation ni les recommandations — et son résultat reste une recommandation revue par des humains, pas une décision finale.

Résultats

Publié dans la revue à comité de lecture Academic Medicine, l'essai randomisé n'a trouvé aucune différence statistiquement significative entre les taux de recommandation d'entretien de l'algorithme et du corps enseignant dans l'ensemble, y compris pour les candidats sous-représentés en médecine (61 sur 65 contre 70 sur 71 recommandés, P=,14) et les candidates (220 sur 227 contre 224 sur 229, P=,55). Le même essai a révélé un écart statistiquement significatif pour les candidats économiquement défavorisés : l'algorithme a recommandé 25 candidats sur 156 pour un entretien, contre 44 sur 178 recommandés par le corps enseignant (P=,048).

Conclusions

Les auteurs indiquent explicitement qu'un modèle entraîné sur des décisions humaines passées hérite « par définition » des biais du corps enseignant qui les a prises, qu'il ne lit que des données structurées, et que son résultat reste une recommandation revue par des humains, non une décision finale — l'écart concernant les candidats économiquement défavorisés est une réserve d'équité authentique et assumée, non un défaut dissimulé.

Mise en œuvre

Coût indicatif
Moyen (50 k€–500 k€)
Délai jusqu’aux résultats
Moyen (1–3 ans)
Personnel et compétences
NYU Grossman admissions faculty (screeners), Data science/machine-learning development team, Peer-reviewed publication team (Academic Medicine)

Conditions de réussite

  • A large historical labeled dataset of past applications and faculty decisions (14,555 records)
  • A staged validation process — retrospective, then prospective, then randomized trial — before adoption
  • Human review retained as the final decision-maker; the algorithm restricted to structured data only

Modes d’échec courants

  • A model trained on past human decisions inherits historical faculty bias 'by definition' (the authors' own caveat)
  • Statistically significant under-recommendation of economically disadvantaged applicants (25/156 vs 44/178, P=.048)

Habituellement financé par

Own resources / municipal budget

Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pratiques similaires qui pourraient vous être utiles