evidoria

← Volver al listado

Buena práctica Importada

El sistema de preselección mediante aprendizaje automático de la NYU Grossman School of Medicine para solicitudes de ingreso a Medicina

Estados Unidos · New York · Ver el perfil de Estados Unidos · Ver el perfil de New York

Evidencia: Ensayo controlado aleatorizado Top 77% 40/100 · Pregunte a Evidence Copilot sobre esta práctica

NYU Grossman entrenó un sistema de aprendizaje automático con 14.555 solicitudes anteriores para identificar candidatos a entrevistar; un ensayo aleatorizado de 2019 con 3.700 solicitudes halló que sus recomendaciones eran estadísticamente indistinguibles de las de los evaluadores humanos en general, pero recomendó a los solicitantes con desventaja económica para entrevista a una tasa significativamente menor que la de los evaluadores (P=,048).

14,555
Solicitudes usadas para entrenar el modelo (2013–2017)
6,000+ hours/year
Horas de selección del profesorado antes necesarias por año
2,910
Solicitudes en la validación retrospectiva
2,715
Solicitudes en la validación prospectiva (ciclo 2018) (2018)
3,700
Solicitudes en el ensayo aleatorizado (ciclo 2019) (2019)
61/65 vs 70/71 (P=.14)
Candidatos subrepresentados en medicina recomendados (algoritmo vs profesorado)
220/227 vs 224/229 (P=.55)
Candidatas recomendadas (algoritmo vs profesorado)
25/156 vs 44/178 (P=.048)
Candidatos económicamente desfavorecidos recomendados (algoritmo vs profesorado)

Detalles

Madurez
Consolidada
Promotor
NYU Grossman School of Medicine
Período
2013–2019
Palabras clave
admissions, higher education administration, machine learning screening, medical education

Contexto

La NYU Grossman School of Medicine desarrolló una herramienta de aprendizaje automático para ayudar a filtrar las aproximadamente 14.500 solicitudes que recibe en cada ciclo de admisión, un proceso que antes consumía más de 6.000 horas de tiempo del profesorado al año. El modelo se entrenó con 14.555 solicitudes de 2013-2017 y las decisiones humanas de selección tomadas por el profesorado sobre ellas.

Objetivos

La herramienta buscaba reducir la carga de trabajo de selección del profesorado, produciendo recomendaciones de entrevista estadísticamente comparables a las de los evaluadores humanos, sin sustituir el juicio humano en las decisiones finales.

Actividades

El modelo pasó por una validación por etapas: validación retrospectiva sobre 2.910 solicitudes, validación prospectiva sobre 2.715 solicitudes en el ciclo de 2018 y, finalmente, un ensayo aleatorizado formal en el ciclo de 2019 que dividió 3.700 solicitudes entre selección exclusivamente por el profesorado y selección asistida por algoritmo. Solo lee datos estructurados —no ensayos ni cartas de recomendación— y su resultado sigue siendo una recomendación revisada por humanos, no una decisión final.

Resultados

Publicado en la revista revisada por pares Academic Medicine, el ensayo aleatorizado no encontró diferencias estadísticamente significativas entre las tasas de recomendación de entrevista del algoritmo y del profesorado en general, incluyendo a candidatos subrepresentados en medicina (61 de 65 frente a 70 de 71 recomendados, P=,14) y candidatas mujeres (220 de 227 frente a 224 de 229, P=,55). El mismo ensayo encontró una brecha estadísticamente significativa para candidatos económicamente desfavorecidos: el algoritmo recomendó a 25 de 156 para entrevista, frente a 44 de 178 recomendados por el profesorado (P=,048).

Conclusiones

Los autores son explícitos al señalar que un modelo entrenado con decisiones humanas pasadas hereda 'por definición' los sesgos del profesorado que las tomó, que solo lee datos estructurados, y que su resultado sigue siendo una recomendación revisada por humanos, no una decisión final —la brecha relativa a los candidatos económicamente desfavorecidos es una salvedad de equidad genuina y declarada, no un defecto oculto.

Implementación

Coste indicativo
Medio (50 000–500 000 €)
Tiempo hasta resultados
Medio (1–3 años)
Personal y competencias
NYU Grossman admissions faculty (screeners), Data science/machine-learning development team, Peer-reviewed publication team (Academic Medicine)

Condiciones para el éxito

  • A large historical labeled dataset of past applications and faculty decisions (14,555 records)
  • A staged validation process — retrospective, then prospective, then randomized trial — before adoption
  • Human review retained as the final decision-maker; the algorithm restricted to structured data only

Modos de fallo comunes

  • A model trained on past human decisions inherits historical faculty bias 'by definition' (the authors' own caveat)
  • Statistically significant under-recommendation of economically disadvantaged applicants (25/156 vs 44/178, P=.048)

Habitualmente financiado por

Own resources / municipal budget

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Prácticas similares que pueden serle útiles