evidoria

← Voltar à navegação

Boa prática Importada

O Sistema de Triagem por Aprendizagem Automática da NYU Grossman School of Medicine para Candidaturas ao Curso de Medicina

Estados Unidos da América · New York · Ver o perfil de Estados Unidos da América · Ver o perfil de New York

Evidência: Ensaio controlado aleatorizado Top 77% 40/100 · Pergunte a Evidence Copilot sobre esta prática

A NYU Grossman treinou um sistema de aprendizagem automática com 14.555 candidaturas anteriores para identificar candidatos a entrevistar; um ensaio aleatorizado de 2019 com 3.700 candidaturas concluiu que as suas recomendações eram estatisticamente indistinguíveis das dos avaliadores humanos em geral, mas recomendou candidatos economicamente desfavorecidos para entrevista a uma taxa significativamente inferior à dos avaliadores (P=,048).

14,555
Candidaturas usadas para treinar o modelo (2013–2017)
6,000+ hours/year
Horas de triagem do corpo docente anteriormente necessárias por ano
2,910
Candidaturas na validação retrospetiva
2,715
Candidaturas na validação prospetiva (ciclo de 2018) (2018)
3,700
Candidaturas no ensaio aleatorizado (ciclo de 2019) (2019)
61/65 vs 70/71 (P=.14)
Candidatos sub-representados na medicina recomendados (algoritmo vs corpo docente)
220/227 vs 224/229 (P=.55)
Candidatas recomendadas (algoritmo vs corpo docente)
25/156 vs 44/178 (P=.048)
Candidatos economicamente desfavorecidos recomendados (algoritmo vs corpo docente)

Detalhes

Maturidade
Consolidada
Promotor
NYU Grossman School of Medicine
Período
2013–2019
Palavras-chave
admissions, higher education administration, machine learning screening, medical education

Contexto

A NYU Grossman School of Medicine desenvolveu uma ferramenta de aprendizagem automática para ajudar a triar as cerca de 14.500 candidaturas que recebe em cada ciclo de admissões, um processo que anteriormente consumia mais de 6.000 horas de tempo do corpo docente por ano. O modelo foi treinado com 14.555 candidaturas de 2013-2017 e as decisões humanas de triagem tomadas pelo corpo docente sobre essas candidaturas.

Objetivos

A ferramenta visava reduzir a carga de trabalho de triagem do corpo docente, produzindo recomendações de entrevista estatisticamente comparáveis às dos avaliadores humanos, sem substituir o julgamento humano nas decisões finais.

Atividades

O modelo passou por uma validação faseada: validação retrospetiva em 2.910 candidaturas, validação prospetiva em 2.715 candidaturas no ciclo de 2018 e, por fim, um ensaio aleatorizado formal no ciclo de 2019 que dividiu 3.700 candidaturas entre triagem exclusivamente por corpo docente e triagem assistida por algoritmo. O modelo lê apenas dados estruturados — não ensaios nem cartas de recomendação — e o seu resultado permanece uma recomendação revista por humanos, não uma decisão final.

Resultados

Publicado na revista revista por pares Academic Medicine, o ensaio aleatorizado não encontrou diferença estatisticamente significativa entre as taxas de recomendação de entrevista do algoritmo e do corpo docente no geral, incluindo para candidatos sub-representados na medicina (61 de 65 vs 70 de 71 recomendados, P=,14) e candidatas do sexo feminino (220 de 227 vs 224 de 229, P=,55). O mesmo ensaio encontrou uma diferença estatisticamente significativa para candidatos economicamente desfavorecidos: o algoritmo recomendou 25 de 156 para entrevista, contra 44 de 178 recomendados pelo corpo docente (P=,048).

Conclusões

Os autores são explícitos ao afirmar que um modelo treinado com decisões humanas passadas herda 'por definição' os enviesamentos do corpo docente que as tomou, que apenas lê dados estruturados, e que o seu resultado permanece uma recomendação revista por humanos, não uma decisão final — a disparidade relativa a candidatos economicamente desfavorecidos é uma ressalva de equidade genuína e divulgada, e não uma falha oculta.

Implementação

Custo indicativo
Médio (50 mil–500 mil €)
Tempo até resultados
Médio (1–3 anos)
Equipa e competências
NYU Grossman admissions faculty (screeners), Data science/machine-learning development team, Peer-reviewed publication team (Academic Medicine)

Condições de sucesso

  • A large historical labeled dataset of past applications and faculty decisions (14,555 records)
  • A staged validation process — retrospective, then prospective, then randomized trial — before adoption
  • Human review retained as the final decision-maker; the algorithm restricted to structured data only

Modos de falha comuns

  • A model trained on past human decisions inherits historical faculty bias 'by definition' (the authors' own caveat)
  • Statistically significant under-recommendation of economically disadvantaged applicants (25/156 vs 44/178, P=.048)

Habitualmente financiado por

Own resources / municipal budget

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis