evidoria

← Voltar à navegação

Boa prática Importada

Ensaio AHEAD — Perguntas de Exame Médico Geradas por IA Igualam as Escritas por Humanos na Maioria das Medidas, com uma Lacuna de Equidade Assinalada

Canadá · Vancouver · Ver o perfil de Canadá · Ver o perfil de Vancouver

Top 59% 47/100 · Pergunte a Evidence Copilot sobre esta prática

Um ECR cego com 258 estudantes de medicina do primeiro ano da UBC constatou que perguntas de exame geradas por ChatGPT-4/Gemini foram produzidas 5,6 vezes mais depressa do que as escritas por estudantes, com notas e aceitação semelhantes, embora os itens humanos discriminassem ligeiramente melhor e tenha surgido uma diferença por género apenas no exame de IA.

Ensaio AHEAD — Perguntas de Exame Médico Geradas por IA Igualam as Escritas por Humanos na Maioria das Medidas, com uma Lacuna de Equidade Assinalada

Detalhes

Promotor
University of British Columbia Faculty of Medicine
Período
December 2024 (published June 2026)
Palavras-chave
higher education, medical education, assessment design, academic integrity

Descrição

Escrever uma única pergunta de escolha múltipla de boa qualidade para um exame de medicina pode levar mais de uma hora e custar entre 200 e mais de 2000 dólares americanos por item utilizável, o que torna dispendiosa a construção e manutenção de grandes bancos de perguntas.
O Ensaio AHEAD, conduzido pela Faculdade de Medicina da University of British Columbia (UBC) em 8 e 9 de dezembro de 2024, distribuiu aleatoriamente 258 estudantes de medicina do primeiro ano, numa proporção de 1:1, por um exame simulado cego com 112 perguntas construído por estudantes de medicina mais avançados (geradas por humanos) ou por um fluxo de trabalho com ChatGPT-4 e validação pelo Google Gemini (geradas por IA), com todos os indícios de autoria removidos antes da entrega.
As perguntas geradas por IA demoraram 4,2 minutos cada a produzir, contra 19,6 minutos das perguntas escritas por humanos — um ganho de eficiência de 5,6 vezes (p<0,0001). As notas gerais do exame foram estatisticamente semelhantes (73,4% no exame humano vs. 71,0% no exame de IA; p=0,083), e a aceitação avaliada pelos estudantes diferiu apenas ligeiramente, favorecendo o exame humano em quatro das nove medidas, com tamanhos de efeito pequenos (d de Cohen ≤0,32). Os itens escritos por humanos tiveram índices de discriminação modesta, mas significativamente, superiores aos gerados por IA (efeito pequeno), e nenhum dos dois exames alterou de forma relevante a perceção dos estudantes sobre a sua preparação.
Uma análise exploratória de subgrupos, provavelmente subdimensionada, encontrou estudantes do sexo masculino com desempenho superior ao das estudantes do sexo feminino no exame gerado por IA (rrb=0,26), mas não no exame gerado por humanos (rrb=0,07) — um sinal que os autores assinalam como exigindo monitorização demográfica, e não como um efeito confirmado. O ensaio foi realizado num único centro, envolveu apenas estudantes do primeiro ano, os autores das perguntas foram estudantes avançados e não docentes, e o registo foi feito retrospetivamente — limitações todas assinaladas pelos autores.

Implementação

Os detalhes de implementação (custo, prazo, equipa, condições de sucesso) ainda não estão disponíveis para esta prática.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis