evidoria

← Voltar à navegação

Boa prática Importada

Exames Orais com IA — A Alternativa da NYU Stern à Avaliação Escrita, Resistente a Fraude

Estados Unidos da América · New York City · Ver o perfil de Estados Unidos da América · Ver o perfil de New York City

Evidência: Descritivo / autorreportado Top 91% 27/100 · Pergunte a Evidence Copilot sobre esta prática

Panos Ipeirotis, da NYU Stern, substituiu os trabalhos escritos de uma disciplina de Gestão de Produto com IA/ML por exames orais conduzidos por IA através de agentes de voz da ElevenLabs, com um custo de 42 cêntimos por aluno face a cerca de 750 dólares em honorários de assistentes, e 70% dos alunos consideraram-no uma medida mais válida da sua compreensão.

15 USD
Custo total do exame (one cohort)
0.42 USD
Custo por estudante (one cohort)
750 USD
Custo estimado com avaliadores humanos (one cohort)
36 students
Estudantes na coorte-piloto (one semester)
83 %
Estudantes que classificaram o exame como mais stressante do que o teste escrito (one cohort)
70 %
Estudantes que concordaram que media melhor a compreensão (one cohort)
13 %
Estudantes que preferiam um examinador humano (one cohort)
29 %
Concordância exata entre os 3 avaliadores de IA (one cohort)
60 %
Concordância dentro de um ponto entre os 3 avaliadores de IA (one cohort)
3.39 out of 4
Pontuação média, enquadramento do problema (one cohort)
1.94 out of 4
Pontuação média, experimentação (one cohort)
Exames Orais com IA — A Alternativa da NYU Stern à Avaliação Escrita, Resistente a Fraude

Detalhes

Maturidade
Piloto
Promotor
NYU Stern School of Business (Panos Ipeirotis, Konstantinos Rizakos)
Período
2025-2026
Palavras-chave
education, higher education, assessment technology

Contexto

Na NYU Stern School of Business, o professor Panos Ipeirotis notou que os trabalhos escritos na sua disciplina 'AI/ML Product Management' começaram a ler-se como memorandos de consultoria altamente polidos; quando questionava os autores com perguntas de acompanhamento, muitos não conseguiam explicar o seu próprio trabalho submetido.

Objetivos

Testar se os estudantes realmente compreendiam o que tinham submetido, sem recorrer a software de deteção de IA, construindo um exame oral conduzido por IA com o co-docente Konstantinos Rizakos.

Atividades

Construído sobre a IA de voz conversacional da ElevenLabs, juntamente com os modelos Anthropic Claude, Google Gemini e OpenAI, o sistema lê antecipadamente o projeto submetido por cada estudante e adapta dinamicamente as perguntas às suas afirmações específicas. Foi testado numa coorte de 36 estudantes ao longo de nove dias, com uma média de 25 minutos por estudante.

Resultados

O exame custou 15 dólares no total, cerca de 42 cêntimos por estudante, face a um custo estimado de 750 dólares para dois avaliadores humanos a 25 dólares/hora. Nos inquéritos aos estudantes, 83% classificaram o exame oral com IA como mais stressante do que um teste escrito, mas 70% concordaram que media melhor a sua verdadeira compreensão, e apenas 13% disseram preferir um examinador humano. Três modelos de IA independentes, ao avaliar as mesmas respostas, concordaram exatamente em 29% dos casos e ficaram dentro de um ponto de diferença em 60% dos casos. Os estudantes pontuaram melhor em 'enquadramento do problema' (média de 3,39/4) do que em 'experimentação' (1,94/4), com três incapazes de discutir sequer as suas próprias escolhas de experimentação.

Conclusões

Trata-se de um projeto-piloto de uma única disciplina, auto-reportado pelo docente através do jornal estudantil da NYU e da imprensa tecnológica independente, e não de um estudo auditado de forma independente ou revisto por pares, pelo que a sua pequena escala pontual deve moderar as expectativas de generalização.

Implementação

Custo indicativo
Baixo (< 50 mil €) — Stated actual cost of $15 total ($0.42/student) for the AI exam versus an estimated $750 for human TA grading.
Tempo até resultados
Curto (< 1 ano) — Exams administered over a nine-day window within one semester.
Equipa e competências
Panos Ipeirotis (instructor), Konstantinos Rizakos (co-instructor), NYU Stern School of Business

Condições de sucesso

  • AI reads each student's own submission in advance and tailors follow-up questions to their specific claims
  • Multiple independent AI models used for grading to expose reliability limits

Modos de falha comuns

  • Only 29% exact grader agreement across three AI models, a real reliability concern
  • Small, one-off, single-course pilot (n=36), self-reported and not independently audited
  • No formal data-privacy or AI-governance framework described for recorded student voice data

Onde se enquadra

Tipo de governação
single instructor, single course
Escala
36 students, one semester
Nível de rendimento
high-income

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis