evidoria

← Volver al listado

Buena práctica Importada

Exámenes Orales con IA — La Alternativa de NYU Stern a la Evaluación Escrita, Resistente al Fraude

Estados Unidos · New York City · Ver el perfil de Estados Unidos · Ver el perfil de New York City

Evidencia: Descriptivo / autodeclarado Top 91% 27/100 · Pregunte a Evidence Copilot sobre esta práctica

Panos Ipeirotis, de NYU Stern, sustituyó los trabajos escritos de un curso de Gestión de Producto con IA/ML por exámenes orales dirigidos por IA mediante agentes de voz de ElevenLabs, con un costo de 42 centavos por alumno frente a unos 750 dólares en salarios de asistentes, y el 70% de los alumnos consideró que era una medida más válida de su comprensión.

15 USD
Coste total del examen (one cohort)
0.42 USD
Coste por estudiante (one cohort)
750 USD
Coste estimado con evaluadores humanos (one cohort)
36 students
Estudiantes en la cohorte piloto (one semester)
83 %
Estudiantes que calificaron el examen como más estresante que la prueba escrita (one cohort)
70 %
Estudiantes que consideraron que medía mejor la comprensión (one cohort)
13 %
Estudiantes que preferían un examinador humano (one cohort)
29 %
Coincidencia exacta entre los 3 evaluadores de IA (one cohort)
60 %
Coincidencia dentro de un punto entre los 3 evaluadores de IA (one cohort)
3.39 out of 4
Puntuación media, planteamiento del problema (one cohort)
1.94 out of 4
Puntuación media, experimentación (one cohort)
Exámenes Orales con IA — La Alternativa de NYU Stern a la Evaluación Escrita, Resistente al Fraude

Detalles

Madurez
Piloto
Promotor
NYU Stern School of Business (Panos Ipeirotis, Konstantinos Rizakos)
Período
2025-2026
Palabras clave
education, higher education, assessment technology

Contexto

En la NYU Stern School of Business, el profesor Panos Ipeirotis notó que los trabajos escritos en su curso 'AI/ML Product Management' empezaban a leerse como memorandos de consultoría muy pulidos; al interrogar a los autores con preguntas de seguimiento, muchos no podían explicar su propio trabajo entregado.

Objetivos

Comprobar si los estudiantes realmente entendían lo que habían entregado, sin recurrir a software de detección de IA, construyendo un examen oral dirigido por IA junto con el coprofesor Konstantinos Rizakos.

Actividades

Construido sobre la IA de voz conversacional de ElevenLabs, junto con los modelos Anthropic Claude, Google Gemini y OpenAI, el sistema lee de antemano el proyecto entregado por cada estudiante y adapta dinámicamente las preguntas a sus afirmaciones específicas. Se probó en una cohorte de 36 estudiantes durante nueve días, con una media de 25 minutos por estudiante.

Resultados

El examen costó 15 dólares en total, unos 42 centavos por estudiante, frente a un coste estimado de 750 dólares para dos evaluadores humanos a 25 dólares/hora. En las encuestas a estudiantes, el 83% calificó el examen oral con IA como más estresante que una prueba escrita, pero el 70% estuvo de acuerdo en que medía mejor su comprensión real, y solo el 13% dijo preferir a un examinador humano. Tres modelos de IA independientes que calificaron las mismas respuestas coincidieron exactamente en el 29% de los casos y estuvieron dentro de un punto de diferencia en el 60% de los casos. Los estudiantes obtuvieron mejores puntuaciones en 'planteamiento del problema' (media de 3,39/4) que en 'experimentación' (1,94/4), y tres de ellos fueron incapaces de explicar siquiera sus propias decisiones de experimentación.

Conclusiones

Se trata de un proyecto piloto de un solo curso, autoinformado por el profesor a través del periódico estudiantil de la NYU y la prensa tecnológica independiente, y no de un estudio auditado de forma independiente o revisado por pares, por lo que su pequeña escala puntual debe moderar las expectativas de generalización.

Implementación

Coste indicativo
Bajo (< 50 000 €) — Stated actual cost of $15 total ($0.42/student) for the AI exam versus an estimated $750 for human TA grading.
Tiempo hasta resultados
Corto (< 1 año) — Exams administered over a nine-day window within one semester.
Personal y competencias
Panos Ipeirotis (instructor), Konstantinos Rizakos (co-instructor), NYU Stern School of Business

Condiciones para el éxito

  • AI reads each student's own submission in advance and tailors follow-up questions to their specific claims
  • Multiple independent AI models used for grading to expose reliability limits

Modos de fallo comunes

  • Only 29% exact grader agreement across three AI models, a real reliability concern
  • Small, one-off, single-course pilot (n=36), self-reported and not independently audited
  • No formal data-privacy or AI-governance framework described for recorded student voice data

Dónde encaja

Tipo de gobernanza
single instructor, single course
Escala
36 students, one semester
Nivel de ingresos
high-income

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles