Panos Ipeirotis, de NYU Stern, sustituyó los trabajos escritos de un curso de Gestión de Producto con IA/ML por exámenes orales dirigidos por IA mediante agentes de voz de ElevenLabs, con un costo de 42 centavos por alumno frente a unos 750 dólares en salarios de asistentes, y el 70% de los alumnos consideró que era una medida más válida de su comprensión.
15 USD
Coste total del examen (one cohort)
0.42 USD
Coste por estudiante (one cohort)
750 USD
Coste estimado con evaluadores humanos (one cohort)
36 students
Estudiantes en la cohorte piloto (one semester)
83 %
Estudiantes que calificaron el examen como más estresante que la prueba escrita (one cohort)
70 %
Estudiantes que consideraron que medía mejor la comprensión (one cohort)
13 %
Estudiantes que preferían un examinador humano (one cohort)
29 %
Coincidencia exacta entre los 3 evaluadores de IA (one cohort)
60 %
Coincidencia dentro de un punto entre los 3 evaluadores de IA (one cohort)
3.39 out of 4
Puntuación media, planteamiento del problema (one cohort)
1.94 out of 4
Puntuación media, experimentación (one cohort)
Detalles
Madurez
Piloto
Promotor
NYU Stern School of Business (Panos Ipeirotis, Konstantinos Rizakos)
En la NYU Stern School of Business, el profesor Panos Ipeirotis notó que los trabajos escritos en su curso 'AI/ML Product Management' empezaban a leerse como memorandos de consultoría muy pulidos; al interrogar a los autores con preguntas de seguimiento, muchos no podían explicar su propio trabajo entregado.
Objetivos
Comprobar si los estudiantes realmente entendían lo que habían entregado, sin recurrir a software de detección de IA, construyendo un examen oral dirigido por IA junto con el coprofesor Konstantinos Rizakos.
Actividades
Construido sobre la IA de voz conversacional de ElevenLabs, junto con los modelos Anthropic Claude, Google Gemini y OpenAI, el sistema lee de antemano el proyecto entregado por cada estudiante y adapta dinámicamente las preguntas a sus afirmaciones específicas. Se probó en una cohorte de 36 estudiantes durante nueve días, con una media de 25 minutos por estudiante.
Resultados
El examen costó 15 dólares en total, unos 42 centavos por estudiante, frente a un coste estimado de 750 dólares para dos evaluadores humanos a 25 dólares/hora. En las encuestas a estudiantes, el 83% calificó el examen oral con IA como más estresante que una prueba escrita, pero el 70% estuvo de acuerdo en que medía mejor su comprensión real, y solo el 13% dijo preferir a un examinador humano. Tres modelos de IA independientes que calificaron las mismas respuestas coincidieron exactamente en el 29% de los casos y estuvieron dentro de un punto de diferencia en el 60% de los casos. Los estudiantes obtuvieron mejores puntuaciones en 'planteamiento del problema' (media de 3,39/4) que en 'experimentación' (1,94/4), y tres de ellos fueron incapaces de explicar siquiera sus propias decisiones de experimentación.
Conclusiones
Se trata de un proyecto piloto de un solo curso, autoinformado por el profesor a través del periódico estudiantil de la NYU y la prensa tecnológica independiente, y no de un estudio auditado de forma independiente o revisado por pares, por lo que su pequeña escala puntual debe moderar las expectativas de generalización.
Implementación
Coste indicativo
Bajo (< 50 000 €) — Stated actual cost of $15 total ($0.42/student) for the AI exam versus an estimated $750 for human TA grading.
Tiempo hasta resultados
Corto (< 1 año) — Exams administered over a nine-day window within one semester.
Personal y competencias
Panos Ipeirotis (instructor), Konstantinos Rizakos (co-instructor), NYU Stern School of Business
Condiciones para el éxito
AI reads each student's own submission in advance and tailors follow-up questions to their specific claims
Multiple independent AI models used for grading to expose reliability limits
Modos de fallo comunes
Only 29% exact grader agreement across three AI models, a real reliability concern
Small, one-off, single-course pilot (n=36), self-reported and not independently audited
No formal data-privacy or AI-governance framework described for recorded student voice data
Dónde encaja
Tipo de gobernanza
single instructor, single course
Escala
36 students, one semester
Nivel de ingresos
high-income
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.