Investigadores de la Facultad de Ingeniería y Ciencias de la Información de la Universidad de Wollongong, a través del Australasian Artificial Intelligence in Engineering Education Centre (AAIEEC), pusieron a prueba si ChatGPT-4, ChatGPT-4o, Wolfram GPT y Tutor Me GPT (Khanmigo Lite) podían funcionar como tutores 24 horas precisos y pedagógicamente sólidos para ingeniería y matemáticas. Dado que el comité de ética en investigación con humanos no aprobaría ensayos con estudiantes reales sin evidencia previa sobre los riesgos, el equipo recurrió en su lugar a tres asistentes de investigación experimentados (dos candidatos a doctorado y uno con doctorado) para simular a un estudiante promedio y a un estudiante con dificultades constantes, en 7 asignaturas y 35 temas de ingeniería eléctrica, ingeniería mecánica y matemáticas.
Cada una de las aproximadamente 280 sesiones (35 temas × 4 herramientas × 2 perfiles de estudiante) duró al menos 20 minutos y se puntuó de 0 a 4 en precisión y en seis dimensiones de experiencia pedagógica (relevancia, eficacia pedagógica, compromiso, progresión, comprensión contextual, uso de ejemplos), con una rúbrica adaptada del marco de comparación entre tutoría humana y computacional de Merrill et al.
La precisión fue alta en ingeniería eléctrica y matemáticas (los modelos obtuvieron generalmente 3–4, es decir, como máximo un error menor), pero baja en ingeniería mecánica, donde las puntuaciones medias cayeron por debajo de 3 y, en un tema de termodinámica, bajaron a 0–1,5; una pregunta sobre la caída de presión en una tubería de agua solo se respondió correctamente en 3 de 8 intentos. Una prueba de Friedman no halló diferencias estadísticamente significativas en precisión entre las cuatro herramientas. Las puntuaciones de experiencia de tutoría fueron más consistentemente positivas (la media más baja por modelo fue 2,97/4), con ChatGPT-4 calificado como el mejor tutor en general y Tutor Me GPT como el más débil.
Los autores son explícitos al afirmar que se trató de una simulación, no de un ensayo con estudiantes reales, y que esta 'no ofrece evidencia directa de la eficacia real de la GenAI para apoyar el aprendizaje'. Recomiendan no avanzar hacia una implementación más amplia en el aula hasta que mejore la precisión y se realice un ensayo supervisado con estudiantes, y revelan que el autor principal forma parte del consejo editorial de la revista (habiéndose apartado de la decisión editorial). El artículo es de acceso abierto (CC-BY-4.0), con un anexo completo con el texto exacto de la instrucción de tutoría utilizada.
De dónde se obtuvo la información de esta práctica, y cuándo.