evidoria

← Back to browse

Good practice

El rechazo de la Universidad Vanderbilt, basado en evidencias, al detector de IA de Turnitin

United States of America · Nashville · See the United States of America profile

Vanderbilt desactivó el detector de IA de Turnitin en toda la universidad en ago. 2023, calculando que su tasa de falsos positivos del 1% podría señalar mal a ~750 de sus 75.000 trabajos anuales; un estudio de Stanford halló 61,3% de redacciones TOEFL no nativas mal clasificadas.

1 %
Tasa de falsos positivos declarada por Turnitin (2023)
75000 papers
Trabajos entregados anualmente a través de Turnitin (2022)
750 papers/year
Trabajos estimados como marcados erróneamente por año según la tasa de falsos positivos declarada (2022)
61.3 %
Tasa media de clasificación errónea de ensayos TOEFL no nativos como generados por IA, en siete detectores (2023)
97.8 %
Tasa más alta de clasificación errónea de ensayos TOEFL no nativos por un único detector (2023)
19.8 %
Ensayos TOEFL juzgados erróneamente de forma unánime como generados por IA por los siete detectores (2023)
11.6 %
Tasa de clasificación errónea tras usar ChatGPT para mejorar la elección de palabras de los ensayos no nativos (2023)
91 essays
Ensayos TOEFL analizados en el estudio de Stanford (2023)
El rechazo de la Universidad Vanderbilt, basado en evidencias, al detector de IA de Turnitin

Details

Promoter
Vanderbilt University
Period
Apr 2023 – Aug 2023 (decision); bias research published Jul 2023
Keywords
higher education, academic integrity, AI-text detection, plagiarism, writing assessment, EdTech governance

Context

En abril de 2023, el Brightspace/Center for Teaching de la Universidad de Vanderbilt activó la función de detección de texto generado por IA de Turnitin, recién lanzada, para uso del profesorado en todo el campus, aunque Turnitin afirmaba públicamente una tasa de falsos positivos de apenas alrededor del 1%. Con cerca de 75,000 trabajos entregados a través de Turnitin en 2022, el personal de Vanderbilt calculó que incluso esa tasa supuestamente baja implicaba que unos 750 trabajos al año podrían ser marcados erróneamente como generados por IA. Ese mismo verano, un equipo de investigación de la Universidad de Stanford publicó un estudio revisado por pares en la revista Patterns, de Cell Press, que analizaba si los detectores comerciales de texto generado por IA estaban sesgados contra los escritores no nativos de inglés.

Objectives

El objetivo declarado de Vanderbilt era evaluar si el detector de texto generado por IA de Turnitin era lo bastante preciso y justo como para sustentar decisiones de integridad académica de alto riesgo, sopesando la tasa de falsos positivos declarada por la herramienta frente al número de trabajos analizados y la transparencia de su metodología.

Activities

A lo largo de varios meses, el Brightspace/Center for Teaching de Vanderbilt realizó pruebas internas del detector de texto generado por IA y consultó a otras universidades y a proveedores de IA, incluida Turnitin, antes de decidir sobre su uso futuro. En paralelo, investigadores de Stanford (Liang, Yuksekgonul, Mao, Wu y Zou) sometieron 91 ensayos TOEFL genuinos escritos por hablantes no nativos de inglés, y un conjunto comparativo de ensayos de octavo grado estadounidense escritos por hablantes nativos, a siete detectores comerciales de GPT ampliamente utilizados, y además comprobaron cómo la reescritura de los textos con ChatGPT modificaba los resultados de los detectores.

Results

Vanderbilt desactivó el detector de texto generado por IA de Turnitin en todo el campus el 16 de agosto de 2023, citando tanto el riesgo de falsos positivos como la negativa de Turnitin a revelar la metodología detallada detrás de sus puntuaciones de probabilidad de IA. El estudio de Stanford halló que los siete detectores clasificaron erróneamente, en promedio, el 61.3% de los ensayos TOEFL no nativos como generados por IA, con un detector que marcó el 97.8% y los siete detectores equivocándose unánimemente en el 19.8% del conjunto, mientras que los ensayos de octavo grado de hablantes nativos de inglés se clasificaron correctamente; usar ChatGPT para mejorar la elección de palabras de los ensayos no nativos redujo la tasa de falsos positivos al 11.6%, mientras que simplificar el vocabulario de los ensayos nativos aumentó su clasificación errónea.

Conclusions

En conjunto, los dos casos muestran un raro bucle de retroalimentación entre el razonamiento interno de coste-beneficio de una institución y una investigación académica independiente que llega a la misma conclusión: los detectores comerciales de texto generado por IA aún no eran suficientemente fiables ni justos para decisiones de integridad académica de alto riesgo, especialmente para estudiantes internacionales y no nativos de inglés, lo que llevó a Vanderbilt y a otras universidades estadounidenses a desactivar la detección de IA en lugar de arriesgarse a acusaciones falsas.

Implementation

Indicative cost
Low (< €50k)
Time to results
Short (< 1 year)
Staffing & skills
Vanderbilt's Brightspace / Center for Teaching team, which administered the campus-wide Turnitin AI-detector rollout and later communicated the decision to disable it, Michael Coley, the Vanderbilt staff member who publicly summarised the institutional reasoning for disabling the detector

Conditions for success

  • Willingness to independently quantify a vendor's claimed false-positive rate against the institution's actual submission volume before relying on the tool
  • Consultation with peer universities and with AI-detection vendors, including Turnitin, before making the final decision
  • Attention to independent peer-reviewed bias research (the Stanford Patterns study) alongside the university's own internal calculations
  • Willingness to discontinue a widely adopted EdTech tool when its vendor would not disclose the methodology behind its scores

Common failure modes

  • Relying on a vendor's marketed accuracy figures without checking them against actual submission volume
  • Continuing to use black-box AI-detection tools whose vendors refuse to disclose their underlying methodology

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful