evidoria

← Back to browse

Good practice

Le rejet, fondé sur des preuves, par l'université Vanderbilt du détecteur d'IA de Turnitin

United States of America · Nashville · See the United States of America profile

Vanderbilt a désactivé le détecteur d'IA de Turnitin en août 2023, calculant que 1 % de faux positifs signalerait à tort ~750 de ses 75 000 copies annuelles ; une étude de Stanford a trouvé 61,3 % de rédactions TOEFL non natives mal classées.

1 %
Taux de faux positifs revendiqué par Turnitin (2023)
75000 papers
Travaux soumis annuellement via Turnitin (2022)
750 papers/year
Travaux estimés signalés à tort par an au taux de faux positifs revendiqué (2022)
61.3 %
Taux moyen de classification erronée des rédactions TOEFL non natives comme générées par IA, sur sept détecteurs (2023)
97.8 %
Taux de classification erronée le plus élevé des rédactions TOEFL non natives par un seul détecteur (2023)
19.8 %
Rédactions TOEFL jugées à tort à l'unanimité comme générées par IA par les sept détecteurs (2023)
11.6 %
Taux de classification erronée après utilisation de ChatGPT pour améliorer le choix des mots des rédactions non natives (2023)
91 essays
Rédactions TOEFL analysées dans l'étude de Stanford (2023)
Le rejet, fondé sur des preuves, par l'université Vanderbilt du détecteur d'IA de Turnitin

Details

Promoter
Vanderbilt University
Period
Apr 2023 – Aug 2023 (decision); bias research published Jul 2023
Keywords
higher education, academic integrity, AI-text detection, plagiarism, writing assessment, EdTech governance

Context

En avril 2023, le Brightspace/Center for Teaching de l'université Vanderbilt a activé la fonctionnalité de détection de texte généré par IA de Turnitin, nouvellement lancée, pour un usage par le corps enseignant à l'échelle de tout le campus, alors même que Turnitin affirmait publiquement un taux de faux positifs d'environ 1% seulement. Avec environ 75,000 travaux soumis via Turnitin en 2022, le personnel de Vanderbilt a calculé que même ce taux revendiqué comme faible impliquait qu'environ 750 travaux par an pourraient être signalés à tort comme générés par IA. Ce même été, une équipe de recherche de l'université Stanford a publié une étude évaluée par des pairs dans la revue Patterns de Cell Press, testant si les détecteurs commerciaux de texte généré par IA étaient biaisés contre les rédacteurs non anglophones natifs.

Objectives

L'objectif affiché de Vanderbilt était d'évaluer si le détecteur de texte généré par IA de Turnitin était suffisamment précis et équitable pour fonder des décisions d'intégrité académique à fort enjeu, en mettant en balance le taux de faux positifs revendiqué par l'outil, le nombre de travaux analysés et la transparence de sa méthodologie.

Activities

Pendant plusieurs mois, le Brightspace/Center for Teaching de Vanderbilt a mené des tests internes du détecteur de texte généré par IA et a consulté d'autres universités ainsi que des fournisseurs d'IA, dont Turnitin, avant de statuer sur son utilisation future. Parallèlement, des chercheurs de Stanford (Liang, Yuksekgonul, Mao, Wu et Zou) ont soumis 91 rédactions TOEFL authentiques écrites par des locuteurs non natifs de l'anglais, ainsi qu'un ensemble comparatif de rédactions d'élèves américains de huitième année, locuteurs natifs, à sept détecteurs commerciaux de GPT largement utilisés, et ont également testé comment une reformulation des textes via ChatGPT modifiait les résultats des détecteurs.

Results

Vanderbilt a désactivé le détecteur de texte généré par IA de Turnitin à l'échelle de tout le campus le 16 août 2023, invoquant à la fois le risque de faux positifs et le refus de Turnitin de divulguer la méthodologie détaillée derrière ses scores de probabilité d'IA. L'étude de Stanford a révélé que les sept détecteurs classaient à tort, en moyenne, 61.3% des rédactions TOEFL non natives comme générées par IA, l'un des détecteurs en signalant 97.8% et les sept détecteurs se trompant à l'unanimité sur 19.8% de l'ensemble, tandis que les rédactions d'élèves natifs de huitième année étaient correctement classées ; l'utilisation de ChatGPT pour améliorer le choix des mots des rédactions non natives a réduit le taux de faux positifs à 11.6%, tandis que la simplification du vocabulaire des rédactions natives a augmenté leur taux de classification erronée.

Conclusions

Ensemble, les deux cas illustrent une rare boucle de rétroaction entre le raisonnement coûts-avantages interne d'une institution et une recherche académique indépendante aboutissant à la même conclusion : les détecteurs commerciaux de texte généré par IA n'étaient pas encore assez fiables ni équitables pour des décisions d'intégrité académique à fort enjeu, en particulier pour les étudiants internationaux et non anglophones natifs, ce qui a conduit Vanderbilt et d'autres universités américaines à désactiver la détection d'IA plutôt que de risquer de fausses accusations.

Implementation

Indicative cost
Low (< €50k)
Time to results
Short (< 1 year)
Staffing & skills
Vanderbilt's Brightspace / Center for Teaching team, which administered the campus-wide Turnitin AI-detector rollout and later communicated the decision to disable it, Michael Coley, the Vanderbilt staff member who publicly summarised the institutional reasoning for disabling the detector

Conditions for success

  • Willingness to independently quantify a vendor's claimed false-positive rate against the institution's actual submission volume before relying on the tool
  • Consultation with peer universities and with AI-detection vendors, including Turnitin, before making the final decision
  • Attention to independent peer-reviewed bias research (the Stanford Patterns study) alongside the university's own internal calculations
  • Willingness to discontinue a widely adopted EdTech tool when its vendor would not disclose the methodology behind its scores

Common failure modes

  • Relying on a vendor's marketed accuracy figures without checking them against actual submission volume
  • Continuing to use black-box AI-detection tools whose vendors refuse to disclose their underlying methodology

Data sources

Where this practice's information was retrieved from, and when.

Attachments

Similar practices you may find useful