Revue de données probantes assistée par IA contre revue humaine seule — une comparaison contrôlée du gouvernement britannique révèle des gains de rapidité et des compromis de qualité
Le DSIT et le DCMS ont chargé la Behavioural Insights Team de mener des revues de données probantes appariées, l'une assistée par IA et l'autre entièrement humaine, sur la même question de politique publique. La revue assistée par IA s'est achevée 23 % plus vite, mais a nécessité davantage de révisions de fluidité, et les deux revues n'ont partagé que 4 des quelque 30 sources citées.
90.5 hours
Temps nécessaire pour la revue assistée par IA (2024)
117.75 hours
Temps nécessaire pour la revue purement humaine (2024)
23 %
Gain de temps global avec l'assistance de l'IA (2024)
15 hours
Temps de la phase d'analyse de la littérature, assistée par IA (2024)
34 hours
Temps de la phase d'analyse de la littérature, purement humaine (2024)
56 %
Réduction du temps dans la phase d'analyse de la littérature (2024)
4 of ~30 sources
Sources communes aux deux revues (2024)
Détails
Maturité
Pilote
Promoteur
Behavioural Insights Team (BIT), commissioned by the Department for Science, Innovation and Technology (DSIT) and the Department for Digital, Culture, Media and Sport (DCMS)
Période
2024
Mots-clés
evidence review, generative AI, policy analysis, government evaluation methods
Contexte
Les ministères britanniques envisagent de plus en plus d'utiliser l'IA générative pour accélérer les revues rapides de données probantes qui alimentent les conseils en matière de politiques publiques, mais disposaient de peu de données contrôlées sur la manière dont les revues assistées par l'IA se comparent aux revues classiques, réalisées uniquement par des humains, sur le même sujet.
Objectifs
En 2024, le Department for Science, Innovation and Technology (DSIT) et le Department for Digital, Culture, Media and Sport (DCMS) ont chargé le Behavioural Insights Team (BIT) de tester si l'IA générative peut accélérer significativement les revues rapides de données probantes sans perte de qualité inacceptable.
Activités
Deux chercheurs distincts, disposant du même sujet et des mêmes critères d'inclusion sur l'effet de la diffusion technologique sur la croissance et la productivité au Royaume-Uni, ont produit indépendamment une revue rapide de données probantes, l'un travaillant entièrement à la main, l'autre utilisant un ensemble d'outils d'IA (dont Elicit, Consensus, Claude 2 et ChatGPT-4) complété par une vérification et une édition manuelles.
Résultats
La revue assistée par IA a été achevée en 90,5 heures contre 117,75 heures pour la revue purement humaine, soit un gain de temps global de 23%, l'écart le plus marqué se situant dans la phase d'analyse de la littérature (15 heures contre 34 heures, soit une réduction de 56%). Cependant, le texte assisté par IA a été jugé moins fluide et a nécessité davantage de révisions, et les deux revues présentaient un chevauchement étonnamment faible dans les sources citées, seulement 4 références communes sur environ 30 sources jugées crédibles par les deux.
Conclusions
Le BIT et les ministères commanditaires ont conclu que l'IA générative peut accélérer sensiblement les revues rapides de données probantes, mais produit encore des erreurs nécessitant une vérification manuelle et peut orienter les évaluateurs vers des corpus de données probantes différents ; ils ont recommandé des travaux supplémentaires avant une adoption plus large, plutôt que de considérer ce résultat comme un mandat pour automatiser les revues de données probantes.
Mise en œuvre
Coût indicatif
Faible (< 50 k€)
Délai jusqu’aux résultats
Court (< 1 an) — The comparison was conducted in 2024 as a one-off matched study, not an ongoing deployed practice.
Personnel et compétences
Two independent researchers (one AI-assisted, one human-only), Behavioural Insights Team (BIT) as delivery and evaluation body, Department for Science, Innovation and Technology (DSIT) and Department for Digital, Culture, Media and Sport (DCMS) as commissioning departments
Conditions de réussite
Identical brief and inclusion criteria given to both reviewers to enable a fair comparison
Manual checking and editing of AI outputs rather than trusting them directly
Combining multiple AI tools (Elicit, Consensus, Claude 2, ChatGPT-4) rather than relying on a single tool
Modes d’échec courants
The AI-assisted draft was judged less fluent and needed more revision than the human-only draft.
The two reviews shared only 4 of roughly 30 credible sources, showing AI assistance can steer reviewers toward a different evidence base.
The authors recommend further work before wider adoption rather than treating this as a mandate to automate evidence reviews.
Où cela s’applique
Type de gouvernance
national government department, delivered via commissioned external evaluation
Échelle
single matched study
Niveau de revenu
high-income
Habituellement financé par
National / regional programmes
Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.
Kit de réplication
Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.