L'Agence des médicaments du Canada a mené une comparaison évaluée par des pairs, portant sur 7 projets, entre Lens.org, SpiderCite et Microsoft Copilot face à la recherche manuelle pour la synthèse de données probantes liées au remboursement des médicaments, concluant que les trois outils d'IA repéraient nettement moins d'études pertinentes que des chercheurs formés.
Rappel/sensibilité, Microsoft Copilot (GPT-4) (7 HTA projects, Aug-Nov 2024)
2.88 hours
Temps de recherche moyen, manuel
0.96 hours
Temps de recherche moyen minimal, Copilot
Détails
Promoteur
Canada's Drug Agency (CDA-AMC, formerly CADTH)
Période
2024–2025
Mots-clés
evidence synthesis, health technology assessment, AI tool evaluation, regulatory policy analysis, systematic review
Contexte
L'Agence des médicaments du Canada (CDA-AMC, anciennement ACMTS) a chargé son équipe de Services d'information de recherche d'évaluer trois outils de recherche documentaire et de synthèse de données probantes assistés par IA — Lens.org, SpiderCite et Microsoft Copilot (GPT-4) — par rapport aux méthodes de recherche standard des revues systématiques, dans le cadre des travaux d'évaluation des technologies de la santé (ETS) qui sous-tendent les recommandations de remboursement de médicaments et de technologies au Canada.
Objectifs
Évaluer si les outils de recherche assistés par IA peuvent égaler la performance de la recherche manuelle des revues systématiques pour la synthèse de données probantes en ETS.
Activités
Une comparaison rétrospective portant sur 7 projets d'ETS achevés par l'agence (août-novembre 2024) a évalué le rappel de recherche et le temps de recherche de chaque outil d'IA par rapport à la recherche manuelle de référence. Les résultats ont été publiés sous forme d'étude comparative évaluée par des pairs et intégrés dans une déclaration de position officielle de la CDA-AMC sur l'utilisation de l'IA en ETS.
Résultats
La recherche manuelle de référence a atteint un rappel/une sensibilité de 0,986, contre 0,676 pour Lens.org, environ 0,23-0,26 pour SpiderCite, et 0,244 pour Copilot. Le temps de recherche est passé d'une moyenne de 2,88 heures pour la recherche manuelle à seulement 0,96 heure pour Copilot.
Conclusions
La conclusion de l'agence est prudente plutôt que promotionnelle : chaque outil a été jugé « adapté à l'usage » uniquement dans des rôles de soutien restreints — par exemple, Copilot pour le brainstorming de stratégies de recherche — et explicitement pas comme un remplacement de la recherche systématique standard sur des sujets d'ETS complexes.
Mise en œuvre
Les détails de mise en œuvre (coût, calendrier, personnel, conditions de réussite) ne sont pas encore disponibles pour cette pratique.
Sources de données
D'où proviennent les informations de cette pratique, et quand.
L'ATRS du Royaume-Uni est un registre public documentant le fonctionnement des outils algorithmiques gouvernementaux et leur impact sur les personnes. …