La Agencia de Medicamentos de Canadá realizó una comparación revisada por pares, con 7 proyectos, entre Lens.org, SpiderCite y Microsoft Copilot frente a la búsqueda manual para la síntesis de evidencia de reembolso de medicamentos, concluyendo que las tres herramientas de IA recuperaron notablemente menos estudios relevantes que los investigadores capacitados.
Recuperación/sensibilidad, Microsoft Copilot (GPT-4) (7 HTA projects, Aug-Nov 2024)
2.88 hours
Tiempo medio de búsqueda, manual
0.96 hours
Tiempo medio mínimo de búsqueda, Copilot
Detalles
Promotor
Canada's Drug Agency (CDA-AMC, formerly CADTH)
Período
2024–2025
Palabras clave
evidence synthesis, health technology assessment, AI tool evaluation, regulatory policy analysis, systematic review
Contexto
La Agencia Canadiense de Medicamentos (CDA-AMC, anteriormente CADTH) encargó a su equipo de Servicios de Información de Investigación evaluar tres herramientas de búsqueda bibliográfica y síntesis de evidencia asistidas por IA — Lens.org, SpiderCite y Microsoft Copilot (GPT-4) — frente a los métodos estándar de búsqueda para revisiones sistemáticas, en el marco del trabajo de Evaluación de Tecnologías Sanitarias (HTA) que sustenta las recomendaciones de reembolso de medicamentos y tecnologías en Canadá.
Objetivos
Evaluar si las herramientas de búsqueda asistidas por IA pueden igualar el rendimiento de la búsqueda manual de revisiones sistemáticas para la síntesis de evidencia en HTA.
Actividades
Una comparación retrospectiva en 7 proyectos de HTA completados por la agencia (agosto-noviembre de 2024) evaluó la recuperación (recall) y el tiempo de búsqueda de cada herramienta de IA frente a la búsqueda manual de referencia. Los resultados se publicaron como un estudio comparativo revisado por pares y se incorporaron a una declaración de postura oficial de la CDA-AMC sobre el uso de IA en HTA.
Resultados
La búsqueda manual de referencia logró una recuperación/sensibilidad de 0,986, frente a 0,676 para Lens.org, aproximadamente 0,23-0,26 para SpiderCite, y 0,244 para Copilot. El tiempo de búsqueda se redujo de una media de 2,88 horas para la búsqueda manual a solo 0,96 horas para Copilot.
Conclusiones
La conclusión de la agencia es cautelosa, no promocional: cada herramienta se consideró 'apta para el propósito' únicamente en funciones de apoyo limitadas — por ejemplo, Copilot para la lluvia de ideas sobre estrategias de búsqueda — y explícitamente no como sustituto de la búsqueda sistemática estándar en temas complejos de HTA.
Implementación
Los detalles de implementación (coste, plazo, personal, condiciones para el éxito) aún no están disponibles para esta práctica.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.