evidoria

← Volver al listado

Buena práctica Importada

Revisión de Evidencia Asistida por IA frente a Solo Humana — una Comparación Controlada del Gobierno del Reino Unido Halla Ganancias de Velocidad y Concesiones de Calidad

Reino Unido · London · Ver el perfil de Reino Unido · Ver el perfil de London

Evidencia: Cuasiexperimental Top 24% 73/100 · Pregunte a Evidence Copilot sobre esta práctica

El DSIT y el DCMS encargaron al Behavioural Insights Team realizar revisiones de evidencia emparejadas, una asistida por IA y otra solo humana, sobre la misma cuestión de política. La revisión asistida por IA terminó un 23 % más rápido, pero necesitó más revisiones de fluidez, y ambas compartieron solo 4 de unas 30 fuentes citadas.

90.5 hours
Tiempo para completar la revisión asistida por IA (2024)
117.75 hours
Tiempo para completar la revisión solo humana (2024)
23 %
Ahorro global de tiempo con asistencia de IA (2024)
15 hours
Tiempo de la fase de análisis de literatura, asistida por IA (2024)
34 hours
Tiempo de la fase de análisis de literatura, solo humana (2024)
56 %
Reducción de tiempo en la fase de análisis de literatura (2024)
4 of ~30 sources
Fuentes compartidas entre ambas revisiones (2024)
Revisión de Evidencia Asistida por IA frente a Solo Humana — una Comparación Controlada del Gobierno del Reino Unido Halla Ganancias de Velocidad y Concesiones de Calidad

Detalles

Madurez
Piloto
Promotor
Behavioural Insights Team (BIT), commissioned by the Department for Science, Innovation and Technology (DSIT) and the Department for Digital, Culture, Media and Sport (DCMS)
Período
2024
Palabras clave
evidence review, generative AI, policy analysis, government evaluation methods

Contexto

Los departamentos del gobierno del Reino Unido consideran cada vez más el uso de IA generativa para acelerar las revisiones rápidas de evidencia que sustentan el asesoramiento en políticas públicas, pero contaban con poca evidencia controlada sobre cómo se comparan las revisiones asistidas por IA con las convencionales, hechas solo por humanos, sobre el mismo tema.

Objetivos

En 2024, el Department for Science, Innovation and Technology (DSIT) y el Department for Digital, Culture, Media and Sport (DCMS) encargaron al Behavioural Insights Team (BIT) probar si la IA generativa puede acelerar de forma significativa las revisiones rápidas de evidencia sin una pérdida inaceptable de calidad.

Actividades

Dos investigadores distintos, con el mismo encargo y criterios de inclusión sobre el efecto de la difusión tecnológica en el crecimiento y la productividad del Reino Unido, produjeron de forma independiente una revisión rápida de evidencia, uno trabajando enteramente a mano, el otro usando una combinación de herramientas de IA (incluidas Elicit, Consensus, Claude 2 y ChatGPT-4) complementada con verificación y edición manuales.

Resultados

La revisión asistida por IA se completó en 90,5 horas frente a 117,75 horas de la revisión solo humana, un ahorro global de tiempo del 23%, con la mayor diferencia en la fase de análisis de la literatura (15 horas frente a 34 horas, una reducción del 56%). Sin embargo, el borrador asistido por IA se consideró menos fluido y requirió más revisión, y las dos revisiones tuvieron una sorprendentemente escasa coincidencia en las fuentes citadas, solo 4 referencias compartidas de unas 30 fuentes consideradas creíbles en ambas.

Conclusiones

El BIT y los departamentos que encargaron el estudio concluyeron que la IA generativa puede acelerar de forma significativa las revisiones rápidas de evidencia, pero sigue produciendo errores que requieren verificación manual y puede llevar a los revisores hacia cuerpos de evidencia distintos; recomendaron más trabajo antes de una adopción más amplia, en lugar de tratar el resultado como un mandato para automatizar las revisiones de evidencia.

Implementación

Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Corto (< 1 año) — The comparison was conducted in 2024 as a one-off matched study, not an ongoing deployed practice.
Personal y competencias
Two independent researchers (one AI-assisted, one human-only), Behavioural Insights Team (BIT) as delivery and evaluation body, Department for Science, Innovation and Technology (DSIT) and Department for Digital, Culture, Media and Sport (DCMS) as commissioning departments

Condiciones para el éxito

  • Identical brief and inclusion criteria given to both reviewers to enable a fair comparison
  • Manual checking and editing of AI outputs rather than trusting them directly
  • Combining multiple AI tools (Elicit, Consensus, Claude 2, ChatGPT-4) rather than relying on a single tool

Modos de fallo comunes

  • The AI-assisted draft was judged less fluent and needed more revision than the human-only draft.
  • The two reviews shared only 4 of roughly 30 credible sources, showing AI assistance can steer reviewers toward a different evidence base.
  • The authors recommend further work before wider adoption rather than treating this as a mandate to automate evidence reviews.

Dónde encaja

Tipo de gobernanza
national government department, delivered via commissioned external evaluation
Escala
single matched study
Nivel de ingresos
high-income

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

Kit de replicación

Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles