evidoria

← Voltar à navegação

Boa prática Importada

Revisão de Evidência Assistida por IA vs. Apenas Humana — Comparação Controlada do Governo do Reino Unido Encontra Ganhos de Velocidade e Compromissos de Qualidade

Reino Unido · London · Ver o perfil de Reino Unido · Ver o perfil de London

Evidência: Quase-experimental Top 25% 73/100 · Pergunte a Evidence Copilot sobre esta prática

O DSIT e o DCMS encarregaram a Behavioural Insights Team de realizar revisões de evidência emparelhadas, uma assistida por IA e outra apenas humana, sobre a mesma questão de política. A revisão assistida por IA terminou 23% mais rápido, mas exigiu mais revisões de fluência, e as duas partilharam apenas 4 de cerca de 30 fontes citadas.

90.5 hours
Tempo para concluir a revisão assistida por IA (2024)
117.75 hours
Tempo para concluir a revisão apenas humana (2024)
23 %
Poupança global de tempo com assistência de IA (2024)
15 hours
Tempo da fase de análise da literatura, assistida por IA (2024)
34 hours
Tempo da fase de análise da literatura, apenas humana (2024)
56 %
Redução de tempo na fase de análise da literatura (2024)
4 of ~30 sources
Fontes partilhadas entre as duas revisões (2024)
Revisão de Evidência Assistida por IA vs. Apenas Humana — Comparação Controlada do Governo do Reino Unido Encontra Ganhos de Velocidade e Compromissos de Qualidade

Detalhes

Maturidade
Piloto
Promotor
Behavioural Insights Team (BIT), commissioned by the Department for Science, Innovation and Technology (DSIT) and the Department for Digital, Culture, Media and Sport (DCMS)
Período
2024
Palavras-chave
evidence review, generative AI, policy analysis, government evaluation methods

Contexto

Departamentos do governo do Reino Unido consideram cada vez mais o uso de IA generativa para acelerar as revisões rápidas de evidência que informam o aconselhamento em matéria de políticas públicas, mas dispunham de pouca evidência controlada sobre como as revisões assistidas por IA se comparam com as convencionais, feitas apenas por humanos, sobre o mesmo tema.

Objetivos

Em 2024, o Department for Science, Innovation and Technology (DSIT) e o Department for Digital, Culture, Media and Sport (DCMS) encomendaram ao Behavioural Insights Team (BIT) que testasse se a IA generativa consegue acelerar de forma significativa as revisões rápidas de evidência sem uma perda inaceitável de qualidade.

Atividades

Dois investigadores distintos, com o mesmo tema e critérios de inclusão sobre o efeito da difusão tecnológica no crescimento e produtividade do Reino Unido, produziram de forma independente uma revisão rápida de evidência — um trabalhando inteiramente à mão, o outro utilizando uma combinação de ferramentas de IA (incluindo Elicit, Consensus, Claude 2 e ChatGPT-4), complementada por verificação e edição manuais.

Resultados

A revisão assistida por IA foi concluída em 90,5 horas, face a 117,75 horas na revisão apenas humana, uma poupança global de 23% no tempo, com a maior diferença na fase de análise da literatura (15 horas contra 34 horas, uma redução de 56%). No entanto, o rascunho assistido por IA foi considerado menos fluente e exigiu mais revisão, e as duas revisões tiveram uma sobreposição surpreendentemente reduzida nas fontes citadas, apenas 4 referências partilhadas de cerca de 30 fontes consideradas credíveis em ambas.

Conclusões

O BIT e os departamentos que encomendaram o estudo concluíram que a IA generativa consegue acelerar de forma significativa as revisões rápidas de evidência, mas continua a produzir erros que exigem verificação manual e pode levar os revisores para conjuntos de evidência distintos; recomendaram mais trabalho antes de uma adoção mais alargada, em vez de considerar o resultado um mandato para automatizar as revisões de evidência.

Implementação

Custo indicativo
Baixo (< 50 mil €)
Tempo até resultados
Curto (< 1 ano) — The comparison was conducted in 2024 as a one-off matched study, not an ongoing deployed practice.
Equipa e competências
Two independent researchers (one AI-assisted, one human-only), Behavioural Insights Team (BIT) as delivery and evaluation body, Department for Science, Innovation and Technology (DSIT) and Department for Digital, Culture, Media and Sport (DCMS) as commissioning departments

Condições de sucesso

  • Identical brief and inclusion criteria given to both reviewers to enable a fair comparison
  • Manual checking and editing of AI outputs rather than trusting them directly
  • Combining multiple AI tools (Elicit, Consensus, Claude 2, ChatGPT-4) rather than relying on a single tool

Modos de falha comuns

  • The AI-assisted draft was judged less fluent and needed more revision than the human-only draft.
  • The two reviews shared only 4 of roughly 30 credible sources, showing AI assistance can steer reviewers toward a different evidence base.
  • The authors recommend further work before wider adoption rather than treating this as a mandate to automate evidence reviews.

Onde se enquadra

Tipo de governação
national government department, delivered via commissioned external evaluation
Escala
single matched study
Nível de rendimento
high-income

Habitualmente financiado por

National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Kit de replicação

Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis