evidoria

← Voltar à navegação

Boa prática Importada

JudgeGPT — um Ensaio Aleatorizado Nacional de IA Generativa para Juízes de Primeira Instância no Paquistão

Paquistão · Lahore · Ver o perfil de Paquistão · Ver o perfil de Lahore

Evidência: Ensaio controlado aleatorizado Top 15% 80/100 · Pergunte a Evidence Copilot sobre esta prática

Um ensaio aleatorizado deu a cerca de 1559 juízes paquistaneses (metade da magistratura) acesso ao JudgeGPT, ferramenta GPT-4 que pesquisa 129 235 decisões e leis. Distritos com juízes formados resolveram +6,3% de processos, decisões melhores em 59% dos casos, sem mais viés.

1559
Juízes abrangidos pelo ensaio
118
Tribunais abrangidos
129235 documents (128,292 rulings + 943 laws)
Documentos na base de dados de recuperação
6,3 %
Aumento de processos resolvidos
1848
Processos adicionais resolvidos por ano
616
Processos adicionais resolvidos no quartil de pior desempenho
59 % of pairwise comparisons
Decisões classificadas como melhores (juízes formados) (vs 42% baseline)
42 %
Percentagem de referência de decisões classificadas como melhores
10-38.50 $ per $ invested (authors' estimate)
Retorno estimado sobre o investimento
2,26 million
Processos pendentes nos tribunais de primeira instância do Paquistão (end of 2024)

Detalhes

Maturidade
Piloto
Promotor
Pakistan trial court judiciary, with ETH Zurich, Imperial College London and the New Economic School
Período
2025–2026
Palavras-chave
judiciary, case backlog, generative AI, legal research

Contexto

Os tribunais de primeira instância do Paquistão enfrentavam 2,26 milhões de processos pendentes no final de 2024, com menos de dois juízes por 100.000 habitantes, face a 22 na UE, o que levou investigadores da ETH Zurique, do Imperial College London e da New Economic School a construir o JudgeGPT, um assistente baseado em GPT-4 com geração aumentada por recuperação, alimentado por 129.235 documentos (128.292 decisões judiciais e 943 leis paquistanesas).

Objetivos

A equipa concebeu um ensaio controlado e aleatorizado abrangendo 1.559 juízes em 118 tribunais - cerca de metade dos juízes de primeira instância do Paquistão - distribuídos aleatoriamente por um braço com JudgeGPT mais formação direcionada, um braço com JudgeGPT mais um seminário geral, e um braço de controlo apenas com seminário.

Atividades

Os juízes formados utilizaram a ferramenta de forma muito mais intensiva do que os braços de comparação, registando cerca de 60 acessos e mais de 200 pedidos cada, contra cerca de 20 acessos e menos de 50 pedidos nos outros braços.

Resultados

Ao longo das 40 semanas seguintes à intervenção, os distritos com mais juízes formados resolveram cerca de 1.848 processos adicionais por ano - um aumento de 6,3% - com o maior efeito, cerca de 616 processos extra, no quartil de distritos com pior desempenho; avaliações cegas de qualidade classificaram as decisões dos juízes formados como melhores em 59% das comparações emparelhadas, face a uma referência de 42%, e o estudo não encontrou qualquer indício de que a assistência de IA tenha aumentado o enviesamento de género ou religioso na linguagem judicial.

Conclusões

A própria estimativa custo-benefício da equipa de investigação aponta para retornos de cerca de 10 a 38,50 dólares por dólar investido, ainda que esse valor provenha dos próprios autores do estudo e não de uma auditoria governamental independente, e o programa continua a ser um ensaio de investigação em larga escala e não uma instituição permanente codificada, com o Supremo Tribunal do Paquistão a sinalizar abertura a um uso judicial mais alargado da IA, ao mesmo tempo que assinala a ausência de um enquadramento legal abrangente que o regule.

Implementação

Custo indicativo
Elevado (500 mil €–5 M€)
Tempo até resultados
Médio (1–3 anos)
Equipa e competências
A research team from ETH Zurich, Imperial College London and the New Economic School worked directly with Pakistan's trial-court judiciary to design and run the trial.

Condições de sucesso

  • Judges in the training arm received targeted training rather than only a general seminar, driving far higher tool usage (about 60 logins and 200+ prompts vs ~20 logins and under 50 prompts).
  • A randomised trial design across a large share of the national judiciary allowed a causal comparison between arms.

Modos de falha comuns

  • The programme remains a research trial rather than a codified permanent institution.
  • Pakistan lacks a comprehensive legal framework governing judicial AI use, per the Supreme Court's own comments.
  • The cited $10-38.50 per dollar return is the research team's own estimate, not an independently audited figure.

Kit de replicação

Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis