evidoria

← Retour à la liste

Bonne pratique Importée

JudgeGPT — un essai randomisé national d'IA générative pour les juges de première instance du Pakistan

Pakistan · Lahore · Voir le profil de Pakistan · Voir le profil de Lahore

Preuves: Essai contrôlé randomisé Top 15% 80/100 · Demandez à Evidence Copilot à propos de cette pratique

Un essai randomisé a donné à ~1 559 juges pakistanais (moitié de la magistrature) l'accès à JudgeGPT, outil GPT-4 interrogeant 129 235 décisions et lois. Districts avec juges formés : 6,3 % de dossiers en plus, décisions meilleures dans 59 % des cas, sans hausse des biais.

1559
Juges couverts par l'essai
118
Tribunaux couverts
129235 documents (128,292 rulings + 943 laws)
Documents dans la base de récupération
6,3 %
Augmentation des affaires résolues
1848
Affaires supplémentaires résolues par an
616
Affaires supplémentaires résolues dans le quartile le moins performant
59 % of pairwise comparisons
Décisions jugées meilleures (juges formés) (vs 42% baseline)
42 %
Part de référence des décisions jugées meilleures
10-38.50 $ per $ invested (authors' estimate)
Retour sur investissement estimé
2,26 million
Affaires en attente dans les tribunaux de première instance du Pakistan (end of 2024)

Détails

Maturité
Pilote
Promoteur
Pakistan trial court judiciary, with ETH Zurich, Imperial College London and the New Economic School
Période
2025–2026
Mots-clés
judiciary, case backlog, generative AI, legal research

Contexte

Les tribunaux de première instance du Pakistan comptaient 2,26 millions d'affaires en attente fin 2024, avec moins de deux juges pour 100 000 habitants, contre 22 dans l'UE, ce qui a conduit des chercheurs de l'ETH Zurich, de l'Imperial College London et de la New Economic School à construire JudgeGPT, un assistant basé sur GPT-4 à génération augmentée par récupération, s'appuyant sur 129 235 documents (128 292 décisions judiciaires et 943 lois pakistanaises).

Objectifs

L'équipe a conçu un essai contrôlé randomisé portant sur 1 559 juges répartis dans 118 tribunaux - soit environ la moitié des juges de première instance du Pakistan - assignés aléatoirement à un bras JudgeGPT avec formation ciblée, un bras JudgeGPT avec seminaire général uniquement, et un bras témoin avec séminaire seul.

Activités

Les juges formés ont utilisé l'outil de façon beaucoup plus intensive que les bras de comparaison, enregistrant environ 60 connexions et plus de 200 requêtes chacun, contre environ 20 connexions et moins de 50 requêtes dans les autres bras.

Résultats

Au cours des 40 semaines suivant l'intervention, les districts comptant davantage de juges formés ont résolu environ 1 848 affaires supplémentaires par an - une hausse de 6,3 % - l'effet le plus marqué, environ 616 affaires supplémentaires, étant observé dans le quartile des districts les moins performants ; des évaluations de qualité en aveugle ont jugé les décisions des juges formés meilleures dans 59 % des comparaisons par paires, contre une référence de 42 %, et l'étude n'a trouvé aucune preuve que l'assistance de l'IA ait accru le biais de genre ou religieux dans le langage judiciaire.

Conclusions

La propre estimation coûts-bénéfices de l'équipe de recherche évalue les retours à environ 10 à 38,50 dollars par dollar investi, bien que ce chiffre provienne des auteurs de l'étude eux-mêmes plutôt que d'un audit gouvernemental indépendant, et le programme demeure un essai de recherche à grande échelle plutôt qu'une institution permanente codifiée, la Cour suprême du Pakistan signalant une ouverture à un usage judiciaire plus large de l'IA tout en soulignant l'absence d'un cadre juridique complet la régissant.

Mise en œuvre

Coût indicatif
Élevé (500 k€–5 M€)
Délai jusqu’aux résultats
Moyen (1–3 ans)
Personnel et compétences
A research team from ETH Zurich, Imperial College London and the New Economic School worked directly with Pakistan's trial-court judiciary to design and run the trial.

Conditions de réussite

  • Judges in the training arm received targeted training rather than only a general seminar, driving far higher tool usage (about 60 logins and 200+ prompts vs ~20 logins and under 50 prompts).
  • A randomised trial design across a large share of the national judiciary allowed a causal comparison between arms.

Modes d’échec courants

  • The programme remains a research trial rather than a codified permanent institution.
  • Pakistan lacks a comprehensive legal framework governing judicial AI use, per the Supreme Court's own comments.
  • The cited $10-38.50 per dollar return is the research team's own estimate, not an independently audited figure.

Kit de réplication

Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pratiques similaires qui pourraient vous être utiles