Un ensayo aleatorizado dio a ~1559 jueces paquistaníes (mitad de la judicatura) acceso a JudgeGPT, herramienta GPT-4 que consulta 129 235 sentencias y leyes. Distritos con jueces formados resolvieron 6,3% más casos, sentencias mejores en el 59% de los casos, sin más sesgo.
1559
Jueces cubiertos por el ensayo
118
Tribunales cubiertos
129235 documents (128,292 rulings + 943 laws)
Documentos en la base de datos de recuperación
6,3 %
Aumento de casos resueltos
1848
Casos adicionales resueltos al año
616
Casos adicionales resueltos en el cuartil de peor desempeño
59 % of pairwise comparisons
Sentencias calificadas como mejores (jueces formados) (vs 42% baseline)
42 %
Porcentaje de referencia de sentencias calificadas como mejores
10-38.50 $ per $ invested (authors' estimate)
Retorno de inversión estimado
2,26 million
Casos pendientes en los tribunales de primera instancia de Pakistán (end of 2024)
Detalles
Madurez
Piloto
Promotor
Pakistan trial court judiciary, with ETH Zurich, Imperial College London and the New Economic School
Período
2025–2026
Palabras clave
judiciary, case backlog, generative AI, legal research
Contexto
Los tribunales de primera instancia de Pakistán tenían 2,26 millones de casos pendientes a finales de 2024, con menos de dos jueces por cada 100.000 habitantes frente a 22 en la UE, lo que llevó a investigadores de ETH Zúrich, el Imperial College de Londres y la New Economic School a construir JudgeGPT, un asistente basado en GPT-4 con generación aumentada por recuperación, que se apoya en 129.235 documentos (128.292 sentencias judiciales y 943 leyes pakistaníes).
Objetivos
El equipo diseñó un ensayo controlado aleatorizado que abarcó a 1.559 jueces en 118 tribunales -aproximadamente la mitad de la judicatura de primera instancia de Pakistán- asignados aleatoriamente a un brazo de JudgeGPT con formación específica, un brazo de JudgeGPT con seminario general únicamente, y un brazo de control solo con seminario.
Actividades
Los jueces formados utilizaron la herramienta de forma mucho más intensiva que los brazos de comparación, registrando alrededor de 60 accesos y más de 200 consultas cada uno, frente a unos 20 accesos y menos de 50 consultas en los demás brazos.
Resultados
A lo largo de las 40 semanas posteriores a la intervención, los distritos con más jueces formados resolvieron unos 1.848 casos adicionales al año -un aumento del 6,3%-, con el mayor efecto, unos 616 casos adicionales, en el cuartil de distritos con peor desempeño; las evaluaciones ciegas de calidad calificaron las sentencias de los jueces formados como mejores en el 59% de las comparaciones por pares, frente a una referencia del 42%, y el estudio no encontró evidencia de que la asistencia de IA aumentara el sesgo de género o religioso en el lenguaje judicial.
Conclusiones
La propia estimación de costo-beneficio del equipo de investigación sitúa los retornos en torno a 10-38,50 dólares por cada dólar invertido, aunque esa cifra proviene de los propios autores del estudio y no de una auditoría gubernamental independiente, y el programa sigue siendo un ensayo de investigación a gran escala en lugar de una institución permanente codificada, con la Corte Suprema de Pakistán señalando apertura a un uso judicial más amplio de la IA mientras señala la ausencia de un marco legal integral que lo regule.
Implementación
Coste indicativo
Alto (500 000 €–5 M€)
Tiempo hasta resultados
Medio (1–3 años)
Personal y competencias
A research team from ETH Zurich, Imperial College London and the New Economic School worked directly with Pakistan's trial-court judiciary to design and run the trial.
Condiciones para el éxito
Judges in the training arm received targeted training rather than only a general seminar, driving far higher tool usage (about 60 logins and 200+ prompts vs ~20 logins and under 50 prompts).
A randomised trial design across a large share of the national judiciary allowed a causal comparison between arms.
Modos de fallo comunes
The programme remains a research trial rather than a codified permanent institution.
Pakistan lacks a comprehensive legal framework governing judicial AI use, per the Supreme Court's own comments.
The cited $10-38.50 per dollar return is the research team's own estimate, not an independently audited figure.
Kit de replicación
Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.