evidoria

← Volver al listado

Buena práctica Importada

El anonimizador automático de resoluciones judiciales del RIK — la herramienta de ML de Estonia para ocultar datos personales en casi 80.000 sentencias

Estonia · Tallinn · Ver el perfil de Estonia · Ver el perfil de Tallinn

Evidencia: Descriptivo / autodeclarado Top 15% 80/100 · Pregunte a Evidence Copilot sobre esta práctica

El RIK de Estonia, con la empresa TEXTA, creó una herramienta de NER que oculta nombres, IDs y direcciones en resoluciones judiciales — usada para anonimizar y republicar casi 80.000 decisiones históricas, sin auditoría de precisión independiente pública.

nearly 80,000
Resoluciones judiciales históricas anonimizadas y republicadas
+99 %
Nombres de personas adicionales identificados frente a la referencia EstNER
~3x
Nombres de organizaciones adicionales identificados frente a la referencia EstNER
El anonimizador automático de resoluciones judiciales del RIK — la herramienta de ML de Estonia para ocultar datos personales en casi 80.000 sentencias

Detalles

Madurez
Consolidada
Promotor
Centre of Registers and Information Systems (RIK), Estonian Ministry of Justice and Digital Affairs, with TEXTA OÜ
Período
2022–2026
Región (NUTS)
EE001
Palabras clave
justice, data protection, natural language processing, court administration

Contexto

Las resoluciones de los tribunales estonios deben tener los datos personales eliminados antes de publicarse en el Sistema de Información Judicial público, pero redactar manualmente sentencias largas —algunas de más de 50 páginas, con múltiples nombres, códigos de identificación, fechas de nacimiento, direcciones, números de teléfono, IBAN y direcciones de correo electrónico— es lento y propenso a errores. El Centro de Registros y Sistemas de Información (RIK), la agencia gubernamental de TI adscrita al Ministerio de Justicia y Asuntos Digitales de Estonia, encargó a la empresa de tecnología lingüística TEXTA OÜ automatizar el proceso.

Actividades

TEXTA construyó un flujo híbrido que combina un modelo estadístico de Campos Aleatorios Condicionales, un modelo neuronal de reconocimiento de entidades nombradas Stanford Stanza, y extractores basados en reglas (regex) para identificadores estructurados como correos electrónicos, IBAN y códigos de identificación, entrenado con un corpus de textos judiciales estonios anotado a medida. El RIK utilizó la herramienta para anonimizar y republicar cerca de 80.000 resoluciones judiciales históricas en el Sistema de Información Judicial, un atraso acumulado que habría sido inviable resolver manualmente.

Resultados

En su propia prueba comparativa, el modelo resultante de TEXTA etiquetó un 99% más de nombres de personas y aproximadamente el triple de nombres de organizaciones que el modelo de código abierto EstNER ya existente en Estonia, sobre el mismo conjunto de datos de causas judiciales. En enero de 2026, el Portal Europa Interoperable de la Comisión Europea destacó la herramienta en su colección Justice & AI Toolbox como buena práctica reutilizable para otros Estados miembros de la UE que construyan sistemas similares de transparencia judicial.

Conclusiones

Ni el RIK, ni TEXTA, ni el Ministerio han publicado una auditoría de precisión independiente y externa del modelo de anonimización —que cubra, por ejemplo, su tasa de fallos en formatos de nombres poco habituales o en documentos con formato no estándar—, y las cifras de precisión/exhaustividad reportadas provienen únicamente de la prueba comparativa interna de TEXTA, no de una evaluación ordenada judicialmente, por lo que el riesgo residual de que un dato personal no redactado aparezca en una resolución publicada no está cuantificado de forma independiente.

Implementación

Coste indicativo
Medio (50 000–500 000 €) — Costs are not itemised in the source; the work was commissioned from an external vendor (TEXTA OÜ) rather than built in-house, implying a contracted-services cost, but no figure is disclosed.
Tiempo hasta resultados
Medio (1–3 años) — Developed and deployed 2022-2026, used to clear a nearly 80,000-document historic backlog and featured by the European Commission in January 2026.
Personal y competencias
Centre of Registers and Information Systems (RIK), Estonian Ministry of Justice and Digital Affairs (commissioning agency), TEXTA OÜ (language-technology vendor and model developer)

Condiciones para el éxito

  • Hybrid modelling approach (CRF + neural NER + rule-based regex) tuned to the specific structured identifiers found in Estonian court texts
  • Custom-annotated training corpus of Estonian court documents rather than a generic off-the-shelf model
  • Statutory obligation to anonymise decisions before publication, giving a clear mandate and use case

Modos de fallo comunes

  • No independent third-party accuracy audit has been published; reported performance comes only from the vendor's own internal benchmark
  • Miss rate on rare name formats or non-standard document layouts is not quantified

Dónde encaja

Tipo de gobernanza
national government IT agency (RIK) with external vendor
Escala
national (Estonian court system)
Nivel de ingresos
high-income

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles