evidoria

← Voltar à navegação

Boa prática Importada

O Anonimizador Automático de Decisões Judiciais do RIK — a Ferramenta de ML da Estónia para Ocultar Dados Pessoais em Quase 80 Mil Sentenças

Estónia · Tallinn · Ver o perfil de Estónia · Ver o perfil de Tallinn

Evidência: Descritivo / autorreportado Top 15% 80/100 · Pergunte a Evidence Copilot sobre esta prática

O RIK da Estónia, com a empresa TEXTA, criou uma ferramenta de NER que oculta automaticamente nomes, IDs e moradas em decisões judiciais — usada para anonimizar e republicar quase 80 mil decisões históricas, sem auditoria de precisão independente pública.

nearly 80,000
Decisões judiciais históricas anonimizadas e republicadas
+99 %
Nomes pessoais adicionais identificados face à referência EstNER
~3x
Nomes de organizações adicionais identificados face à referência EstNER
O Anonimizador Automático de Decisões Judiciais do RIK — a Ferramenta de ML da Estónia para Ocultar Dados Pessoais em Quase 80 Mil Sentenças

Detalhes

Maturidade
Consolidada
Promotor
Centre of Registers and Information Systems (RIK), Estonian Ministry of Justice and Digital Affairs, with TEXTA OÜ
Período
2022–2026
Região (NUTS)
EE001
Palavras-chave
justice, data protection, natural language processing, court administration

Contexto

As decisões dos tribunais estonianos têm de ter os dados pessoais removidos antes de serem publicadas no Sistema de Informação dos Tribunais, de acesso público, mas a redação manual de acórdãos longos — alguns com mais de 50 páginas, contendo vários nomes, números de identificação, datas de nascimento, moradas, números de telefone, IBANs e endereços de email — é lenta e sujeita a erros. O Centro de Registos e Sistemas de Informação (RIK), a agência governamental de TI sob o Ministério da Justiça e Assuntos Digitais da Estónia, contratou a empresa de tecnologia linguística TEXTA OÜ para automatizar o processo.

Atividades

A TEXTA construiu um pipeline híbrido que combina um modelo estatístico de Campos Aleatórios Condicionais, um modelo neuronal de reconhecimento de entidades nomeadas Stanford Stanza, e extratores baseados em regras (regex) para identificadores estruturados como emails, IBANs e números de identificação, treinado num corpus de textos judiciais estonianos anotado à medida. O RIK utilizou a ferramenta para anonimizar e republicar quase 80.000 decisões judiciais históricas no Sistema de Informação dos Tribunais, um volume acumulado que seria impraticável de eliminar manualmente.

Resultados

No seu próprio teste comparativo, o modelo resultante da TEXTA identificou 99% mais nomes pessoais e cerca de três vezes mais nomes de organizações do que o modelo de código aberto EstNER, já existente na Estónia, no mesmo conjunto de dados de processos judiciais. Em janeiro de 2026, o Portal Europa Interoperável da Comissão Europeia destacou a ferramenta na sua coleção Justice & AI Toolbox como uma boa prática reutilizável para outros Estados-Membros da UE que construam sistemas semelhantes de transparência judicial.

Conclusões

Não foi publicada pelo RIK, pela TEXTA ou pelo Ministério nenhuma auditoria de precisão independente e de terceiros do modelo de anonimização — que cobrisse, por exemplo, a sua taxa de falhas em formatos de nomes raros ou em documentos com formatação não padronizada —, e os valores de precisão/exaustividade reportados provêm do teste comparativo interno da própria TEXTA, e não de uma avaliação ordenada por um tribunal, pelo que o risco residual de um dado pessoal não redigido escapar para uma decisão publicada não está quantificado de forma independente.

Implementação

Custo indicativo
Médio (50 mil–500 mil €) — Costs are not itemised in the source; the work was commissioned from an external vendor (TEXTA OÜ) rather than built in-house, implying a contracted-services cost, but no figure is disclosed.
Tempo até resultados
Médio (1–3 anos) — Developed and deployed 2022-2026, used to clear a nearly 80,000-document historic backlog and featured by the European Commission in January 2026.
Equipa e competências
Centre of Registers and Information Systems (RIK), Estonian Ministry of Justice and Digital Affairs (commissioning agency), TEXTA OÜ (language-technology vendor and model developer)

Condições de sucesso

  • Hybrid modelling approach (CRF + neural NER + rule-based regex) tuned to the specific structured identifiers found in Estonian court texts
  • Custom-annotated training corpus of Estonian court documents rather than a generic off-the-shelf model
  • Statutory obligation to anonymise decisions before publication, giving a clear mandate and use case

Modos de falha comuns

  • No independent third-party accuracy audit has been published; reported performance comes only from the vendor's own internal benchmark
  • Miss rate on rare name formats or non-standard document layouts is not quantified

Onde se enquadra

Tipo de governação
national government IT agency (RIK) with external vendor
Escala
national (Estonian court system)
Nível de rendimento
high-income

Habitualmente financiado por

National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis