O Ministério da Justiça da Finlândia, com a Universidade de Helsínquia, a Universidade de Aalto e a Statistics Finland, construiu o Anoppi — uma ferramenta de tecnologia da linguagem de código aberto que pseudonimiza automaticamente nomes e dados pessoais em decisões judiciais e administrativas antes de serem publicadas como dados abertos.
Detalhes
Promotor
Finnish Ministry of Justice, with the University of Helsinki (HELDIG), Aalto University and Statistics Finland
Período
2018–2020 (project); tool remains available as open-source software
Palavras-chave
justice, data protection, open data, public administration
Descrição
Ao abrigo das obrigações do RGPD na Finlândia, as decisões judiciais e outras decisões oficiais que as autoridades publicam para investigação e escrutínio público têm primeiro de ter os dados pessoais removidos — tradicionalmente uma tarefa de redação manual e lenta. O projeto Anoppi (2018–2020), liderado pelo Ministério da Justiça com o Helsinki Centre for Digital Humanities da Universidade de Helsínquia, o Semantic Computing Research Group da Universidade de Aalto, a Statistics Finland e a editora Edita, construiu uma ferramenta de tecnologia da linguagem para automatizar esta tarefa em documentos em língua finlandesa. O Anoppi combina reconhecimento de entidades nomeadas estatístico e baseado em regras com análise morfológica para detetar e substituir nomes e outros identificadores por marcadores neutros (por exemplo, "Pessoa A"), preservando a estrutura e a legibilidade do documento, sendo disponibilizado tanto como aplicação web como através de uma API REST. Foi demonstrado publicamente na conferência sobre IA do Conselho da Europa em Helsínquia, em fevereiro de 2019, e publicado como código de código aberto para que outras autoridades o pudessem reutilizar para além das decisões judiciais. A avaliação, revista por pares, do próprio projeto concluiu que o Anoppi "tem um bom desempenho com diferentes tipos de documentos", mas assinalou que o seu reconhecimento de entidades nomeadas e a desambiguação ainda produzem erros, e que "melhorar ainda mais... aumentaria a utilidade do software" — um reconhecimento honesto de que a pseudonimização automática ainda não está isenta de erros, pelo que quem utiliza a ferramenta deve manter revisão humana no processo para documentos altamente sensíveis.
Implementação
Os detalhes de implementação (custo, prazo, equipa, condições de sucesso) ainda não estão disponíveis para esta prática.
Implementa esta prática?
Reivindique-a —
implementadores verificados obtêm um contacto público na página e podem propor correções.
Fontes de dados
De onde foi obtida a informação desta prática, e quando.