evidoria

← Voltar à navegação

Boa prática Importada

Harmonizando 4,1 Milhões de Registos Fiscais Multilingues — O Pipeline de Agrupamento por PLN da Autoridade Tributária do Ruanda

Ruanda · Kigali · Ver o perfil de Ruanda · Ver o perfil de Kigali

Evidência: Descritivo / autorreportado Top 50% 60/100 · Pergunte a Evidence Copilot sobre esta prática

Um estudo com dados da Autoridade Tributária do Ruanda usou MiniLM, UMAP e HDBSCAN para harmonizar 4,1 milhões de nomes de produtos multilingues de registos fiscais EBM em 425.103 nomes padronizados, revelando anomalias de preços.

4,124,005
Registos de EBM e alfândegas processados (FY2020-2022)
425,103
Nomes de produtos padronizados produzidos
6,295
Clusters HDBSCAN detalhados produzidos
167,085
Registos assinalados como ruído (erros/rótulos raros)
73.8 %
Registos de nomes de produtos não ingleses no conjunto de dados

Detalhes

Maturidade
Piloto
Promotor
Rwanda Revenue Authority (Strategy and Risk Analysis Department), research by Adventist University of Central Africa
Período
2020–2025
Palavras-chave
tax administration, customs, fraud detection

Contexto

Desde 2013, a Autoridade Tributária do Ruanda (RRA) tem digitalizado a faturação através de Máquinas de Faturação Eletrónica (EBMs), alcançando dados estruturados ao nível do item com o EBM v2.0/2.1. Mas a introdução manual e multilingue de nomes de produtos — 'açúcar' registado indistintamente como sucre, isukari ou sukari — deixava os registos inconsistentes e difíceis de analisar para deteção de fraude.

Objetivos

Harmonizar nomes de produtos multilingues e introduzidos de forma inconsistente em categorias padronizadas, para que produtos idênticos possam ser comparados entre línguas para análise de preços e fraude.

Atividades

Um estudo de 2025 realizado com o Departamento de Estratégia e Análise de Risco da RRA, que forneceu conjuntos de dados e apoio técnico, construiu um pipeline de limpeza de texto, deteção e tradução de idioma, embeddings de frases MiniLM, redução de dimensionalidade PCA/UMAP, e clustering KMeans e HDBSCAN, processando 4.124.005 registos de EBM e alfândegas (Janela Única Eletrónica) do EF2020-2022, dos quais 73,8% não estavam em inglês (kinyarwanda, francês ou suaíli).

Resultados

O pipeline produziu 425.103 nomes de produtos padronizados, 20 categorias amplas KMeans e 6.295 clusters detalhados HDBSCAN (mais 167.085 pontos assinalados como ruído, como erros ortográficos e rótulos raros). Agrupar produtos idênticos entre línguas permitiu aos investigadores comparar os valores de importação/compra com os preços de venda do mesmo item, revelando discrepâncias de preços reais — por exemplo, um cluster de 'papel a3' variando entre 1.000 e 15.000 francos ruandeses, consistente com subfaturação ou declaração incorreta.

Conclusões

Trata-se de um estudo de investigação revisto por pares (um projeto de tese de mestrado) construído sobre dados administrativos reais da RRA, e não uma implementação de produção confirmada. Os autores descrevem o design modular do pipeline como escalável para outros setores e línguas dentro dos sistemas de dados governamentais.

Implementação

Custo indicativo
Baixo (< 50 mil €)
Tempo até resultados
Curto (< 1 ano) — Processed FY2020-2022 administrative records; published as a peer-reviewed journal article in 2025.
Equipa e competências
Rwanda Revenue Authority Strategy and Risk Analysis Department (data and technical input), Researcher(s) at Adventist University of Central Africa (MSc thesis project)

Condições de sucesso

  • Access to structured, item-level EBM v2.0/2.1 invoicing data
  • Language detection/translation capability to handle Kinyarwanda, French, Swahili and English product names
  • Modular pipeline design enabling reuse across other product categories and languages

Modos de falha comuns

  • 167,085 records (about 4%) remained unresolved as noise points (typos, rare labels), requiring further cleaning
  • Not yet confirmed as a live production fraud-detection workflow inside RRA

Habitualmente financiado por

National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Kit de replicação

Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis