evidoria

← Voltar à navegação

Boa prática Importada

Modelo de Aprendizagem Automática da STT para Fraude e Corrupção na Contratação Pública

Lituânia · Vilnius · Ver o perfil de Lituânia · Ver o perfil de Vilnius

Evidência: Observacional / pré-pós Top 22% 73/100 · Pergunte a Evidence Copilot sobre esta prática

A STT lituana, com a OCDE e o Government Transparency Institute (financiado pela UE), construiu uma Random Forest de Distância de Hellinger sobre 11 conjuntos de dados. O quartil de contratos de maior risco captou 60% dos casos criminais conhecidos, face a 25% ao acaso.

60 %
Contracts with proven/suspected offences captured in top-risk quartile
25 %
Expected capture rate under random selection
about 5x
Known-case capture multiplier in top decile vs chance
11
Administrative datasets integrated into the analytical database
Modelo de Aprendizagem Automática da STT para Fraude e Corrupção na Contratação Pública

Detalhes

Maturidade
Piloto
Promotor
Special Investigation Service of the Republic of Lithuania (STT)
Período
2024–2025
Região (NUTS)
LT01
Palavras-chave
anti-corruption, public procurement, law-enforcement analytics

Contexto

O Serviço de Investigação Especial da Lituânia (STT) colaborou com a OCDE e o Government Transparency Institute, financiado pelo Instrumento de Apoio Técnico da Comissão Europeia, para construir uma ferramenta de avaliação de risco baseada em aprendizagem automática para os contratos públicos. A equipa integrou onze conjuntos de dados administrativos — abrangendo infrações penais e administrativas, registos de empresas, titularidade efetiva, listas negras e dados de projetos financiados pela UE — numa única base de dados analítica, reestruturando os registos de contratação de nível de concurso para nível de lote para captar a dinâmica das propostas.

Objetivos

O objetivo era ajudar os analistas do STT a priorizar a atenção investigativa nos contratos públicos com maior probabilidade de envolver fraude ou corrupção, mantendo cada previsão explicável para que oriente o julgamento do investigador em vez de o substituir.

Atividades

Como apenas uma pequena parte dos contratos está associada a infrações confirmadas, a equipa utilizou uma Random Forest Estratificada por Distância de Hellinger, um método concebido para aprendizagem Positiva-Não-Rotulada e desequilíbrio severo de classes. Cada previsão é acompanhada de valores SHAP (SHapley Additive exPlanations) num painel interativo, permitindo aos analistas identificar quais fatores — padrões de licitação, concentração de titularidade, posição na rede — determinaram a pontuação de risco de um contrato.

Resultados

Em testes retrospetivos, concentrar a atenção investigativa no quartil de 25% de contratos com maior risco previsto captou cerca de 60% dos contratos associados a infrações penais provadas ou suspeitas, face aos 25% esperados por seleção aleatória, e o decil superior captou cerca de cinco vezes mais casos conhecidos do que o acaso.

Conclusões

O estudo de caso publicado pela OCDE é explícito ao afirmar que se trata de uma prova de conceito, e não de um sistema operacional: recomenda uma fase inicial de atualizações anuais apoiada por um pipeline de dados estável antes de uma implementação mais ampla, e sublinha que a ferramenta se destina a orientar o julgamento dos investigadores, não a substituí-lo.

Implementação

Custo indicativo
Médio (50 mil–500 mil €) — No published budget figure; the work was delivered as technical assistance funded by the European Commission's Technical Support Instrument, with OECD and Government Transparency Institute expertise rather than a large capital build.
Tempo até resultados
Curto (< 1 ano) — Developed during 2024–2025 as a proof-of-concept; the OECD recommends an initial phase of annual model updates on a stable data pipeline before any wider operational rollout.
Equipa e competências
STT (Special Investigation Service of Lithuania) analysts using the SHAP dashboard, OECD technical-assistance team, Government Transparency Institute researchers

Condições de sucesso

  • integration of eleven administrative datasets into a single analytical database
  • a Positive-Unlabelled learning method (Hellinger Distance Stratified Random Forest) suited to severe class imbalance in offence labels
  • SHAP-based explainability so investigators can trace and trust individual risk scores
  • a stable, regularly-updated data pipeline before wider operational deployment

Modos de falha comuns

  • remains a proof-of-concept without the annual-update data pipeline the OECD recommends before operational use
  • only a small share of contracts carry confirmed offence labels, limiting how confidently the model generalises.

Onde se enquadra

Tipo de governação
national anti-corruption/law-enforcement agency
Escala
national
Nível de rendimento
high-income

Kit de replicação

Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis