A auditoria 'Gender Shades' do MIT (2018) constatou erros de género até 34,7% em mulheres de pele mais escura, contra menos de 1% em homens de pele mais clara — prova citada quando a Amazon suspendeu o uso policial do Rekognition e a IBM abandonou o reconhecimento facial.
34.7 %
Taxa de erro de classificação de género, mulheres de pele mais escura (sistema com maior erro) (2018)
<1 %
Taxa de erro de classificação de género, homens de pele mais clara (2018)
31 %
Taxa de erro de classificação de género do Amazon Rekognition, mulheres de pele mais escura (2019)
0 %
Taxa de erro de classificação de género do Amazon Rekognition, homens de pele mais clara (2019)
Detalhes
Promotor
MIT Media Lab; Amazon; IBM
Período
2018-2020
Palavras-chave
AI governance, facial recognition, policing, corporate policy
Contexto
Em fevereiro de 2018, os investigadores do MIT Media Lab Joy Buolamwini e Timnit Gebru publicaram "Gender Shades", uma auditoria revista por pares (Proceedings of Machine Learning Research, FAT* 2018) a três sistemas comerciais de classificação de género: IBM, Microsoft e Face++.
Objetivos
Quantificar com que precisão os sistemas comerciais de análise facial classificam o género em diferentes tons de pele, usando um conjunto de dados de referência propositadamente equilibrado, com parlamentares de três países africanos e três países europeus.
Atividades
A auditoria testou os sistemas da IBM, Microsoft e Face++ no conjunto de dados equilibrado. Uma auditoria de seguimento em 2019, de Deborah Raji e Buolamwini, "Actionable Auditing", testou especificamente o Rekognition da Amazon.
Resultados
Os três sistemas tiveram um desempenho muito pior com mulheres de pele mais escura do que com homens de pele mais clara: as taxas de erro para mulheres de pele mais escura atingiram até 34,7%, contra taxas de erro inferiores a 1% para homens de pele mais clara. A auditoria de seguimento de 2019 concluiu que o Rekognition da Amazon classificava incorretamente o género de mulheres de pele mais escura em cerca de 31% dos casos, contra 0% para homens de pele mais clara. Em junho de 2020, a IBM anunciou que descontinuaria os produtos de reconhecimento facial de uso geral, a Amazon anunciou uma moratória de um ano no uso policial do Rekognition (desde então prorrogada indefinidamente), e a Microsoft suspendeu a venda da sua tecnologia de reconhecimento facial a departamentos de polícia dos EUA até haver regulamentação federal.
Conclusões
Como as mudanças de política empresarial coincidiram com protestos em massa sobre questões de justiça racial mais amplas do que esta auditoria específica, não é possível isolar de forma clara o peso causal da investigação face à pressão pública mais alargada. Ainda assim, a auditoria é repetida e explicitamente citada pelas próprias empresas e pela imprensa independente como um gatilho probatório direto, e continua a ser o relato mais rigorosamente quantificado de enviesamento na classificação de género em IA comercial.
Implementação
Custo indicativo
Baixo (< 50 mil €) — An academic research audit; no implementation or programme costs are reported.
Tempo até resultados
Curto (< 1 ano) — Initial audit published February 2018; follow-up audit 2019; corporate responses (IBM's exit, Amazon's moratorium, Microsoft's pause) followed through 2020.
Equipa e competências
MIT Media Lab researchers (Joy Buolamwini, Timnit Gebru; 2019 follow-up with Deborah Raji)
Condições de sucesso
A purpose-built, phenotype- and gender-balanced benchmark dataset of parliamentarians from three African and three European countries
Independent peer review (FAT* 2018) that gave the findings credibility later cited directly by the audited vendors and by independent press
Modos de falha comuns
Corporate policy responses coincided with the 2020 George Floyd protests, so the audit's own causal share of those changes cannot be cleanly isolated from broader public pressure
Habitualmente financiado por
Philanthropic / foundation fundingNational / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Kit de replicação
Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.
O CDEI do governo britânico auditou algoritmos em recrutamento, serviços financeiros, policiamento e administração local; concluiu que ferramentas de recrutamento …
Desde 2006, o Hospital Universitário de Lusaca reúne serviços médicos, policiais, psicossociais e jurídicos para sobreviventes de abuso sexual, elevando …