evidoria

← Retour à la liste

Bonne pratique Importée

Gender Shades : l'audit du MIT qui a forcé Amazon, IBM et Microsoft à affronter le fossé de genre dans la reconnaissance faciale

États-Unis d'Amérique · Cambridge · Voir le profil de États-Unis d'Amérique · Voir le profil de Cambridge

Preuves: Descriptif / auto-déclaré Top 18% 89/100 · Demandez à Evidence Copilot à propos de cette pratique

L'audit « Gender Shades » du MIT (2018) a révélé un taux d'erreur de genre allant jusqu'à 34,7 % pour les femmes à la peau plus foncée, contre moins de 1 % pour les hommes à la peau plus claire — preuve citée quand Amazon a suspendu l'usage policier de Rekognition et IBM a abandonné la reconnaissance faciale.

34.7 %
Taux d'erreur de classification du genre, femmes à la peau plus foncée (système le moins précis) (2018)
<1 %
Taux d'erreur de classification du genre, hommes à la peau plus claire (2018)
31 %
Taux d'erreur de classification du genre d'Amazon Rekognition, femmes à la peau plus foncée (2019)
0 %
Taux d'erreur de classification du genre d'Amazon Rekognition, hommes à la peau plus claire (2019)

Détails

Promoteur
MIT Media Lab; Amazon; IBM
Période
2018-2020
Mots-clés
AI governance, facial recognition, policing, corporate policy

Contexte

En février 2018, les chercheurs du MIT Media Lab Joy Buolamwini et Timnit Gebru ont publié « Gender Shades », un audit évalué par des pairs (Proceedings of Machine Learning Research, FAT* 2018) portant sur trois systèmes commerciaux de classification du genre : IBM, Microsoft et Face++.

Objectifs

Quantifier la précision avec laquelle les systèmes commerciaux d'analyse faciale classent le genre selon les différentes teintes de peau, à l'aide d'un jeu de données de référence spécialement équilibré, composé de parlementaires de trois pays africains et trois pays européens.

Activités

L'audit a évalué les systèmes d'IBM, Microsoft et Face++ sur ce jeu de données équilibré. Un audit de suivi en 2019, mené par Deborah Raji et Buolamwini, « Actionable Auditing », a spécifiquement testé Rekognition d'Amazon.

Résultats

Les trois systèmes ont obtenu des résultats bien pires pour les femmes à la peau plus foncée que pour les hommes à la peau plus claire : les taux d'erreur pour les femmes à la peau plus foncée ont atteint jusqu'à 34,7 %, contre des taux d'erreur inférieurs à 1 % pour les hommes à la peau plus claire. L'audit de suivi de 2019 a constaté que Rekognition d'Amazon classait incorrectement le genre des femmes à la peau plus foncée dans environ 31 % des cas, contre 0 % pour les hommes à la peau plus claire. En juin 2020, IBM a annoncé qu'elle abandonnerait ses produits de reconnaissance faciale à usage général, Amazon a annoncé un moratoire d'un an sur l'utilisation de Rekognition par la police (depuis prolongé indéfiniment), et Microsoft a suspendu la vente de sa technologie de reconnaissance faciale aux services de police américains en attendant une réglementation fédérale.

Conclusions

Les changements de politique des entreprises ayant coïncidé avec des manifestations de masse sur des questions de justice raciale plus larges que cet audit spécifique, il n'est pas possible d'isoler clairement la part causale de la recherche par rapport à la pression publique plus générale. L'audit n'en est pas moins régulièrement et explicitement cité par les entreprises et la presse indépendante comme un déclencheur factuel direct, et il demeure le compte rendu le plus rigoureusement quantifié du biais de classification du genre dans l'IA commerciale.

Mise en œuvre

Coût indicatif
Faible (< 50 k€) — An academic research audit; no implementation or programme costs are reported.
Délai jusqu’aux résultats
Court (< 1 an) — Initial audit published February 2018; follow-up audit 2019; corporate responses (IBM's exit, Amazon's moratorium, Microsoft's pause) followed through 2020.
Personnel et compétences
MIT Media Lab researchers (Joy Buolamwini, Timnit Gebru; 2019 follow-up with Deborah Raji)

Conditions de réussite

  • A purpose-built, phenotype- and gender-balanced benchmark dataset of parliamentarians from three African and three European countries
  • Independent peer review (FAT* 2018) that gave the findings credibility later cited directly by the audited vendors and by independent press

Modes d’échec courants

  • Corporate policy responses coincided with the 2020 George Floyd protests, so the audit's own causal share of those changes cannot be cleanly isolated from broader public pressure

Habituellement financé par

Philanthropic / foundation funding National / regional programmes

Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.

Kit de réplication

Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles