evidoria

← Volver al listado

Buena práctica Importada

Gender Shades: la auditoría del MIT que obligó a Amazon, IBM y Microsoft a enfrentar la brecha de género en el reconocimiento facial

Estados Unidos · Cambridge · Ver el perfil de Estados Unidos · Ver el perfil de Cambridge

Evidencia: Descriptivo / autodeclarado Top 18% 89/100 · Pregunte a Evidence Copilot sobre esta práctica

La auditoría 'Gender Shades' del MIT (2018) halló errores de género de hasta 34,7% en mujeres de piel más oscura, frente a menos del 1% en hombres de piel más clara, evidencia citada cuando Amazon suspendió el uso policial de Rekognition e IBM abandonó el reconocimiento facial.

34.7 %
Tasa de error de clasificación de género, mujeres de piel más oscura (sistema con mayor error) (2018)
<1 %
Tasa de error de clasificación de género, hombres de piel más clara (2018)
31 %
Tasa de error de clasificación de género de Amazon Rekognition, mujeres de piel más oscura (2019)
0 %
Tasa de error de clasificación de género de Amazon Rekognition, hombres de piel más clara (2019)

Detalles

Promotor
MIT Media Lab; Amazon; IBM
Período
2018-2020
Palabras clave
AI governance, facial recognition, policing, corporate policy

Contexto

En febrero de 2018, los investigadores del MIT Media Lab Joy Buolamwini y Timnit Gebru publicaron "Gender Shades", una auditoría revisada por pares (Proceedings of Machine Learning Research, FAT* 2018) de tres sistemas comerciales de clasificación de género: IBM, Microsoft y Face++.

Objetivos

Cuantificar con qué precisión los sistemas comerciales de análisis facial clasifican el género en distintos tonos de piel, utilizando un conjunto de datos de referencia diseñado y equilibrado, con parlamentarios de tres países africanos y tres países europeos.

Actividades

La auditoría evaluó los sistemas de IBM, Microsoft y Face++ en el conjunto de datos equilibrado. Una auditoría de seguimiento en 2019, de Deborah Raji y Buolamwini, "Actionable Auditing", puso a prueba específicamente el Rekognition de Amazon.

Resultados

Los tres sistemas rindieron mucho peor con mujeres de piel más oscura que con hombres de piel más clara: las tasas de error para mujeres de piel más oscura llegaron hasta el 34,7%, frente a tasas de error inferiores al 1% para hombres de piel más clara. La auditoría de seguimiento de 2019 encontró que Rekognition de Amazon clasificaba incorrectamente el género de mujeres de piel más oscura en aproximadamente el 31% de los casos, frente al 0% en hombres de piel más clara. En junio de 2020, IBM anunció que dejaría de fabricar productos de reconocimiento facial de uso general, Amazon anunció una moratoria de un año sobre el uso policial de Rekognition (desde entonces prorrogada indefinidamente), y Microsoft suspendió la venta de su tecnología de reconocimiento facial a departamentos de policía de EE. UU. a la espera de una regulación federal.

Conclusiones

Dado que los cambios de política empresarial coincidieron con protestas masivas por cuestiones de justicia racial más amplias que esta auditoría concreta, no es posible aislar con claridad el peso causal de la investigación frente a la presión pública más general. Aun así, la auditoría es citada repetida y explícitamente por las propias empresas y por la prensa independiente como un desencadenante probatorio directo, y sigue siendo el relato más rigurosamente cuantificado del sesgo de clasificación de género en la IA comercial.

Implementación

Coste indicativo
Bajo (< 50 000 €) — An academic research audit; no implementation or programme costs are reported.
Tiempo hasta resultados
Corto (< 1 año) — Initial audit published February 2018; follow-up audit 2019; corporate responses (IBM's exit, Amazon's moratorium, Microsoft's pause) followed through 2020.
Personal y competencias
MIT Media Lab researchers (Joy Buolamwini, Timnit Gebru; 2019 follow-up with Deborah Raji)

Condiciones para el éxito

  • A purpose-built, phenotype- and gender-balanced benchmark dataset of parliamentarians from three African and three European countries
  • Independent peer review (FAT* 2018) that gave the findings credibility later cited directly by the audited vendors and by independent press

Modos de fallo comunes

  • Corporate policy responses coincided with the 2020 George Floyd protests, so the audit's own causal share of those changes cannot be cleanly isolated from broader public pressure

Habitualmente financiado por

Philanthropic / foundation funding National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

Kit de replicación

Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles