Perante o prazo de desclassificação aos 25 anos, o Departamento de Estado dos EUA treinou um modelo de IA que decidiu com confiança mais de 60% de 121.536 telegramas diplomáticos em minutos, coincidindo com revisores humanos em 97-99% dos casos.
121536 cables
Telegramas diplomáticos processados na coorte de 1998 (2023)
60 % of cohort (>72,000 cables)
Telegramas decididos com confiança pelo modelo (2023)
97-99 %
Concordância com os revisores humanos no conjunto de validação (2023)
99.29 %
Exatidão nas decisões de desclassificação (relato independente) (2023)
81.43 %
Exatidão nas decisões de retenção (relato independente) (2023)
400000 USD
Custo de desenvolvimento (2022-2023)
47218 cables (39% of cohort)
Telegramas que ainda exigiram revisão manual humana (2023)
Detalhes
Maturidade
Em expansão
Promotor
U.S. Department of State — Office of Information Programs and Services (Declassification Division) / Center for Analytics
Período
2022-2024
Palavras-chave
records management, declassification, government transparency, machine learning, FOIA
Contexto
A Ordem Executiva 13526 exige que as agências do governo dos EUA revejam os registos classificados para desclassificação automática assim que estes completem 25 anos, e o volume de telegramas diplomáticos do Departamento de Estado cresceu cerca de seis vezes desde a década de 1990, tornando a revisão manual integral cada vez mais insustentável.
Objetivos
A partir de outubro de 2022, a Divisão de Desclassificação, o Bureau de Gestão de Recursos de Informação e o Center for Analytics propuseram-se treinar um modelo de aprendizagem automática supervisionada em decisões de desclassificação humanas anteriores, para triar telegramas em categorias de 'desclassificar com confiança', 'manter classificado com confiança' e 'necessita de revisão humana', reduzindo o volume que exige revisão manual completa.
Atividades
O modelo foi treinado com decisões de desclassificação humanas relativas a telegramas de 1995-1997. Após um projeto-piloto bem-sucedido, foi elevado a Programa de pleno direito em 2023 e aplicado à coorte de 1998, com 121.536 telegramas, produzindo uma pontuação de confiança e uma categoria para cada telegrama.
Resultados
O modelo decidiu com confiança mais de 72.000 telegramas (cerca de 60% da coorte) em 20 a 30 minutos de tempo de computação cada, contra cerca de um ano de revisão manual anteriormente. O Departamento de Estado reporta uma concordância de 97-99% com os revisores humanos no conjunto de validação; um relato independente da American Historical Association apresenta valores mais detalhados — 99,29% de exatidão nas decisões de desclassificação face a 81,43% nas decisões de retenção — e um custo de desenvolvimento de cerca de 400.000 dólares. Cerca de 39% dos telegramas (47.218 de 121.536) ainda exigiram revisão manual humana porque o modelo não conseguiu classificá-los com confiança.
Conclusões
O Departamento descreve o modelo como deliberadamente 'sobreprotetor', errando no sentido de reter informação quando há incerteza, e alerta contra a generalização dos resultados a outros tipos de registos sem novo treino; projetos-piloto separados para pesquisa assistida por IA no âmbito da FOIA continuam em fase inicial de testes, sem implementação total.
Implementação
Custo indicativo
Baixo (< 50 mil €) — Development cost reported at approximately $400,000 (American Historical Association account); no separate operating-cost figures published.
Tempo até resultados
Curto (< 1 ano) — Model training began October 2022 on a pilot basis; redesignated a full Program in 2023 and applied to the 121,536-cable 1998 cohort, each confidently-decided cable processed in 20-30 minutes of computing time versus roughly a year of manual review previously.
Equipa e competências
Declassification Division, Bureau of Information Resource Management, Center for Analytics
Condições de sucesso
Training on a large corpus of prior human declassification decisions (1995-1997 cables) before deployment
Deliberately calibrating the model to be 'overprotective' (erring toward withholding) when confidence is low
Retaining mandatory human review for the ~39% of cases the model cannot confidently classify
Onde se enquadra
Tipo de governação
national government agency
Escala
national
Nível de rendimento
high_income
Habitualmente financiado por
National / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Implementa esta prática?
Reivindique-a —
implementadores verificados obtêm um contacto público na página e podem propor correções.
Fontes de dados
De onde foi obtida a informação desta prática, e quando.