Desde cerca de 2019, o Programa de Informação Científica e Técnica da NASA usa um modelo de aprendizagem automática — treinado com 3,5 milhões de documentos etiquetados manualmente — para etiquetar automaticamente os dados abertos e publicações da NASA segundo uma taxonomia de cerca de 20 000 palavras-chave padronizadas, tendo disponibilizado a ferramenta em código aberto.
Detalhes
Maturidade
Consolidada
Promotor
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Período
2018–present
Palavras-chave
open data, machine learning, information management, federal government
Contexto
O corpus de Informação Científica e Técnica (STI) da NASA abrange artigos científicos, relatórios técnicos, repositórios de software e outros conteúdos não estruturados dispersos por múltiplos sistemas, historicamente etiquetados manualmente com cerca de dez palavras-chave por documento, extraídas de uma taxonomia em evolução com mais de 20.000 termos padronizados.
Objetivos
A equipa STI e a Equipa de Análise de Dados do OCIO da NASA propuseram-se construir um sistema automatizado de etiquetagem baseado em aprendizagem automática e PLN, para reduzir o esforço manual de etiquetagem e melhorar a descoberta de conteúdos técnicos da NASA.
Atividades
O sistema foi treinado no corpus de 3,5 milhões de documentos já etiquetados do NASA Technical Reports Server, sendo depois disponibilizado como software de código aberto (os repositórios concept-tagging-training e concept-tagging-api no GitHub) e documentado como estudo de caso 'proof point' da Federal Data Strategy, publicado em maio de 2019. O seu uso expandiu-se entretanto para além da etiquetagem original de artigos, abrangendo outros dados não estruturados da NASA.
Resultados
Não foram publicados dados públicos de precisão, utilização ou de descoberta antes/depois, pelo que o impacto medido da ferramenta na capacidade de encontrar dados permanece por demonstrar, apesar de o sistema já estar em funcionamento há vários anos.
Conclusões
O estudo de caso apresenta explicitamente a ferramenta como um modelo que outras agências federais podem replicar nos seus próprios corpora de texto, suportado por código aberto em vez de uma caixa-preta proprietária.
Implementação
Custo indicativo
Baixo (< 50 mil €) — Built in-house by existing NASA STI Program and OCIO staff using an existing tagged corpus; no separate procurement or licensing cost disclosed; code released free as open source.
Tempo até resultados
Médio (1–3 anos) — System built and documented by 2018–2019 (Federal Data Strategy proof point published May 2019); operating and expanding in scope through 2026 (present).
Equipa e competências
NASA Scientific and Technical Information (STI) Program, NASA OCIO Data Analytics Team
Condições de sucesso
A large, already human-tagged corpus (3.5 million documents) available to train the model
An existing, standardised keyword taxonomy (20,000+ terms) to tag against
Releasing the code as open source so other agencies can reuse it directly
Modos de falha comuns
No public accuracy, usage or before/after discoverability metrics have been published, leaving the tool's real-world impact unverified
Tagging quality depends on the historical taxonomy staying current as NASA's technical content evolves
Onde se enquadra
Tipo de governação
US federal agency (NASA)
Escala
national/federal
Nível de rendimento
high-income
Habitualmente financiado por
National / regional programmes
Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.
Kit de replicação
Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.
Antes da publicação, um serviço pontua cada conjunto de dados do portal sul-coreano segundo cinco critérios — compreensibilidade, processamento, ligação, …
A Operação Serenata de Amor, iniciativa da sociedade civil brasileira, usa aprendizagem automática de código aberto ('Rosie') para assinalar reembolsos …