evidoria

← Voltar à navegação

Boa prática Importada

Etiquetas de metadados geradas por IA da NASA — Etiquetagem automática por aprendizagem automática para a descoberta de dados abertos federais

Estados Unidos da América · Washington, D.C. · Ver o perfil de Estados Unidos da América · Ver o perfil de Washington, D.C.

Evidência: Descritivo / autorreportado Top 12% 80/100 · Pergunte a Evidence Copilot sobre esta prática

Desde cerca de 2019, o Programa de Informação Científica e Técnica da NASA usa um modelo de aprendizagem automática — treinado com 3,5 milhões de documentos etiquetados manualmente — para etiquetar automaticamente os dados abertos e publicações da NASA segundo uma taxonomia de cerca de 20 000 palavras-chave padronizadas, tendo disponibilizado a ferramenta em código aberto.

Detalhes

Maturidade
Consolidada
Promotor
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Período
2018–present
Palavras-chave
open data, machine learning, information management, federal government

Contexto

O corpus de Informação Científica e Técnica (STI) da NASA abrange artigos científicos, relatórios técnicos, repositórios de software e outros conteúdos não estruturados dispersos por múltiplos sistemas, historicamente etiquetados manualmente com cerca de dez palavras-chave por documento, extraídas de uma taxonomia em evolução com mais de 20.000 termos padronizados.

Objetivos

A equipa STI e a Equipa de Análise de Dados do OCIO da NASA propuseram-se construir um sistema automatizado de etiquetagem baseado em aprendizagem automática e PLN, para reduzir o esforço manual de etiquetagem e melhorar a descoberta de conteúdos técnicos da NASA.

Atividades

O sistema foi treinado no corpus de 3,5 milhões de documentos já etiquetados do NASA Technical Reports Server, sendo depois disponibilizado como software de código aberto (os repositórios concept-tagging-training e concept-tagging-api no GitHub) e documentado como estudo de caso 'proof point' da Federal Data Strategy, publicado em maio de 2019. O seu uso expandiu-se entretanto para além da etiquetagem original de artigos, abrangendo outros dados não estruturados da NASA.

Resultados

Não foram publicados dados públicos de precisão, utilização ou de descoberta antes/depois, pelo que o impacto medido da ferramenta na capacidade de encontrar dados permanece por demonstrar, apesar de o sistema já estar em funcionamento há vários anos.

Conclusões

O estudo de caso apresenta explicitamente a ferramenta como um modelo que outras agências federais podem replicar nos seus próprios corpora de texto, suportado por código aberto em vez de uma caixa-preta proprietária.

Implementação

Custo indicativo
Baixo (< 50 mil €) — Built in-house by existing NASA STI Program and OCIO staff using an existing tagged corpus; no separate procurement or licensing cost disclosed; code released free as open source.
Tempo até resultados
Médio (1–3 anos) — System built and documented by 2018–2019 (Federal Data Strategy proof point published May 2019); operating and expanding in scope through 2026 (present).
Equipa e competências
NASA Scientific and Technical Information (STI) Program, NASA OCIO Data Analytics Team

Condições de sucesso

  • A large, already human-tagged corpus (3.5 million documents) available to train the model
  • An existing, standardised keyword taxonomy (20,000+ terms) to tag against
  • Releasing the code as open source so other agencies can reuse it directly

Modos de falha comuns

  • No public accuracy, usage or before/after discoverability metrics have been published, leaving the tool's real-world impact unverified
  • Tagging quality depends on the historical taxonomy staying current as NASA's technical content evolves

Onde se enquadra

Tipo de governação
US federal agency (NASA)
Escala
national/federal
Nível de rendimento
high-income

Habitualmente financiado por

National / regional programmes

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Kit de replicação

Artefactos reutilizáveis desta prática — tal como publicados pelas suas fontes.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis