evidoria

← Voltar à navegação

Good practice

Etiquetas de metadados geradas por IA da NASA — Etiquetagem automática por aprendizagem automática para a descoberta de dados abertos federais

Estados Unidos da América · Washington, D.C. · Ver o perfil de Estados Unidos da América

Desde cerca de 2019, o Programa de Informação Científica e Técnica da NASA usa um modelo de aprendizagem automática — treinado com 3,5 milhões de documentos etiquetados manualmente — para etiquetar automaticamente os dados abertos e publicações da NASA segundo uma taxonomia de cerca de 20 000 palavras-chave padronizadas, tendo disponibilizado a ferramenta em código aberto.

Detalhes

Promotor
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Período
2018–present
Palavras-chave
open data, machine learning, information management, federal government

Descrição

O corpo de Informação Científica e Técnica (STI) da NASA abrange artigos científicos, relatórios técnicos, repositórios de software e outros conteúdos não estruturados espalhados por vários sistemas, historicamente etiquetados à mão com cerca de dez palavras-chave por documento, retiradas de uma taxonomia em evolução com mais de 20 000 termos padronizados.
A equipa do STI e a Equipa de Análise de Dados do OCIO da NASA construíram um sistema de etiquetagem automática baseado em aprendizagem automática e PLN, treinado com o corpo de 3,5 milhões de documentos já etiquetados do NASA Technical Reports Server, e disponibilizaram-no como software de código aberto — os repositórios concept-tagging-training e concept-tagging-api no GitHub — documentando-o como um estudo de caso 'proof point' da Estratégia Federal de Dados (publicado em maio de 2019).
O uso da ferramenta expandiu-se desde então para além do seu propósito original de etiquetagem de artigos, aplicando-se a outros dados não estruturados da NASA, e o estudo de caso apresenta-a explicitamente como um modelo que outras agências federais podem replicar com os seus próprios textos. Não foram publicados números de precisão, utilização ou de melhoria da capacidade de descoberta antes/depois, pelo que o seu impacto medido continua por demonstrar, apesar de o sistema estar em funcionamento há vários anos.

Implementação

Os detalhes de implementação (custo, prazo, equipa, condições de sucesso) ainda não estão disponíveis para esta prática.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Práticas semelhantes que podem ser úteis