evidoria

← Retour à la liste

Bonne pratique Importée

Étiquettes de métadonnées générées par IA de la NASA — Étiquetage automatique par apprentissage automatique pour la découverte des données ouvertes fédérales

États-Unis d'Amérique · Washington, D.C. · Voir le profil de États-Unis d'Amérique · Voir le profil de Washington, D.C.

Preuves: Descriptif / auto-déclaré Top 12% 80/100 · Demandez à Evidence Copilot à propos de cette pratique

Depuis environ 2019, le programme d'information scientifique et technique de la NASA utilise un modèle d'apprentissage automatique — entraîné sur 3,5 millions de documents étiquetés manuellement — pour étiqueter automatiquement les données ouvertes et publications de la NASA selon une taxonomie d'environ 20 000 mots-clés normalisés, et a mis l'outil en open source.

Détails

Maturité
Établie
Promoteur
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Période
2018–present
Mots-clés
open data, machine learning, information management, federal government

Contexte

Le corpus d'information scientifique et technique (STI) de la NASA couvre des articles scientifiques, des rapports techniques, des dépôts logiciels et d'autres contenus non structurés dispersés dans plusieurs systèmes, historiquement étiquetés à la main avec une dizaine de mots-clés par document, issus d'une taxonomie évolutive de plus de 20 000 termes normalisés.

Objectifs

L'équipe STI et l'équipe d'analyse de données de l'OCIO de la NASA ont entrepris de construire un système d'étiquetage automatisé basé sur l'apprentissage automatique et le TAL, afin de réduire la charge manuelle d'étiquetage et d'améliorer la découvrabilité des contenus techniques de la NASA.

Activités

Le système a été entraîné sur le corpus de 3,5 millions de documents déjà étiquetés du NASA Technical Reports Server, puis publié en open source (les dépôts concept-tagging-training et concept-tagging-api sur GitHub) et documenté comme étude de cas « proof point » de la Federal Data Strategy, publiée en mai 2019. Son usage s'est depuis étendu au-delà de l'étiquetage initial d'articles à d'autres données non structurées de la NASA.

Résultats

Aucune donnée publique de précision, d'utilisation ou de découvrabilité avant/après n'a été publiée, de sorte que l'impact mesuré de l'outil sur la facilité de trouver les données reste à démontrer, même si le système fonctionne depuis plusieurs années.

Conclusions

L'étude de cas présente explicitement l'outil comme un modèle que d'autres agences fédérales peuvent reproduire sur leurs propres corpus de texte, appuyé par un code open source plutôt qu'une boîte noire propriétaire.

Mise en œuvre

Coût indicatif
Faible (< 50 k€) — Built in-house by existing NASA STI Program and OCIO staff using an existing tagged corpus; no separate procurement or licensing cost disclosed; code released free as open source.
Délai jusqu’aux résultats
Moyen (1–3 ans) — System built and documented by 2018–2019 (Federal Data Strategy proof point published May 2019); operating and expanding in scope through 2026 (present).
Personnel et compétences
NASA Scientific and Technical Information (STI) Program, NASA OCIO Data Analytics Team

Conditions de réussite

  • A large, already human-tagged corpus (3.5 million documents) available to train the model
  • An existing, standardised keyword taxonomy (20,000+ terms) to tag against
  • Releasing the code as open source so other agencies can reuse it directly

Modes d’échec courants

  • No public accuracy, usage or before/after discoverability metrics have been published, leaving the tool's real-world impact unverified
  • Tagging quality depends on the historical taxonomy staying current as NASA's technical content evolves

Où cela s’applique

Type de gouvernance
US federal agency (NASA)
Échelle
national/federal
Niveau de revenu
high-income

Habituellement financé par

National / regional programmes

Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.

Kit de réplication

Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pratiques similaires qui pourraient vous être utiles