Étiquettes de métadonnées générées par IA de la NASA — Étiquetage automatique par apprentissage automatique pour la découverte des données ouvertes fédérales
Depuis environ 2019, le programme d'information scientifique et technique de la NASA utilise un modèle d'apprentissage automatique — entraîné sur 3,5 millions de documents étiquetés manuellement — pour étiqueter automatiquement les données ouvertes et publications de la NASA selon une taxonomie d'environ 20 000 mots-clés normalisés, et a mis l'outil en open source.
Détails
Maturité
Établie
Promoteur
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Période
2018–present
Mots-clés
open data, machine learning, information management, federal government
Contexte
Le corpus d'information scientifique et technique (STI) de la NASA couvre des articles scientifiques, des rapports techniques, des dépôts logiciels et d'autres contenus non structurés dispersés dans plusieurs systèmes, historiquement étiquetés à la main avec une dizaine de mots-clés par document, issus d'une taxonomie évolutive de plus de 20 000 termes normalisés.
Objectifs
L'équipe STI et l'équipe d'analyse de données de l'OCIO de la NASA ont entrepris de construire un système d'étiquetage automatisé basé sur l'apprentissage automatique et le TAL, afin de réduire la charge manuelle d'étiquetage et d'améliorer la découvrabilité des contenus techniques de la NASA.
Activités
Le système a été entraîné sur le corpus de 3,5 millions de documents déjà étiquetés du NASA Technical Reports Server, puis publié en open source (les dépôts concept-tagging-training et concept-tagging-api sur GitHub) et documenté comme étude de cas « proof point » de la Federal Data Strategy, publiée en mai 2019. Son usage s'est depuis étendu au-delà de l'étiquetage initial d'articles à d'autres données non structurées de la NASA.
Résultats
Aucune donnée publique de précision, d'utilisation ou de découvrabilité avant/après n'a été publiée, de sorte que l'impact mesuré de l'outil sur la facilité de trouver les données reste à démontrer, même si le système fonctionne depuis plusieurs années.
Conclusions
L'étude de cas présente explicitement l'outil comme un modèle que d'autres agences fédérales peuvent reproduire sur leurs propres corpus de texte, appuyé par un code open source plutôt qu'une boîte noire propriétaire.
Mise en œuvre
Coût indicatif
Faible (< 50 k€) — Built in-house by existing NASA STI Program and OCIO staff using an existing tagged corpus; no separate procurement or licensing cost disclosed; code released free as open source.
Délai jusqu’aux résultats
Moyen (1–3 ans) — System built and documented by 2018–2019 (Federal Data Strategy proof point published May 2019); operating and expanding in scope through 2026 (present).
Personnel et compétences
NASA Scientific and Technical Information (STI) Program, NASA OCIO Data Analytics Team
Conditions de réussite
A large, already human-tagged corpus (3.5 million documents) available to train the model
An existing, standardised keyword taxonomy (20,000+ terms) to tag against
Releasing the code as open source so other agencies can reuse it directly
Modes d’échec courants
No public accuracy, usage or before/after discoverability metrics have been published, leaving the tool's real-world impact unverified
Tagging quality depends on the historical taxonomy staying current as NASA's technical content evolves
Où cela s’applique
Type de gouvernance
US federal agency (NASA)
Échelle
national/federal
Niveau de revenu
high-income
Habituellement financé par
National / regional programmes
Pistes de financement indicatives pour des pratiques de ce type — vérifiez toujours les appels en cours et les règles d'éligibilité de chaque programme.
Kit de réplication
Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.