evidoria

← Retour à la liste

Good practice

Étiquettes de métadonnées générées par IA de la NASA — Étiquetage automatique par apprentissage automatique pour la découverte des données ouvertes fédérales

États-Unis d'Amérique · Washington, D.C. · Voir le profil de États-Unis d'Amérique

Depuis environ 2019, le programme d'information scientifique et technique de la NASA utilise un modèle d'apprentissage automatique — entraîné sur 3,5 millions de documents étiquetés manuellement — pour étiqueter automatiquement les données ouvertes et publications de la NASA selon une taxonomie d'environ 20 000 mots-clés normalisés, et a mis l'outil en open source.

Détails

Promoteur
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Période
2018–present
Mots-clés
open data, machine learning, information management, federal government

Description

Le corpus d'information scientifique et technique (STI) de la NASA comprend des articles scientifiques, des rapports techniques, des dépôts logiciels et d'autres contenus non structurés répartis sur plusieurs systèmes, historiquement étiquetés manuellement avec une dizaine de mots-clés par document issus d'une taxonomie évolutive de plus de 20 000 termes normalisés.
L'équipe STI et l'équipe d'analyse de données de l'OCIO de la NASA ont construit un système d'étiquetage automatique fondé sur l'apprentissage automatique et le TALN, entraîné sur le corpus de 3,5 millions de documents déjà étiquetés du NASA Technical Reports Server, puis l'ont publié en open source — les dépôts concept-tagging-training et concept-tagging-api sur GitHub — en le documentant comme étude de cas 'proof point' de la stratégie fédérale des données (publiée en mai 2019).
L'usage de l'outil s'est depuis étendu au-delà de son objectif initial d'étiquetage d'articles à d'autres données non structurées de la NASA, et l'étude de cas le présente explicitement comme un modèle que d'autres agences fédérales peuvent reproduire sur leurs propres textes. Aucun chiffre public de précision, d'usage ou d'amélioration de la découvrabilité avant/après n'a été publié : son impact mesuré reste donc à démontrer, bien que le système fonctionne depuis plusieurs années.

Mise en œuvre

Les détails de mise en œuvre (coût, calendrier, personnel, conditions de réussite) ne sont pas encore disponibles pour cette pratique.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pratiques similaires qui pourraient vous être utiles