evidoria

← Volver al listado

Good practice

Etiquetas de metadatos generadas por IA de la NASA — Etiquetado automático mediante aprendizaje automático para la descubribilidad de datos abiertos federales

Estados Unidos · Washington, D.C. · Ver el perfil de Estados Unidos

Desde aproximadamente 2019, el Programa de Información Científica y Técnica de la NASA usa un modelo de aprendizaje automático — entrenado con 3,5 millones de documentos etiquetados manualmente — para etiquetar automáticamente los datos abiertos y publicaciones de la NASA según una taxonomía de unas 20 000 palabras clave estandarizadas, y ha publicado la herramienta como código abierto.

Detalles

Promotor
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Período
2018–present
Palabras clave
open data, machine learning, information management, federal government

Descripción

El corpus de Información Científica y Técnica (STI) de la NASA abarca artículos científicos, informes técnicos, repositorios de software y otros contenidos no estructurados repartidos en varios sistemas, históricamente etiquetados a mano con unas diez palabras clave por documento, tomadas de una taxonomía en evolución de más de 20 000 términos estandarizados.
El equipo de STI y el equipo de Análisis de Datos de la OCIO de la NASA construyeron un sistema de etiquetado automático basado en aprendizaje automático y PLN, entrenado con el corpus de 3,5 millones de documentos ya etiquetados del NASA Technical Reports Server, y lo publicaron como software de código abierto — los repositorios concept-tagging-training y concept-tagging-api en GitHub — documentándolo como un caso de estudio 'proof point' de la Estrategia Federal de Datos (publicado en mayo de 2019).
El uso de la herramienta se ha ampliado desde entonces más allá de su propósito original de etiquetar artículos hacia otros datos no estructurados de la NASA, y el caso de estudio la presenta explícitamente como una plantilla que otras agencias federales pueden replicar con sus propios textos. No se han publicado cifras públicas de precisión, uso o mejora de la descubribilidad antes/después, por lo que su impacto medido sigue sin demostrarse, aunque el sistema lleva varios años en funcionamiento.

Implementación

Los detalles de implementación (coste, plazo, personal, condiciones para el éxito) aún no están disponibles para esta práctica.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Prácticas similares que pueden serle útiles