Etiquetas de metadatos generadas por IA de la NASA — Etiquetado automático mediante aprendizaje automático para la descubribilidad de datos abiertos federales
Desde aproximadamente 2019, el Programa de Información Científica y Técnica de la NASA usa un modelo de aprendizaje automático — entrenado con 3,5 millones de documentos etiquetados manualmente — para etiquetar automáticamente los datos abiertos y publicaciones de la NASA según una taxonomía de unas 20 000 palabras clave estandarizadas, y ha publicado la herramienta como código abierto.
Detalles
Madurez
Consolidada
Promotor
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Período
2018–present
Palabras clave
open data, machine learning, information management, federal government
Contexto
El corpus de Información Científica y Técnica (STI) de la NASA abarca artículos científicos, informes técnicos, repositorios de software y otros contenidos no estructurados dispersos en múltiples sistemas, históricamente etiquetados a mano con unas diez palabras clave por documento, extraídas de una taxonomía en evolución con más de 20.000 términos estandarizados.
Objetivos
El equipo STI y el Equipo de Análisis de Datos del OCIO de la NASA se propusieron construir un sistema de etiquetado automatizado basado en aprendizaje automático y PLN, para reducir la carga manual de etiquetado y mejorar la posibilidad de descubrir contenidos técnicos de la NASA.
Actividades
El sistema se entrenó con el corpus de 3,5 millones de documentos ya etiquetados del NASA Technical Reports Server, y luego se publicó como software de código abierto (los repositorios concept-tagging-training y concept-tagging-api en GitHub) y se documentó como estudio de caso 'proof point' de la Federal Data Strategy, publicado en mayo de 2019. Su uso se ha ampliado desde entonces más allá del etiquetado original de artículos a otros datos no estructurados de la NASA.
Resultados
No se han publicado cifras públicas de precisión, uso o de capacidad de descubrimiento antes/después, por lo que el impacto medido de la herramienta en la localización de datos sigue sin demostrarse, aunque el sistema lleva varios años en funcionamiento.
Conclusiones
El estudio de caso presenta explícitamente la herramienta como una plantilla que otras agencias federales pueden replicar en sus propios corpus de texto, respaldada por código abierto en lugar de una caja negra propietaria.
Implementación
Coste indicativo
Bajo (< 50 000 €) — Built in-house by existing NASA STI Program and OCIO staff using an existing tagged corpus; no separate procurement or licensing cost disclosed; code released free as open source.
Tiempo hasta resultados
Medio (1–3 años) — System built and documented by 2018–2019 (Federal Data Strategy proof point published May 2019); operating and expanding in scope through 2026 (present).
Personal y competencias
NASA Scientific and Technical Information (STI) Program, NASA OCIO Data Analytics Team
Condiciones para el éxito
A large, already human-tagged corpus (3.5 million documents) available to train the model
An existing, standardised keyword taxonomy (20,000+ terms) to tag against
Releasing the code as open source so other agencies can reuse it directly
Modos de fallo comunes
No public accuracy, usage or before/after discoverability metrics have been published, leaving the tool's real-world impact unverified
Tagging quality depends on the historical taxonomy staying current as NASA's technical content evolves
Dónde encaja
Tipo de gobernanza
US federal agency (NASA)
Escala
national/federal
Nivel de ingresos
high-income
Habitualmente financiado por
National / regional programmes
Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.
Kit de replicación
Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.
Antes de publicarse, un servicio puntúa cada conjunto de datos del portal surcoreano según cinco criterios —comprensibilidad, procesamiento, vinculación, cumplimiento, …