evidoria

← Volver al listado

Buena práctica Importada

Etiquetas de metadatos generadas por IA de la NASA — Etiquetado automático mediante aprendizaje automático para la descubribilidad de datos abiertos federales

Estados Unidos · Washington, D.C. · Ver el perfil de Estados Unidos · Ver el perfil de Washington, D.C.

Evidencia: Descriptivo / autodeclarado Top 12% 80/100 · Pregunte a Evidence Copilot sobre esta práctica

Desde aproximadamente 2019, el Programa de Información Científica y Técnica de la NASA usa un modelo de aprendizaje automático — entrenado con 3,5 millones de documentos etiquetados manualmente — para etiquetar automáticamente los datos abiertos y publicaciones de la NASA según una taxonomía de unas 20 000 palabras clave estandarizadas, y ha publicado la herramienta como código abierto.

Detalles

Madurez
Consolidada
Promotor
NASA Scientific and Technical Information (STI) Program / NASA OCIO Data Analytics Team
Período
2018–present
Palabras clave
open data, machine learning, information management, federal government

Contexto

El corpus de Información Científica y Técnica (STI) de la NASA abarca artículos científicos, informes técnicos, repositorios de software y otros contenidos no estructurados dispersos en múltiples sistemas, históricamente etiquetados a mano con unas diez palabras clave por documento, extraídas de una taxonomía en evolución con más de 20.000 términos estandarizados.

Objetivos

El equipo STI y el Equipo de Análisis de Datos del OCIO de la NASA se propusieron construir un sistema de etiquetado automatizado basado en aprendizaje automático y PLN, para reducir la carga manual de etiquetado y mejorar la posibilidad de descubrir contenidos técnicos de la NASA.

Actividades

El sistema se entrenó con el corpus de 3,5 millones de documentos ya etiquetados del NASA Technical Reports Server, y luego se publicó como software de código abierto (los repositorios concept-tagging-training y concept-tagging-api en GitHub) y se documentó como estudio de caso 'proof point' de la Federal Data Strategy, publicado en mayo de 2019. Su uso se ha ampliado desde entonces más allá del etiquetado original de artículos a otros datos no estructurados de la NASA.

Resultados

No se han publicado cifras públicas de precisión, uso o de capacidad de descubrimiento antes/después, por lo que el impacto medido de la herramienta en la localización de datos sigue sin demostrarse, aunque el sistema lleva varios años en funcionamiento.

Conclusiones

El estudio de caso presenta explícitamente la herramienta como una plantilla que otras agencias federales pueden replicar en sus propios corpus de texto, respaldada por código abierto en lugar de una caja negra propietaria.

Implementación

Coste indicativo
Bajo (< 50 000 €) — Built in-house by existing NASA STI Program and OCIO staff using an existing tagged corpus; no separate procurement or licensing cost disclosed; code released free as open source.
Tiempo hasta resultados
Medio (1–3 años) — System built and documented by 2018–2019 (Federal Data Strategy proof point published May 2019); operating and expanding in scope through 2026 (present).
Personal y competencias
NASA Scientific and Technical Information (STI) Program, NASA OCIO Data Analytics Team

Condiciones para el éxito

  • A large, already human-tagged corpus (3.5 million documents) available to train the model
  • An existing, standardised keyword taxonomy (20,000+ terms) to tag against
  • Releasing the code as open source so other agencies can reuse it directly

Modos de fallo comunes

  • No public accuracy, usage or before/after discoverability metrics have been published, leaving the tool's real-world impact unverified
  • Tagging quality depends on the historical taxonomy staying current as NASA's technical content evolves

Dónde encaja

Tipo de gobernanza
US federal agency (NASA)
Escala
national/federal
Nivel de ingresos
high-income

Habitualmente financiado por

National / regional programmes

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

Kit de replicación

Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Prácticas similares que pueden serle útiles