Data lineage: qué es el linaje de datos

Data lineage: qué es el linaje de datos

Data lineage, o linaje de datos, describe el recorrido de un dato desde su origen hasta sus consumidores: qué sistemas lo producen, qué transformaciones recibe, dónde se almacena y qué informes o modelos dependen de él.

Ese mapa permite responder “¿de dónde sale esta cifra?”, “¿qué se rompe si cambio una columna?” y “¿qué versión alimentó el modelo?”. Sin linaje, investigar un incidente depende de memoria y mensajes dispersos.

Qué incluye el linaje

  • fuentes y tablas;
  • campos o conjuntos de datos;
  • jobs y transformaciones;
  • movimientos entre entornos;
  • responsables;
  • horarios y versiones;
  • modelos semánticos;
  • dashboards y modelos de machine learning.

El nivel puede ser de sistema, tabla o columna. Más detalle aporta precisión, pero aumenta costo de captura y mantenimiento.

Ejemplo

CRM.clientes
  → pipeline_normaliza_clientes
  → warehouse.dim_cliente
  → modelo_ventas
  → dashboard_comercial

Si cambia CRM.clientes.segmento, el grafo muestra consumidores aguas abajo. También permite rastrear una cifra desde el dashboard hacia la fuente.

Linaje técnico y de negocio

El linaje técnico registra objetos y operaciones. El de negocio añade significado:

  • definición de “cliente activo”;
  • propietario;
  • sensibilidad;
  • reglas de calidad;
  • frecuencia esperada;
  • sistema autorizado.

Un grafo con nombres crípticos ayuda a ingeniería, pero no explica por qué una métrica es válida. Combina ambos niveles.

Linaje vs catálogo de datos

Un catálogo organiza activos, búsqueda, descripciones y responsables. El linaje representa dependencias y flujo. Se complementan: el catálogo responde “qué existe”; el linaje, “cómo está conectado”.

Captura automática y documentación manual

Las plataformas pueden extraer metadatos de SQL, orquestadores y herramientas de BI. La automatización reduce trabajo, pero no siempre detecta:

  • archivos enviados por correo;
  • lógica en hojas de cálculo;
  • consultas dinámicas;
  • scripts fuera del repositorio;
  • reglas aplicadas manualmente;
  • dependencias externas.

Permite anotaciones y valida cobertura. “Linaje automático” no significa “linaje completo”.

Impacto de cambios

Antes de renombrar, eliminar o cambiar el tipo de una columna:

  1. Busca consumidores aguas abajo.
  2. Identifica propietarios.
  3. Clasifica compatibilidad.
  4. Prueba en un entorno controlado.
  5. Comunica la migración.
  6. Despliega con observabilidad.
  7. Verifica activos críticos.

El análisis inverso ayuda durante incidentes: parte del indicador incorrecto y sigue dependencias hacia arriba.

Linaje y calidad

Una alerta de calidad de datos es más útil si muestra qué informes están afectados. El linaje permite priorizar: una tabla con 30 consumidores críticos requiere otra respuesta que una tabla experimental sin uso.

Asocia controles a nodos y aristas:

  • esquema;
  • volumen;
  • frescura;
  • unicidad;
  • reconciliación;
  • transformaciones esperadas.

Linaje en machine learning

Para reproducir un modelo registra:

  • snapshot o versión de datos;
  • código de preparación;
  • features;
  • parámetros;
  • entorno;
  • modelo;
  • evaluación;
  • endpoint o informe consumidor.

El linaje no sustituye el versionado, pero conecta sus identificadores.

Conecta también cada activo con el pipeline de datos que lo actualiza; así una dependencia lógica conserva evidencia de su ejecución operativa.

Seguridad y privacidad

Rastrear datos sensibles permite saber dónde se copian y quién podría verlos. Etiqueta fuentes, columnas derivadas y exportaciones. Un hash o embedding puede seguir siendo dato sensible; la transformación no elimina automáticamente las obligaciones.

La ética y privacidad debe formar parte del diseño, no añadirse después.

Cómo empezar

  1. Selecciona un informe crítico.
  2. Mapea sus fuentes manualmente.
  3. Define propietarios.
  4. Captura dependencias del orquestador y BI.
  5. Añade definiciones de negocio.
  6. Prueba un análisis de impacto.
  7. Automatiza la actualización.
  8. Mide cobertura.

No intentes documentar todo con el mismo detalle. Prioriza activos de alto valor y flujos regulados.

Métricas de madurez

  • porcentaje de activos críticos con propietario;
  • cobertura de dependencias;
  • tiempo para localizar origen de un KPI;
  • cambios evaluados antes de desplegar;
  • incidentes con consumidores identificados;
  • nodos obsoletos;
  • última actualización del linaje.

Errores frecuentes

  • Dibujar un diagrama una vez y abandonarlo.
  • Capturar solo sistemas, sin transformaciones.
  • Confundir movimiento con significado.
  • No incluir hojas y procesos manuales.
  • Exponer metadatos sensibles a cualquiera.
  • No vincular propietarios.
  • Prometer cobertura total sin medirla.
  • Ignorar activos retirados.

Un buen linaje reduce el costo de confiar: la persona puede inspeccionar el camino, la transformación y la responsabilidad de la cifra.

Preguntas frecuentes

¿Qué es data lineage?
Es la trazabilidad del dato desde sus fuentes, a través de transformaciones, hasta informes, modelos y otros consumidores.

¿Para qué sirve el linaje de datos?
Ayuda a explicar cifras, analizar impactos, resolver incidentes, auditar uso y reproducir procesos.

¿Qué diferencia hay entre linaje y catálogo?
El catálogo describe y permite descubrir activos; el linaje muestra sus dependencias y recorrido.

¿El linaje puede capturarse automáticamente?
En parte. Conectores extraen metadatos, pero procesos manuales, lógica dinámica y fuentes externas requieren revisión.

¿Qué es linaje a nivel de columna?
Es el rastreo de cómo una columna fuente contribuye a una columna derivada a través de expresiones y movimientos.

¿Cómo se mide la cobertura?
Define activos críticos y calcula qué proporción tiene fuentes, transformaciones, consumidores, propietarios y actualización verificadas.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Subir