Data lineage: qué es el linaje de datos

Data lineage, o linaje de datos, describe el recorrido de un dato desde su origen hasta sus consumidores: qué sistemas lo producen, qué transformaciones recibe, dónde se almacena y qué informes o modelos dependen de él.
Ese mapa permite responder “¿de dónde sale esta cifra?”, “¿qué se rompe si cambio una columna?” y “¿qué versión alimentó el modelo?”. Sin linaje, investigar un incidente depende de memoria y mensajes dispersos.
Qué incluye el linaje
- fuentes y tablas;
- campos o conjuntos de datos;
- jobs y transformaciones;
- movimientos entre entornos;
- responsables;
- horarios y versiones;
- modelos semánticos;
- dashboards y modelos de machine learning.
El nivel puede ser de sistema, tabla o columna. Más detalle aporta precisión, pero aumenta costo de captura y mantenimiento.
Ejemplo
CRM.clientes
→ pipeline_normaliza_clientes
→ warehouse.dim_cliente
→ modelo_ventas
→ dashboard_comercial
Si cambia CRM.clientes.segmento, el grafo muestra consumidores aguas abajo. También permite rastrear una cifra desde el dashboard hacia la fuente.
Linaje técnico y de negocio
El linaje técnico registra objetos y operaciones. El de negocio añade significado:
- definición de “cliente activo”;
- propietario;
- sensibilidad;
- reglas de calidad;
- frecuencia esperada;
- sistema autorizado.
Un grafo con nombres crípticos ayuda a ingeniería, pero no explica por qué una métrica es válida. Combina ambos niveles.
Linaje vs catálogo de datos
Un catálogo organiza activos, búsqueda, descripciones y responsables. El linaje representa dependencias y flujo. Se complementan: el catálogo responde “qué existe”; el linaje, “cómo está conectado”.
Captura automática y documentación manual
Las plataformas pueden extraer metadatos de SQL, orquestadores y herramientas de BI. La automatización reduce trabajo, pero no siempre detecta:
- archivos enviados por correo;
- lógica en hojas de cálculo;
- consultas dinámicas;
- scripts fuera del repositorio;
- reglas aplicadas manualmente;
- dependencias externas.
Permite anotaciones y valida cobertura. “Linaje automático” no significa “linaje completo”.
Impacto de cambios
Antes de renombrar, eliminar o cambiar el tipo de una columna:
- Busca consumidores aguas abajo.
- Identifica propietarios.
- Clasifica compatibilidad.
- Prueba en un entorno controlado.
- Comunica la migración.
- Despliega con observabilidad.
- Verifica activos críticos.
El análisis inverso ayuda durante incidentes: parte del indicador incorrecto y sigue dependencias hacia arriba.
Linaje y calidad
Una alerta de calidad de datos es más útil si muestra qué informes están afectados. El linaje permite priorizar: una tabla con 30 consumidores críticos requiere otra respuesta que una tabla experimental sin uso.
Asocia controles a nodos y aristas:
- esquema;
- volumen;
- frescura;
- unicidad;
- reconciliación;
- transformaciones esperadas.
Linaje en machine learning
Para reproducir un modelo registra:
- snapshot o versión de datos;
- código de preparación;
- features;
- parámetros;
- entorno;
- modelo;
- evaluación;
- endpoint o informe consumidor.
El linaje no sustituye el versionado, pero conecta sus identificadores.
Conecta también cada activo con el pipeline de datos que lo actualiza; así una dependencia lógica conserva evidencia de su ejecución operativa.
Seguridad y privacidad
Rastrear datos sensibles permite saber dónde se copian y quién podría verlos. Etiqueta fuentes, columnas derivadas y exportaciones. Un hash o embedding puede seguir siendo dato sensible; la transformación no elimina automáticamente las obligaciones.
La ética y privacidad debe formar parte del diseño, no añadirse después.
Cómo empezar
- Selecciona un informe crítico.
- Mapea sus fuentes manualmente.
- Define propietarios.
- Captura dependencias del orquestador y BI.
- Añade definiciones de negocio.
- Prueba un análisis de impacto.
- Automatiza la actualización.
- Mide cobertura.
No intentes documentar todo con el mismo detalle. Prioriza activos de alto valor y flujos regulados.
Métricas de madurez
- porcentaje de activos críticos con propietario;
- cobertura de dependencias;
- tiempo para localizar origen de un KPI;
- cambios evaluados antes de desplegar;
- incidentes con consumidores identificados;
- nodos obsoletos;
- última actualización del linaje.
Errores frecuentes
- Dibujar un diagrama una vez y abandonarlo.
- Capturar solo sistemas, sin transformaciones.
- Confundir movimiento con significado.
- No incluir hojas y procesos manuales.
- Exponer metadatos sensibles a cualquiera.
- No vincular propietarios.
- Prometer cobertura total sin medirla.
- Ignorar activos retirados.
Un buen linaje reduce el costo de confiar: la persona puede inspeccionar el camino, la transformación y la responsabilidad de la cifra.
Preguntas frecuentes
¿Qué es data lineage?
Es la trazabilidad del dato desde sus fuentes, a través de transformaciones, hasta informes, modelos y otros consumidores.
¿Para qué sirve el linaje de datos?
Ayuda a explicar cifras, analizar impactos, resolver incidentes, auditar uso y reproducir procesos.
¿Qué diferencia hay entre linaje y catálogo?
El catálogo describe y permite descubrir activos; el linaje muestra sus dependencias y recorrido.
¿El linaje puede capturarse automáticamente?
En parte. Conectores extraen metadatos, pero procesos manuales, lógica dinámica y fuentes externas requieren revisión.
¿Qué es linaje a nivel de columna?
Es el rastreo de cómo una columna fuente contribuye a una columna derivada a través de expresiones y movimientos.
¿Cómo se mide la cobertura?
Define activos críticos y calcula qué proporción tiene fuentes, transformaciones, consumidores, propietarios y actualización verificadas.

Deja una respuesta