ETL vs ELT: Diferencias y Cuándo Usar Cada Enfoque

Featured image for article 57

ETL y ELT describen el orden en que un flujo extrae, transforma y carga datos. La diferencia no es solo mover una letra: cambia dónde se ejecuta la lógica, qué información llega al destino y cómo se controlan coste, privacidad y reutilización.

Qué significa ETL

En ETL (Extract, Transform, Load) los datos se extraen, se transforman en una capa intermedia y después se cargan en el sistema de destino. El destino recibe una representación ya depurada o modelada.

Puede ser apropiado cuando el sistema final tiene recursos limitados, cuando solo debe recibir campos autorizados o cuando existe una transformación estable antes de la carga. La capa intermedia necesita capacidad de proceso, registros y recuperación.

Qué significa ELT

En ELT (Extract, Load, Transform) se carga primero una copia controlada de los datos y las transformaciones se ejecutan dentro del warehouse o lakehouse. Los motores analíticos modernos permiten escalar consultas y conservar capas de datos crudos, intermedios y de consumo.

ELT facilita volver a transformar la fuente sin extraerla de nuevo y permite que varios modelos reutilicen la misma base. A cambio, el destino debe controlar acceso, retención, costes y exposición de campos sensibles desde la llegada.

Comparación práctica

Criterio ETL ELT
Lugar principal de transformación Motor o servicio intermedio Warehouse o lakehouse
Datos disponibles en destino Normalmente seleccionados y transformados Crudos y modelados por capas
Reprocesamiento Puede requerir reextraer o conservar staging Puede rehacerse desde la capa cruda
Privacidad Permite retirar campos antes de cargar Exige controles desde la zona de aterrizaje
Uso típico Sistemas heredados o destino restringido Analítica cloud y transformaciones SQL

Ejemplo ETL

Una empresa recibe un archivo de nómina, elimina identificadores innecesarios, normaliza departamentos y carga un agregado mensual en el warehouse. El proceso intermedio nunca entrega los datos personales al entorno analítico.

  1. Extraer el archivo cifrado.
  2. Validar esquema y periodo.
  3. Eliminar columnas no autorizadas.
  4. Calcular métricas por departamento.
  5. Cargar el resultado y registrar el lote.

Ejemplo ELT

Una tienda replica pedidos desde su base transaccional a una zona de aterrizaje del warehouse. Después crea modelos SQL para estados, ventas netas y cohortes. El equipo puede reconstruir una métrica desde la copia histórica cuando cambia una regla.

CREATE OR REPLACE TABLE analytics.ventas_diarias AS
SELECT
  DATE(fecha_confirmacion) AS fecha,
  moneda,
  SUM(importe_neto) AS ventas_netas,
  COUNT(DISTINCT pedido_id) AS pedidos
FROM raw.pedidos
WHERE estado = 'confirmado'
GROUP BY 1, 2;

En un proyecto real, la tabla debería construirse mediante una herramienta que registre dependencias, pruebas y versión del código, no como una consulta aislada ejecutada manualmente.

El patrón híbrido es normal

Muchos sistemas combinan ambos enfoques. Durante la ingesta se descifran archivos, se validan tipos y se tokenizan datos sensibles; después, las reglas analíticas se ejecutan en el warehouse. Llamar al resultado ETL o ELT importa menos que documentar cada límite.

Cómo elegir

  1. Clasifica los datos: identifica campos personales, secretos y restricciones de residencia.
  2. Evalúa el destino: capacidad de cómputo, concurrencia, SQL, formatos y coste.
  3. Define reproceso: cuánto historial debes conservar y cuánto tarda reconstruirlo.
  4. Revisa competencias: Python, SQL, Spark, orquestación y operación.
  5. Mide el SLA: frecuencia, latencia, volumen y tiempo de recuperación.

Capas recomendadas en ELT

  • Raw o landing: copia inmutable, acceso restringido y metadatos del lote.
  • Staging: tipos, nombres, deduplicación técnica y estandarización.
  • Core: entidades y reglas de negocio compartidas.
  • Marts: modelos preparados para áreas y casos de consumo.

Separar capas evita que cada dashboard interprete de manera distinta el mismo evento. También permite localizar si un error nació en el origen, la estandarización o la métrica.

Pruebas mínimas

  • Esquema y tipos esperados.
  • Claves únicas y relaciones válidas.
  • Recuento de filas y reconciliación con el origen.
  • Frescura del lote.
  • Campos sensibles protegidos.
  • Idempotencia: repetir el proceso no duplica resultados.

Costes que suelen olvidarse

En ETL, cuenta el motor intermedio, el almacenamiento temporal y la transferencia. En ELT, cuenta el escaneo de consultas, la reconstrucción de modelos y la concurrencia. En ambos, añade monitoreo, ambientes, catálogo y tiempo de soporte.

La explicación de ELT publicada por dbt ayuda a entender el patrón de transformación dentro del warehouse. Para convertirlo en un flujo operable, continúa con la guía de orquestación de pipelines.

Preguntas frecuentes

¿ELT es siempre más moderno?

No. Es común en plataformas analíticas cloud, pero ETL sigue siendo válido cuando hay restricciones de destino, privacidad o procesamiento.

¿La zona raw debe guardar todo?

No. La minimización y la retención siguen aplicando. Conserva solo lo autorizado y necesario, con controles de acceso.

¿ETL y ELT sustituyen la orquestación?

No. Describen el orden de las etapas. La orquestación coordina dependencias, reintentos, horarios y alertas.

Subir