Datapedia
Ingeniería de Datos

Pipeline de datos

Secuencia automatizada de pasos que mueve y transforma datos desde sus fuentes de origen hasta su destino final, listos para ser usados.

ETLAutomatizaciónArquitectura de datos

Qué es

Un pipeline de datos es una secuencia de pasos automatizados que extrae datos de una o más fuentes, los transforma (limpia, combina, agrega) y los entrega en un destino final, como un data warehouse o un modelo de machine learning, sin intervención manual en cada ejecución.

Sus componentes típicos

  • Extracción: obtener los datos de las fuentes de origen.
  • Transformación: limpiar, combinar o calcular nuevas variables.
  • Carga: escribir los datos ya procesados en su destino final.
  • Validación y monitoreo: verificar que los datos cumplan expectativas de calidad antes y después de cada paso.

Por qué necesitan mantenimiento

Un pipeline no es “configurar y olvidarse”: las fuentes de datos cambian de estructura, los volúmenes crecen, y los errores silenciosos (datos incompletos o duplicados) pueden pasar desapercibidos si no hay buena observabilidad sobre lo que el pipeline está produciendo día a día.