Qué es
Un pipeline de datos es una secuencia de pasos automatizados que extrae datos de una o más fuentes, los transforma (limpia, combina, agrega) y los entrega en un destino final, como un data warehouse o un modelo de machine learning, sin intervención manual en cada ejecución.
Sus componentes típicos
- Extracción: obtener los datos de las fuentes de origen.
- Transformación: limpiar, combinar o calcular nuevas variables.
- Carga: escribir los datos ya procesados en su destino final.
- Validación y monitoreo: verificar que los datos cumplan expectativas de calidad antes y después de cada paso.
Por qué necesitan mantenimiento
Un pipeline no es “configurar y olvidarse”: las fuentes de datos cambian de estructura, los volúmenes crecen, y los errores silenciosos (datos incompletos o duplicados) pueden pasar desapercibidos si no hay buena observabilidad sobre lo que el pipeline está produciendo día a día.
