Qué es
Un lakehouse busca combinar lo mejor de dos mundos: el almacenamiento flexible y económico de un data lake (que acepta cualquier tipo de dato, estructurado o no) con las garantías de transacciones confiables, calidad y estructura que tradicionalmente solo ofrecía un data warehouse.
Por qué surgió
Durante años, las organizaciones mantenían un data lake para datos crudos y un data warehouse separado para análisis de negocio, duplicando datos y procesos entre ambos. Tecnologías como Delta Lake o Apache Iceberg permitieron agregar esas garantías directamente sobre el almacenamiento de un data lake, evitando esa duplicación.
Su ventaja principal
Permite tener una única fuente de datos que sirve tanto para análisis de negocio tradicional (con la confiabilidad de un warehouse) como para cargas de trabajo de machine learning que necesitan acceso directo a datos crudos y variados, sin mantener dos sistemas separados.
