¿Qué es?
Un data lake es un repositorio que almacena grandes volúmenes de datos crudos —estructurados, semiestructurados y no estructurados— sin necesidad de definir su esquema por adelantado. A diferencia de un data warehouse, donde los datos se transforman antes de guardarse, en un data lake se guarda todo en su formato original y se decide cómo estructurarlo recién en el momento de analizarlo.
Data lake vs. data warehouse
| Data Lake | Data Warehouse | |
|---|---|---|
| Formato de los datos | Crudo, sin transformar | Procesado y estructurado |
| Esquema | Se define al leer (schema-on-read) | Se define al escribir (schema-on-write) |
| Tipos de datos | Estructurados, semi y no estructurados | Principalmente estructurados |
| Usuarios típicos | Data scientists, ingenieros | Analistas de negocio |
Ventajas
- Flexibilidad para almacenar cualquier tipo de dato (logs, imágenes, JSON, video).
- Menor costo de almacenamiento en comparación con soluciones altamente estructuradas.
- Base ideal para entrenar modelos de machine learning que necesitan datos crudos.
Riesgos comunes
Sin buena gobernanza, un data lake puede convertirse en un “data swamp”: un repositorio desorganizado donde es imposible encontrar o confiar en los datos. Catalogar, versionar y documentar el contenido es tan importante como almacenarlo.
