Datapedia
Ingeniería de Datos

Data Lake

Repositorio centralizado que almacena datos estructurados y no estructurados en su formato original, listos para analizarse.

AlmacenamientoArquitectura de datosETL

¿Qué es?

Un data lake es un repositorio que almacena grandes volúmenes de datos crudos —estructurados, semiestructurados y no estructurados— sin necesidad de definir su esquema por adelantado. A diferencia de un data warehouse, donde los datos se transforman antes de guardarse, en un data lake se guarda todo en su formato original y se decide cómo estructurarlo recién en el momento de analizarlo.

Data lake vs. data warehouse

Data Lake Data Warehouse
Formato de los datos Crudo, sin transformar Procesado y estructurado
Esquema Se define al leer (schema-on-read) Se define al escribir (schema-on-write)
Tipos de datos Estructurados, semi y no estructurados Principalmente estructurados
Usuarios típicos Data scientists, ingenieros Analistas de negocio

Ventajas

  • Flexibilidad para almacenar cualquier tipo de dato (logs, imágenes, JSON, video).
  • Menor costo de almacenamiento en comparación con soluciones altamente estructuradas.
  • Base ideal para entrenar modelos de machine learning que necesitan datos crudos.

Riesgos comunes

Sin buena gobernanza, un data lake puede convertirse en un “data swamp”: un repositorio desorganizado donde es imposible encontrar o confiar en los datos. Catalogar, versionar y documentar el contenido es tan importante como almacenarlo.