La compresión de datos reduce el espacio físico necesario para almacenar un conjunto de datos, identificando y eliminando redundancia dentro de la información, a costa de requerir procesamiento adicional para comprimir los datos antes de guardarlos y descomprimirlos antes de usarlos.
Por qué es tan relevante en Big Data
Con volúmenes de datos masivos, incluso una compresión moderada puede representar ahorros enormes en costos de almacenamiento y en tiempo de transferencia entre sistemas, siendo una de las razones por las que formatos columnares como Parquet, que comprimen especialmente bien, se volvieron tan populares en el ecosistema de Big Data.
