Qué es
Apache Spark es un motor de procesamiento distribuido diseñado para trabajar con grandes volúmenes de datos de forma mucho más rápida que las herramientas anteriores como Hadoop MapReduce, principalmente porque puede mantener datos en memoria RAM entre distintas etapas de procesamiento, en lugar de escribirlos y leerlos del disco constantemente.
Qué lo hizo tan popular
Además de su velocidad, Spark ofrece una interfaz relativamente sencilla para trabajar con datos distribuidos usando lenguajes populares como Python, Scala o SQL, y unifica en una sola herramienta capacidades para procesamiento por lotes, streaming, machine learning y consultas tipo SQL.
Dónde se usa
Es una de las herramientas centrales en la mayoría de las plataformas modernas de datos, tanto para transformar grandes volúmenes de datos en pipelines de ingeniería de datos como para entrenar modelos de machine learning sobre conjuntos de datos que no entran en la memoria de una sola máquina.
