Datapedia
Big Data

Apache Spark

Motor de procesamiento distribuido de datos, más rápido que Hadoop para muchas tareas gracias a su uso intensivo de memoria RAM.

Procesamiento distribuidoOpen source

Qué es

Apache Spark es un motor de procesamiento distribuido diseñado para trabajar con grandes volúmenes de datos de forma mucho más rápida que las herramientas anteriores como Hadoop MapReduce, principalmente porque puede mantener datos en memoria RAM entre distintas etapas de procesamiento, en lugar de escribirlos y leerlos del disco constantemente.

Además de su velocidad, Spark ofrece una interfaz relativamente sencilla para trabajar con datos distribuidos usando lenguajes populares como Python, Scala o SQL, y unifica en una sola herramienta capacidades para procesamiento por lotes, streaming, machine learning y consultas tipo SQL.

Dónde se usa

Es una de las herramientas centrales en la mayoría de las plataformas modernas de datos, tanto para transformar grandes volúmenes de datos en pipelines de ingeniería de datos como para entrenar modelos de machine learning sobre conjuntos de datos que no entran en la memoria de una sola máquina.