Datapedia
Big Data

Hadoop

Framework open source para el almacenamiento y procesamiento distribuido de grandes volúmenes de datos en clusters de servidores.

Procesamiento distribuidoOpen sourceMapReduce

Qué es

Hadoop es un conjunto de herramientas open source que popularizó el procesamiento distribuido de datos a gran escala usando hardware relativamente económico, en lugar de servidores especializados muy costosos. Fue una de las tecnologías fundacionales del movimiento de Big Data a mediados de los 2000.

Sus dos grandes componentes

  • HDFS (Hadoop Distributed File System): un sistema de archivos que reparte los datos entre muchos servidores, duplicándolos para tolerar fallas.
  • MapReduce: el modelo de programación original de Hadoop para procesar esos datos distribuidos en paralelo.

Su lugar hoy

Aunque sigue en uso en muchas organizaciones, gran parte de su rol de procesamiento fue reemplazado por Apache Spark, considerablemente más rápido para muchos casos de uso al aprovechar mejor la memoria RAM en lugar de depender tanto del disco.