Qué es
Hadoop es un conjunto de herramientas open source que popularizó el procesamiento distribuido de datos a gran escala usando hardware relativamente económico, en lugar de servidores especializados muy costosos. Fue una de las tecnologías fundacionales del movimiento de Big Data a mediados de los 2000.
Sus dos grandes componentes
- HDFS (Hadoop Distributed File System): un sistema de archivos que reparte los datos entre muchos servidores, duplicándolos para tolerar fallas.
- MapReduce: el modelo de programación original de Hadoop para procesar esos datos distribuidos en paralelo.
Su lugar hoy
Aunque sigue en uso en muchas organizaciones, gran parte de su rol de procesamiento fue reemplazado por Apache Spark, considerablemente más rápido para muchos casos de uso al aprovechar mejor la memoria RAM en lugar de depender tanto del disco.
