HDFS divide los archivos grandes en bloques y los distribuye entre muchos servidores de un cluster, manteniendo automáticamente varias copias de cada bloque (según su factor de replicación configurado) para garantizar que los datos sobrevivan incluso si algunos servidores individuales fallan.
Su rol histórico en el ecosistema Big Data
Fue el componente de almacenamiento fundacional del ecosistema Hadoop, y aunque hoy muchas organizaciones migraron hacia almacenamiento de objetos en la nube (como S3) para sus data lakes, los conceptos que HDFS popularizó —distribuir y replicar datos automáticamente entre muchos servidores económicos— siguen siendo la base conceptual de casi todos los sistemas de almacenamiento distribuido actuales.
