Datapedia
Big Data

MapReduce

Modelo de programación para procesar grandes volúmenes de datos en paralelo, dividiendo el trabajo en una etapa de mapeo y otra de reducción.

Procesamiento distribuidoHadoop

Qué es

MapReduce es un modelo de programación, popularizado por Google, para procesar grandes conjuntos de datos distribuyendo el trabajo en dos etapas: map, que procesa cada fragmento de datos de forma independiente y en paralelo, y reduce, que combina los resultados parciales de todos los fragmentos en un resultado final.

Un ejemplo simple: contar palabras

Para contar cuántas veces aparece cada palabra en millones de documentos, la etapa de map cuenta las palabras dentro de cada documento por separado y en paralelo, y la etapa de reduce suma los conteos parciales de cada palabra entre todos los documentos para obtener el total general.

Su legado

Aunque frameworks más modernos como Apache Spark superaron a MapReduce en velocidad y flexibilidad, el patrón conceptual de dividir un problema grande en tareas paralelas independientes y luego combinar los resultados sigue siendo la base de buena parte del procesamiento distribuido actual.