Datapedia
Big Data

Apache Beam

Modelo de programación unificado que permite definir pipelines de procesamiento de datos que pueden ejecutarse indistintamente en modo streaming o por lotes, sobre distintos motores subyacentes.

Pipeline de datosOpen source

Apache Beam ofrece una única API para definir la lógica de un pipeline de datos, que luego puede ejecutarse sobre distintos motores de procesamiento subyacentes (como Spark, Flink o el motor de Google Cloud Dataflow), sin necesitar reescribir la lógica del pipeline para cada motor específico.

Su propuesta de valor central

Trata el procesamiento por lotes como un caso particular del procesamiento de streaming (un flujo de datos finito, en lugar de infinito), unificando bajo un mismo modelo conceptos que en otras herramientas requerían enfoques completamente separados.