Datapedia
Big Data

Streaming de datos

Procesamiento de datos de forma continua, a medida que se generan, en lugar de acumularlos para procesarlos en bloques periódicos.

Tiempo realApache KafkaProcesamiento continuo

Qué es

El streaming de datos procesa la información evento por evento, a medida que se genera —un clic en una app, una transacción, una lectura de sensor— en lugar de esperar a acumular un lote de datos para procesarlo todo junto de forma periódica.

Streaming vs. procesamiento por lotes

El procesamiento por lotes (batch) es más simple de implementar y suficiente para muchos reportes que no necesitan estar actualizados al segundo. El streaming, en cambio, es indispensable cuando la latencia importa: detectar fraude mientras ocurre, o actualizar un dashboard operativo en tiempo real.

Herramientas típicas

Sistemas como Apache Kafka se usan para transportar los eventos en tiempo real entre distintos sistemas, mientras que motores como Spark Streaming o Flink se encargan de procesar y transformar esos eventos a medida que llegan.