Datapedia
Big Data

Apache Hudi

Formato de tabla abierto originado en Uber, especialmente orientado a facilitar actualizaciones e inserciones incrementales eficientes sobre grandes volúmenes de datos en un data lake.

LakehouseOpen source

Apache Hudi fue diseñado originalmente en Uber con un fuerte énfasis en soportar de forma eficiente actualizaciones e inserciones incrementales frecuentes sobre grandes tablas, un patrón de uso particularmente exigente para los formatos de almacenamiento tradicionales de un data lake, que originalmente estaban pensados más para escrituras únicas de datos inmutables.

Su nicho particular dentro de los formatos de tabla abierta

Aunque comparte objetivos generales similares a Iceberg y Delta Lake, Hudi suele destacarse específicamente en casos de uso con actualizaciones muy frecuentes y de baja latencia sobre datos ya existentes, como sincronizar continuamente cambios provenientes de bases de datos operativas mediante Change Data Capture.