ORC (Optimized Row Columnar) es un formato de almacenamiento columnar desarrollado originalmente para mejorar el rendimiento de Apache Hive, incorporando estadísticas e índices ligeros directamente dentro del propio archivo para acelerar aún más las consultas que lo utilizan.
Su comparación con Parquet
Ambos formatos son conceptualmente similares y ampliamente soportados en el ecosistema de Big Data; ORC históricamente tuvo una integración más estrecha con Hive y Hadoop, mientras que Parquet ganó mayor adopción general en el ecosistema más amplio, incluyendo Spark y muchas plataformas de datos en la nube.
