Optimizing Parquet Storage

Optimize columnar Parquet storage for analytics — file and row-group sizing, compression codecs (Snappy/ZSTD), partitioning and file layout, column pruning and predicate pushdown, dictionary encoding, and fixing the small-files problem. Use when Parquet reads are slow or costly, files are too small/large, choosing compression or partitioning, or improving scan pruning on a data lake.

Unknown-333 10042b9 3.1 KB Updated

File contents

Unknown-333/awesome-data-engineering-skills/tree/main/skills/optimizing-parquet-storage commit 10042b98e6

Frequently asked questions

npx skillmds@latest add unknown-333/optimizing-parquet-storage