Spark Job Optimization

当 Spark 作业慢、出现数据倾斜/shuffle 瓶颈/OOM,或需为大数据量管道做分区、缓存、Join、内存与 AQE 调优时使用;按「诊断→分区→Join→缓存→shuffle→内存→格式→验证」产出可执行 PySpark 代码与生产配置;不适用于非 Spark 引擎(Flink/Trino/单机 pandas/Polars)或与性能无关的纯 ETL 逻辑编写。触发词:Spark 慢、数据倾斜、shuffle 优化、broadcast join、AQE、executor 内存、repartition、Kryo

findscripter 116ee17 7.3 KB Updated

File contents

findscripter/everything-skills/tree/main/03-data/spark-job-optimization commit 116ee17f51

Frequently asked questions

npx skillmds@latest add findscripter/spark-job-optimization