Deepspeed

Expert guidance for distributed training with DeepSpeed - ZeRO optimization stages, pipeline parallelism, FP16/BF16/FP8, 1-bit Adam, sparse attention

gabrielmoreira Updated 17 repo stars

File contents

gabrielmoreira/agent-skills-mirror/tree/main/mirrors/repos/OpenLAIR@dr-claw/skills/distributed-training/deepspeed commit 8d1650e3bc

Frequently asked questions

npx skillmds@latest add gabrielmoreira/deepspeed