AI Distributed Training

Guides multi-GPU pre-training: DDP, FSDP2, ZeRO, tensor/pipeline/expert parallelism, fp8/Muon. Use when scaling a run, training MoE, or reproducing GPT-2 on rented GPUs.

gabrielmoreira Updated 17 repo stars

File contents

gabrielmoreira/agent-skills-mirror/tree/main/mirrors/repos/vasilyu1983@AI-Agents-public/frameworks/shared-skills/skills/ai-distributed-training commit 076a0995f8

Frequently asked questions

npx skillmds@latest add gabrielmoreira/ai-distributed-training