Ray Train

Distributed training orchestration across clusters. Scales PyTorch/TensorFlow/HuggingFace from laptop to 1000s of nodes. Built-in hyperparameter tuning with Ray Tune, fault tolerance, elastic scaling. Use when training massive models across multiple machines or running distributed hyperparameter sweeps.

synthetic-sciences a38cf09 2 files · 23.1 KB Updated

File contents

synthetic-sciences/openscience/tree/main/backend/cli/skills/ml-training/ray-train commit a38cf09355

Frequently asked questions

npx skillmds@latest add synthetic-sciences/ray-train