Results for “multi-node-training”

16 skills
jiachen-t-wang
Emu Generative Pretraining In Multimodality Arxiv 2307 05222
Emu: Generative Pretraining in Multimodality
6
orchestra-research
Openrlhf Training
Train large language models (7B-70B+) with RLHF using PPO, GRPO, DPO, and other algorithms, accelerated by Ray and vLLM for distributed multi-GPU setups.
10.4k · bundle
jiachen-t-wang
Eva Clip Improved Training Techniques For Clip At Scale Arxi
EVA-CLIP: Improved Training Techniques for CLIP at Scale
6
jiachen-t-wang
Chameleon Mixed Modal Early Fusion Foundation Models Arxiv 2
Chameleon: Mixed-Modal Early-Fusion Foundation Models
6
jiachen-t-wang
Multimodal Few Shot Learning With Frozen Language Models Arx
Multimodal Few-Shot Learning with Frozen Language Models
6
jiachen-t-wang
Visual Instruction Tuning Arxiv 2304 08485v2
Visual Instruction Tuning
6
jiachen-t-wang
Matryoshka Representation Learning Arxiv 2205 13147v4
Matryoshka Representation Learning
6
dracounion
Project Based Learning
当需要快速掌握一门新技能或知识领域,且希望通过实践而非单纯理论学习时
11 · bundle
jiachen-t-wang
Gemini A Family Of Highly Capable Multimodal Models Arxiv 23
Gemini: A Family of Highly Capable Multimodal Models
6
jiachen-t-wang
Multimodal Learning With Transformers A Survey Arxiv 2206 06
Multimodal Learning with Transformers: A Survey
6
jiachen-t-wang
Multimodal Neurons In Artificial Neural Networks Arxiv 2103
Multimodal Neurons in Artificial Neural Networks
6
qcmuu
Openrlhf Training
High-performance RLHF framework with Ray+vLLM acceleration. Use for PPO, GRPO, RLOO, DPO training of large models (7B-70B+). Built on Ray, vLLM, ZeRO-3. 2× faster than DeepSpeedChat with distributed architecture and GPU resource sharing.
0 · bundle
tianhao909
Openrlhf Training
High-performance RLHF framework with Ray+vLLM acceleration. Use for PPO, GRPO, RLOO, DPO training of large models (7B-70B+). Built on Ray, vLLM, ZeRO-3. 2× faster than DeepSpeedChat with distributed architecture and GPU resource sharing.
1 · bundle
jiachen-t-wang
Mixup Beyond Empirical Risk Minimization Arxiv 1710 09412v2
Mixup: Beyond Empirical Risk Minimization
6
nvidia
Mcore Run On Slurm
Launch distributed Megatron-LM training jobs on a SLURM cluster with a minimal sbatch skeleton, environment-variable setup for torch.distributed.run, CUDA_DEVICE_MAX_CONNECTIONS rules, container conventions, monitoring, and per-rank failure diagnosis.
2.2k · bundle
k-dense-ai
Pytorch Lightning
Organize PyTorch code into LightningModules, configure Trainers for multi-GPU/TPU, implement data pipelines, callbacks, logging (W&B, TensorBoard, MLflow), and distributed training (DDP, FSDP, DeepSpeed) for scalable neural network training.
30.2k · bundle