Slime Rl Training

Fornece orientação para pós-treinamento de LLM com RL usando slime, um framework Megatron+SGLang. Use ao treinar modelos GLM, implementar fluxos de trabalho personalizados de geração de dados, ou precisar de integração estreita com Megatron-LM para escalabilidade em RL.

artubss Updated 10 repo stars

File contents

artubss/SKILLS-CLAUDE-CODE/tree/main/skills/skills/ai-research/post-training-slime commit 25941fbed3

Frequently asked questions

npx skillmds@latest add artubss/slime-rl-training