Grpo Rl Training

Orientação especializada para ajuste fino com GRPO/RL usando TRL para treinamento de modelos com raciocínio e tarefas específicas

artubss Updated 10 repo stars

File contents

artubss/SKILLS-CLAUDE-CODE/tree/main/skills/skills/ai-research/post-training-grpo-rl-training commit 6771dff9f2

Frequently asked questions

npx skillmds@latest add artubss/grpo-rl-training