Dynamic Fine Tuning Sft Rl

Minimal modification to SFT that dynamically rescales objectives by token probability. Rectifies implicit reward structure to improve generalization comparable to RL while maintaining SFT simplicity.

adu2021 6a55413 13.6 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/dynamic-fine-tuning-sft-rl commit 6a55413a57

Frequently asked questions

npx skillmds@latest add adu2021/dynamic-fine-tuning-sft-rl