Pear Sft Preparation

Improve post-RL performance by reweighting SFT loss using importance sampling. Prioritize training examples that match the target policy distribution, not the behavior policy. Achieves 14.6% Pass@8 gains on AIME.

adu2021 162c167 8.1 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/pear-sft-preparation commit 162c167d20

Frequently asked questions

npx skillmds@latest add adu2021/pear-sft-preparation