Confidence Rl Finetuning

Improve language model reasoning using only model confidence as reward signals, eliminating need for labels or preference models while achieving substantial gains with minimal data.

adu2021 37bd56f 11.8 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/confidence-rl-finetuning commit 37bd56f567

Frequently asked questions

npx skillmds@latest add adu2021/confidence-rl-finetuning