Rlp Reinforcement Pretraining Objective

Improve reasoning during pretraining (not just post-training) by computing rewards from information gain—how much reasoning improves log-likelihood of observed tokens. Works at 1T token scale across diverse corpora.

adu2021 a43fdee 7.3 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/rlp-reinforcement-pretraining-objective commit a43fdee767

Frequently asked questions

npx skillmds@latest add adu2021/rlp-reinforcement-pretraining-objective