Trapo Semi Supervised Rl

Bridge labeled and unlabeled data through trajectory similarity in reinforcement learning. Select reliable unlabeled samples by comparing pass-rate evolution trajectories against labeled data. Achieve 42.6% accuracy with 1K labeled + 3K unlabeled samples, surpassing fully-supervised training on 45K labels with 10% annotation budget.

adu2021 e98614d 3.1 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/trapo-semi-supervised-rl commit e98614df20

Frequently asked questions

npx skillmds@latest add adu2021/trapo-semi-supervised-rl