Srpo Vla Policy

Train VLA models for robotic manipulation by using the model's own successful trajectories as self-reference for reward—enable progress-based feedback for failed attempts without external rewards or demonstrations.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/srpo-vla-policy commit b2d9e572e7

Frequently asked questions

npx skillmds@latest add adu2021/srpo-vla-policy