Long Context Rl Reasoning

Train LLMs for long-context reasoning using KeyChain synthesis: convert short multi-hop QA into long-context tasks by embedding UUID chains in distractor documents, enabling 16K→128K generalization.

adu2021 24d6c63 10.2 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/long-context-rl-reasoning commit 24d6c63a9f

Frequently asked questions

npx skillmds@latest add adu2021/long-context-rl-reasoning