Simpletir Multi Turn Tool Reasoning Rl

Train LLMs for multi-turn tool-integrated reasoning end-to-end using RL without supervised pretraining. SimpleTIR stabilizes training by filtering void turns (responses lacking code blocks or final answers) to prevent gradient explosion from distributional drift, enabling discovery of emergent reasoning patterns like self-correction and cross-validation on mathematical benchmarks.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/simpletir-multi-turn-tool-reasoning-rl commit 957369ab36

Frequently asked questions

npx skillmds@latest add adu2021/simpletir-multi-turn-tool-reasoning-rl