Info Driven Policy Optimization Agents

Optimize multi-turn agent policies by measuring turn-level information gain via counterfactual reasoning. Provide dense reward signals identifying which clarifying questions and observations improve the agent's decision distribution, then adaptively blend information rewards with outcome rewards.

adu2021 08dad64 9.6 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/info-driven-policy-optimization-agents commit 08dad6412e

Frequently asked questions

npx skillmds@latest add adu2021/info-driven-policy-optimization-agents