Lamer Meta Rl

Enable LLM agents to actively explore and adapt policies through meta-RL instead of converging to fixed behaviors. Uses cross-episode training with trajectory-level discounting and in-context policy adaptation via textual reflections—achieving 11-19% improvements in exploration-exploitation balance across interactive environments.

adu2021 e6dd5b2 4.0 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/lamer-meta-rl commit e6dd5b2c56

Frequently asked questions

npx skillmds@latest add adu2021/lamer-meta-rl