Adaptive PPO Exploration via Reward History

Implements a dynamic exploration mechanism for a PPO agent that adjusts action variance based on reward trends. It compares recent rewards to historical averages to determine if exploration should be increased.

ECNU-ICALK Updated 559 repo stars

File contents

ECNU-ICALK/AutoSkill/tree/main/SkillBank/ConvSkill/english_gpt4_8/adaptive-ppo-exploration-via-reward-history commit 239b108c10

Frequently asked questions

npx skillmds@latest add ecnu-icalk/adaptive-ppo-exploration-via-reward-history