Safe Flow Q Learning

Train offline safe RL agents using Hamilton-Jacobi reachability principles to learn feasibility-gated policies. Combine reward and safety critics with flow-matching teacher policies, distill to one-step actors, and calibrate safety thresholds via conformal prediction—achieving near-zero constraint violations with 2.5× inference speedup.

adu2021 2516599 4.5 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.3-claude-opus-4.6/safe-flow-q-learning commit 25165995ff

Frequently asked questions

npx skillmds@latest add adu2021/safe-flow-q-learning