Truthrl Ternary Reward Hallucination Reduction

Reduce LLM hallucinations by training with a ternary reward signal that distinguishes correct answers, hallucinations, and abstentions. This technique incentivizes truthfulness over accuracy-only metrics, enabling safer, more calibrated language models through GRPO-based optimization.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/truthrl-ternary-reward-hallucination-reduction commit 26a98aa4df

Frequently asked questions

npx skillmds@latest add adu2021/truthrl-ternary-reward-hallucination-reduction