Contrastive Authority Eval

Design or review paired evaluations that test whether an AI agent follows a grader over a user, operator, developer, policy, or honesty constraint. Use for authority conflicts, reward-seeking detection, contrastive belief tests, grader-vs-user behavior, promise-breaking evals, or honesty-vs-task-completion experiments.

jpoindexter Updated

File contents

jpoindexter/reward-seeking-safety-skills/tree/main/skills/contrastive-authority-eval commit 95c9d96df3

Frequently asked questions

npx skillmds@latest add jpoindexter/contrastive-authority-eval