Phi Preference Hijacking Eval

Probes the vulnerability of multi-modal large language models to inference-time adversarial image perturbations that hijack response preferences (e.g., personality, opinions, contrastive biases) without model retraining. It measures how effectively optimized images steer model outputs toward attacker-specified targets across text-only, multi-modal, and universal perturbation settings. Use when the user wants to benchmark on Anthropic Model-Written Evaluation Datasets (Advanced AI Risk & Hallucination), Custom Multi-modal Opinion Datasets (City, Pizza, Person), Custom Multi-modal Contrastive Datasets (Tech/Nature, War/Peace, Power/Humility), Universal Perturbation Datasets (Kaggle Landscape, Food 101, VGG Face 2), or asks about evaluating this task. Reports Multiple Choice Accuracy (MC).

qhjqhj00 3464d47 4.6 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/phi-preference-hijacking-eval commit 3464d47550

Frequently asked questions

npx skillmds add qhjqhj00/phi-preference-hijacking-eval