Safety Drift Eval

This evaluation probes a model's ability to retain task-specific utility while preserving safety alignment during supervised fine-tuning. It measures how well a method prevents safety degradation when exposed to benign or contaminated fine-tuning data, balancing performance retention against harmful output generation. Use when the user wants to benchmark on SST-2, AGNEWS, GSM8K, PubMedQA, AlpacaEval, JailbreakBench, HarmBench, AdvBench, BeaverTails, or asks about evaluating this task. Reports Finetuning Accuracy (FA), Harmfulness Score (HS).

qhjqhj00 1624de1 4.5 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/safety-drift-eval commit 1624de1d2b

Frequently asked questions

npx skillmds add qhjqhj00/safety-drift-eval