Obliteratus

Remove refusal behaviors from open-weight LLMs using OBLITERATUS — mechanistic interpretability techniques (diff-in-means, SVD, whitened SVD, SAE decomposition, etc.) to excise guardrails while preserving reasoning. 9 CLI methods (+ 4 Python-API-only), 15 analysis modules, 116 model presets across 5 compute tiers. Use when a user wants to uncensor, abliterate, or remove refusal from an LLM.

intertwine d9525a3 6 files · 31.0 KB Updated

File contents

intertwine/hermes-agent/tree/main/skills/mlops/obliteratus commit d9525a347d

Frequently asked questions

npx skillmds@latest add intertwine/obliteratus