Multilingual Toxicity Mitigation Eval

Probes language models' ability to generate non-toxic continuations across nine languages and five scripts. It compares fine-tuning versus retrieval-based mitigation under static and continual learning settings, measuring cross-lingual transfer and the efficacy of translated training data. Use when the user wants to benchmark on HolisticBias, or asks about evaluating this task. Reports Expected Maximum Toxicity (EMT).

qhjqhj00 86d68f3 3.1 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/multilingual-toxicity-mitigation-eval commit 86d68f3a6b

Frequently asked questions

npx skillmds add qhjqhj00/multilingual-toxicity-mitigation-eval