Fairmedqa Eval

Evaluates large language models for demographic bias in medical question answering by measuring performance disparities across counterfactual clinical vignettes that systematically vary race, sex, and socioeconomic status while preserving clinical outcomes. Use when the user wants to benchmark on FairMedQA, or asks about evaluating this task. Reports accuracy disparity (AD).

qhjqhj00 60dbab8 4.3 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/fairmedqa-eval commit 60dbab84b0

Frequently asked questions

npx skillmds add qhjqhj00/fairmedqa-eval