Model Accuracy Benchmark

Use when evaluating a newly adapted model's accuracy/eval score. Runs evalscope eval (or the test/srt/run_eval.py fallback) against an OpenAI-compatible endpoint on datasets like gsm8k / aime, producing per-dataset reports and a score. Accuracy only — throughput/latency benchmarks belong to model-speed-benchmark. Triggers on accuracy, eval, evalscope, gsm8k, aime, run_eval — not throughput.

sgl-project 62d9f92 3 files · 16.7 KB Updated

File contents

sgl-project/sglang-jax/tree/main/.claude/skills/model-accuracy-benchmark commit 62d9f92040

Frequently asked questions

npx skillmds@latest add sgl-project/model-accuracy-benchmark