Evaluating Code Models

Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics. Use when benchmarking code models, comparing coding abilities, testing multi-language support, or measuring code generation quality. Industry standard from BigCode Project used by HuggingFace leaderboards. Use when this capability is needed.

tomevault-io 820269e 2 files · 12.1 KB Updated

File contents

tomevault-io/skills-registry/tree/main/davila7--claude-code-templates--evaluation-bigcode-evaluation-harness commit 820269e518

Frequently asked questions

npx skillmds@latest add tomevault-io/evaluating-code-models