Evaluating Llms Harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, APIs.

q2805187159 c3de20b 5 files · 56.7 KB Updated 3 repo stars

File contents

q2805187159/Anvil/tree/main/skills/mlops/evaluation/lm-evaluation-harness commit c3de20b035

Frequently asked questions

npx skillmds add q2805187159/evaluating-llms-harness