Benchmark2 Systematic Evaluation Of LLM Benchmarks

Systematic evaluation toolkit for assessing large language models across multiple dimensions, enabling comprehensive benchmarking of agent capabilities and comparative analysis of model performance.

adu2021 Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/benchmark2-systematic-evaluation-of-llm-benchmarks commit b55054bacb

Frequently asked questions

npx skillmds@latest add adu2021/benchmark2-systematic-evaluation-of-llm-benchmarks