Ais Bench Eval

在评测机上用 ais_bench 自动评测大模型的四类基准:精度(mmlu/ceval/gsm8k 等数据集打分)、性能(吞吐/TTFT/TPOT 压测)、Agent(SWE-bench/Terminal-Bench/tau2-bench)、多模态(mmmu 等)。覆盖评测发起、后台执行、进度跟踪、断点续跑、分数提取全流程。适用于"帮我评测模型/跑个 benchmark/测下精度/性能压测/SWE-bench 跑个分/评测任务怎么样了/续跑上次评测"等请求;不用于部署或起模型推理服务、不做精度问题根因排查(那是 vllm-ascend-accuracy 的职责)、也不管理评测机本身的机器清单(server-management 的职责)。

zhaochuang001 Updated

File contents

zhaochuang001/awesome-agent-skills/tree/main/ais-bench-eval commit b5740d4827

Frequently asked questions

npx skillmds@latest add zhaochuang001/ais-bench-eval