Claw Eval Zh

執行 claw-eval-zh 中文 agent benchmark,評估 OpenClaw agent 在中文真實任務上的表現。可用於測試模型的中文 agentic 能力、比較模型、跑 Pass^k 一致性評估,或匯出 Claw-Eval 風格的中文任務集。改編自 PinchBench,任務格式參考 Claw-Eval 中文任務風格。

voidful b6778cf 16 files · 631.5 KB Updated

File contents

voidful/taiwan-agent-bench/tree/main/ commit b6778cff99

Frequently asked questions

npx skillmds@latest add voidful/claw-eval-zh