Bubench Run

Use this skill whenever the user describes a benchmark experiment using any combination of these parameters — agent (e.g. browser-use, skyvern), model (e.g. deepseek, minimax, claude, gemini, gpt), data/benchmark (e.g. LexBench-Browser), browser (e.g. Chrome-Local, lexmount), and tasks (specific IDs or "all"). Trigger phrases include "跑实验 agent=xxx model=xxx", "跑实验 agent xxx model xxx", "run [model] on [tasks]", "eval [model] results", "re-run [model]", or any request that specifies an agent + model + task set to execute or evaluate. Also triggers on requests to chain run→eval pipelines, check experiment progress, or read final results.

lexmount 57f2f1a 6.4 KB Updated

File contents

lexmount/browseruse-agent-bench/tree/main/browseruse_bench/skills/bubench-run commit 57f2f1a33b

Frequently asked questions

npx skillmds@latest add lexmount/bubench-run