Swebench Eval

Evaluates language models' ability to resolve real-world software engineering issues by generating code patches. It probes long-context reasoning, cross-file dependency understanding, and execution-based validation within large, complex codebases. Use when the user wants to benchmark on SWE-bench, or asks about evaluating this task. Reports resolve_rate.

qhjqhj00 7d85ba0 2.6 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/swebench-eval commit 7d85ba0c73

Frequently asked questions

npx skillmds add qhjqhj00/swebench-eval