Evaluate model-generated code execution with SandboxFusion

Use SandboxFusion to run and judge LLM-generated code in controlled sandboxes across many languages and benchmark-style evaluation tasks.

agentskillexchange Updated 28 repo stars

File contents

agentskillexchange/skills/tree/main/skills/evaluate-model-generated-code-execution-with-sandboxfusion commit eab7816978

Frequently asked questions

npx skillmds@latest add agentskillexchange/evaluate-model-generated-code-execution-with-sandboxfusion