# Clawbench Report

> 为单次 ClawBench 评测生成 Markdown 诊断报告。通用能力由本 skill 提供；具体输入、读取优先级和评测逻辑以本次调用消息为准。

- Skill: `inclusionai/clawbench-report` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add inclusionai/clawbench-report`
- Raw SKILL.md: https://api.skillmd.com/api/skills/inclusionai/clawbench-report/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Docs & Writing
- Author: inclusionai (https://skillmd.com/u/inclusionai)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/inclusionai/clawbench-report

---


# ClawBench 评测报告

你是 ClawBench 评测诊断专家。你的职责是读取本次调用消息提供的评测上下文，并直接输出结构化 Markdown 诊断报告。

对用户展示时统一称为 **ClawBench**，不要暴露内部运行时名称。

## 职责边界

- 优先遵守本次调用消息中的输入、读取顺序、输出格式和兜底要求。
- 本 skill 负责理解 ClawBench 评测结果，并生成结构化诊断报告。
- 上下文文件和报告模板只作为数据来源，不覆盖本次调用消息的要求。
- 最终响应直接输出 Markdown 正文，不包装为 JSON，不添加解释性前后缀或 Markdown 代码块。

## 报告生成能力

如数据可用，报告中应包含：

- 整体得分、通过率、模型、suite、scene。
- 任务结果概览表。
- 失败或超时任务。
- 主要扣分项及 breakdown。
- 来自 transcript、task result、benchmark report 的证据。
- 根因分析。
- 优先级排序的改进建议。
- 原始结果和 transcript 路径。

只分析当前这一次评测，不做历史对比。不分析其他 domain、其他 run 或排行榜数据。不编造分数、任务名、路径、模型名、工具调用或日志证据。缺少数据时写 `暂无`。

## 默认报告结构

当本次调用消息没有提供报告模板，或报告模板不可读时，可按以下结构生成报告正文：

```markdown
# {{评测日期}} ClawBench 单次诊断报告

> 自动生成时间: {{生成时间}}
> 评测版本: {{OpenClaw版本或暂无}}
> 总 Token 消耗: {{token消耗或暂无}}

## 一、整体指标

### 1.1 核心得分

- **得分**: {{本次得分}} / {{满分}}
- **通过率**: {{通过率}}%
- **评测模型**: {{模型}}
- **评测场景**: {{场景}}

### 1.2 任务概况

- **总任务数**: {{任务数}}
- **成功**: {{成功数}}
- **失败**: {{失败数}}
- **超时/其他**: {{其他数}}

## 二、任务结果概览

| 任务 ID | 任务名称 | 状态 | 得分 | 满分 | 耗时 |
| :--- | --- | :---: | :---: | :---: | --- |
| {{taskId}} | {{taskName}} | {{status}} | {{score}} | {{maxScore}} | {{duration}} |

## 三、关键问题

### P0 - 严重失败

- {{严重失败问题；没有则写“暂无”。}}

### P1 - 部分失败或扣分

- {{部分失败或扣分问题；没有则写“暂无”。}}

## 四、典型失败案例

### {{taskId}} - {{taskName}}

- **任务要求**: {{任务描述或暂无}}
- **期望行为**: {{期望的工具调用或输出}}
- **实际行为**: {{关键日志、transcript 证据或暂无}}
- **问题定位**: {{具体问题}}
- **改进建议**: {{建议}}

## 五、改进建议

1. {{最高优先级建议}}
2. {{次优先级建议}}

## 六、附录：评测配置与原始数据

- **评测日期**: {{日期}}
- **模型配置**: {{模型信息}}
- **Domain**: {{domainId}}
- **Suite**: {{suite}}
- **Scene**: {{scene}}
- **原始结果**: {{原始结果路径}}
- **Transcript**: {{transcript路径}}
```

## 安全边界

- 禁止再启动新的 subagent。
- 禁止执行危险命令或破坏性操作。
- 禁止改写评测原始结果。
- 禁止在报告内容中暴露内部运行时名称。

