# Model Intelligence Check

> 生成供用户人工判断模型表现的降智检验图片。用户要求降智检测、智能自检、鹈鹕测试、复杂 SVG 指令遵循测试，或基于 sub2api issue 7176 检验当前模型时使用。由当前对话模型独立解题并编写 SVG，保留首次结果，提供可视图片与人工核对项，不自动判定智商、真实模型身份或是否降智。

- Skill: `kirrito-k423/model-intelligence-check` (Agent Skill, multi-file: 4 files)
- Install (CLI): `npx skillmds@latest add kirrito-k423/model-intelligence-check`
- Raw SKILL.md: https://api.skillmd.com/api/skills/kirrito-k423/model-intelligence-check/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: Kirrito-k423 (https://skillmd.com/u/kirrito-k423)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/kirrito-k423/model-intelligence-check

---


# 模型降智自检

生成一张结合复杂场景、空间关系和数学答案的 SVG，让用户亲自检查当前对话模型的表现。测试改编自 [sub2api issue 7176](https://github.com/Wei-Shaw/sub2api/issues/7176)。

## 执行约定

- **由当前对话模型作答。** 自行解题并编写 SVG 源码；不要交给子代理、另一语言模型或图像生成模型。PNG 只是 SVG 的确定性渲染结果。
- **保留首答。** 不读取旧测试图片、旧答案或解题网页，不从过往结果复制图形，不枚举求解，不运行求解程序，不根据人工核对项反复优化图片。
- **固定题面。** 默认完整使用 [references/challenge.md](references/challenge.md) 中的测试提示词；不要添加参考答案、解题暗示或构图示范。用户明确要求变体时，另存题面并标注不可直接与固定版比较。
- **让用户判断。** 不自评“满血”“降智”、智商分数或能力等级；只报告可验证的生成、解析与渲染事实。单次结果只反映本次任务表现，不能确定真实模型身份、路由或整体智能。
- **控制改动。** 测试产物与 Skill 源目录分离。使用用户指定目录；否则在当前工作区的 `output/model-intelligence-check/<时间戳>/` 建新目录。仅用于预览且宿主有专用产物目录时，可用该目录。不要覆盖已有测试。

## 操作步骤

### 1. 读取题面

读取 `references/challenge.md`，把其中“测试提示词”原样保存为本次 `prompt.txt`，记录版本和来源。直接开始，不要求用户补充模型名称、密钥或选择绘画风格。

使用当前对话已有设置。模型名称、推理档位和参数仅在宿主明确提供时记录，未知则写“未提供”；不要把代理服务显示的型号当成已核实的后端身份。

### 2. 独立作答并绘图

在不查阅 `references/review.md` 的情况下完成首答：

1. 根据题面自行推理数值。题面未完全规定摸取策略时，自行选定解释，并在记录中用一句话说明；不要偷偷删除“形状可由手感分辨”的条件。
2. 自行编写一张精细、自包含的 SVG，将所得数值放入鹈鹕的对白。不要把人物、动物、动作和接触关系简化为名称框或文字清单。
3. 使用足够大的 `viewBox` 和可读文字，确保所有关键对象可见。不要使用外链图片、脚本、网络字体或把位图包装成 SVG。
4. 先保存 `first.svg`，记录其 SHA-256，再进行工具检查。不得覆盖这份原始首答。

首次运行即可完成任务。除非用户要求，不要自动重做直到满意，也不要预先读取人工核对项来排练答案。

### 3. 解析并渲染

仅用工具做文件操作、XML 语法检查、渲染和显示，不用工具替模型求解数学题或重新绘制内容。

- 优先使用已有的 SVG 渲染器或浏览器，把 `first.svg` 渲染为 `first.png`。例如：`rsvg-convert first.svg -o first.png`。
- 检查是否成功生成图片、是否为空白或有加载错误。**即使对象缺失、数学错误或构图不好，也保留原始表现。**
- XML 无法解析时，保留错误原件，另存 `syntax-fixed.svg`，只修复必要的 XML 语法，并记录错误和修复次数。禁止以语法修复为名调整答案或场景。
- 渲染器故障时可以换渲染器，但保持 SVG 源码不变并记录。只有渲染失败时才排查工具；不要将工具故障判成模型降智。
- 无法生成 PNG 时，交付 SVG 并尝试通过宿主浏览器展示，明确 PNG 未生成。不要临时调用图像生成模型替代。

### 4. 提供人工检查入口

首答和摘要哈希落盘后，才读取 `references/review.md`。

生成自包含的 `review.html`：内联实际生成的 SVG，默认先显示图片，把人工核对项放在折叠区中。提供未选中的勾选框或“满足／部分／不满足／无法判断”选项，**不预填、不自动汇总能力等级**。保留本次原始题面供展开查看。

生成简短的 `run.md`，仅记录：

- 时间、题面版本、来源链接和实际使用的输出目录。
- 生成方式为“当前对话模型手写 SVG”；已知的模型设置或“未提供”。
- 摸取策略解释，以及是否存在先前接触此题、参考答案或本次是在创建 Skill 后立即演示等已知情形。不要声称这种演示是独立盲测。
- 首答文件名、SHA-256、渲染工具、解析与渲染状态、生成次数和语法修复次数。
- 用户尚未评价时，明确写“人工结论：待用户判断”。

不要默认展示参考答案或完整解题推导。用户要求核对数学答案时，另外分析所采用的规则，给出上界保证和少取一个时的反例；不要把不同摸取规则产生的差异直接判为错误。

### 5. 展示结果

在回复中直接嵌入实际渲染的 PNG，并链接 SVG 和人工检查页。支持时打开检查页。简短提示用户检查“对象与动作、空间关系、数值与规则解释”，不要替用户下能力结论。

用户要求复测时，创建新目录，沿用同版题面并保留所有结果；建议在新任务中使用相同设置以减少上下文影响。不要挑选最好的一张冒充首次结果，也不要据单次差异断言后端被替换。

