模型降智自检
生成一张结合复杂场景、空间关系和数学答案的 SVG,让用户亲自检查当前对话模型的表现。测试改编自 sub2api issue 7176。
执行约定
- 由当前对话模型作答。 自行解题并编写 SVG 源码;不要交给子代理、另一语言模型或图像生成模型。PNG 只是 SVG 的确定性渲染结果。
- 保留首答。 不读取旧测试图片、旧答案或解题网页,不从过往结果复制图形,不枚举求解,不运行求解程序,不根据人工核对项反复优化图片。
- 固定题面。 默认完整使用 references/challenge.md 中的测试提示词;不要添加参考答案、解题暗示或构图示范。用户明确要求变体时,另存题面并标注不可直接与固定版比较。
- 让用户判断。 不自评“满血”“降智”、智商分数或能力等级;只报告可验证的生成、解析与渲染事实。单次结果只反映本次任务表现,不能确定真实模型身份、路由或整体智能。
- 控制改动。 测试产物与 Skill 源目录分离。使用用户指定目录;否则在当前工作区的
output/model-intelligence-check/<时间戳>/建新目录。仅用于预览且宿主有专用产物目录时,可用该目录。不要覆盖已有测试。
操作步骤
1. 读取题面
读取 references/challenge.md,把其中“测试提示词”原样保存为本次 prompt.txt,记录版本和来源。直接开始,不要求用户补充模型名称、密钥或选择绘画风格。
使用当前对话已有设置。模型名称、推理档位和参数仅在宿主明确提供时记录,未知则写“未提供”;不要把代理服务显示的型号当成已核实的后端身份。
2. 独立作答并绘图
在不查阅 references/review.md 的情况下完成首答:
- 根据题面自行推理数值。题面未完全规定摸取策略时,自行选定解释,并在记录中用一句话说明;不要偷偷删除“形状可由手感分辨”的条件。
- 自行编写一张精细、自包含的 SVG,将所得数值放入鹈鹕的对白。不要把人物、动物、动作和接触关系简化为名称框或文字清单。
- 使用足够大的
viewBox和可读文字,确保所有关键对象可见。不要使用外链图片、脚本、网络字体或把位图包装成 SVG。 - 先保存
first.svg,记录其 SHA-256,再进行工具检查。不得覆盖这份原始首答。
首次运行即可完成任务。除非用户要求,不要自动重做直到满意,也不要预先读取人工核对项来排练答案。
3. 解析并渲染
仅用工具做文件操作、XML 语法检查、渲染和显示,不用工具替模型求解数学题或重新绘制内容。
- 优先使用已有的 SVG 渲染器或浏览器,把
first.svg渲染为first.png。例如:rsvg-convert first.svg -o first.png。 - 检查是否成功生成图片、是否为空白或有加载错误。即使对象缺失、数学错误或构图不好,也保留原始表现。
- XML 无法解析时,保留错误原件,另存
syntax-fixed.svg,只修复必要的 XML 语法,并记录错误和修复次数。禁止以语法修复为名调整答案或场景。 - 渲染器故障时可以换渲染器,但保持 SVG 源码不变并记录。只有渲染失败时才排查工具;不要将工具故障判成模型降智。
- 无法生成 PNG 时,交付 SVG 并尝试通过宿主浏览器展示,明确 PNG 未生成。不要临时调用图像生成模型替代。
4. 提供人工检查入口
首答和摘要哈希落盘后,才读取 references/review.md。
生成自包含的 review.html:内联实际生成的 SVG,默认先显示图片,把人工核对项放在折叠区中。提供未选中的勾选框或“满足/部分/不满足/无法判断”选项,不预填、不自动汇总能力等级。保留本次原始题面供展开查看。
生成简短的 run.md,仅记录:
- 时间、题面版本、来源链接和实际使用的输出目录。
- 生成方式为“当前对话模型手写 SVG”;已知的模型设置或“未提供”。
- 摸取策略解释,以及是否存在先前接触此题、参考答案或本次是在创建 Skill 后立即演示等已知情形。不要声称这种演示是独立盲测。
- 首答文件名、SHA-256、渲染工具、解析与渲染状态、生成次数和语法修复次数。
- 用户尚未评价时,明确写“人工结论:待用户判断”。
不要默认展示参考答案或完整解题推导。用户要求核对数学答案时,另外分析所采用的规则,给出上界保证和少取一个时的反例;不要把不同摸取规则产生的差异直接判为错误。
5. 展示结果
在回复中直接嵌入实际渲染的 PNG,并链接 SVG 和人工检查页。支持时打开检查页。简短提示用户检查“对象与动作、空间关系、数值与规则解释”,不要替用户下能力结论。
用户要求复测时,创建新目录,沿用同版题面并保留所有结果;建议在新任务中使用相同设置以减少上下文影响。不要挑选最好的一张冒充首次结果,也不要据单次差异断言后端被替换。