# AI Reasoning Process Visualizer

> ai-reasoning-process-visualizer

- Skill: `tybiefh-beep/ai-reasoning-process-visualizer` (Agent Skill)
- Install (CLI): `npx skillmds@latest add tybiefh-beep/ai-reasoning-process-visualizer`
- Raw SKILL.md: https://api.skillmd.com/api/skills/tybiefh-beep/ai-reasoning-process-visualizer/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: tybiefh-beep (https://skillmd.com/u/tybiefh-beep)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/tybiefh-beep/ai-reasoning-process-visualizer

---


# ai-reasoning-process-visualizer

## 触发条件

需要将 AI 的中间推理步骤、排除选项、不确定节点暴露给用户时使用。让用户在执行过程的中间节点介入修正,而非只能接受或拒绝最终结果,打破 AI 输出黑箱。

## 反触发(不适用)

- 简单单步任务无需可视化(展示中间步骤反而干扰)
- 用户明确不需要了解推理过程时
- 模型本身不支持 chain-of-thought 输出时退化为普通对话
- 实时性要求高、不能等待用户介入时(批量任务)

## Gotchas(易错点)

- **强制 CoT 输出,部分模型不配合** → prompt 要明确"用 ```steps [1]...``` 格式,不要解释",并加 few-shot 示例
- **步骤粒度难控** → 太粗看不出推理,太细视觉爆炸;建议"3-7 步"为目标,超过 7 步合并,少于 3 步不展示
- **"确定度分数"AI 自评会撒谎** → 简单任务报 99%,难任务报 50% 都见过;不能当真理,只能参考
- **节点介入后,上下文怎么重传是个难题** → 不能简单"回到第 N 步重跑",因为 LLM 不知道中间所有状态;用"把第 N 步的 prompt + 用户修改 + 第 N+1 步原输出"作为新 prompt 重跑
- **推理路径对比 N 模型 × M 步开销大** → 默认只对比 2 个模型,3+ 要用户明确选
- **可视化要响应式** → 时间线在手机上看 7 步要滚动,提供"折叠早期步骤"功能
- **推理 ≠ 思考过程** → CoT 输出的"步骤"是 LLM 模拟的,不是真思考;不要给用户"这是 AI 真在想"的错觉

## 覆盖操作(必须支持)

- [ ] 结构化 CoT prompt 设计(强制 AI 输出步骤标记,`[STEP 1] ... [STEP 2] ...` 或 JSON)
- [ ] 推理步骤解析与树状/时间线可视化渲染
- [ ] 节点级介入 UI(在任意步骤暂停、修改前提、让 AI 从该点重新推理)
- [ ] 不确定度标注(AI 自评信心分数 0-100 的提取与展示)
- [ ] 推理路径对比(同一任务不同模型的推理差异可视化)
- [ ] 折叠/展开早期步骤
- [ ] 导出推理过程(markdown / 图片)

## 工作流(分阶段)

### 1. 立项
- 决定 CoT 强制方式(prompt 强制 / 微调 / few-shot)
- 决定步骤粒度(粗 3-4 步 / 中 5-7 步 / 细 8+ 步)
- 决定介入粒度(每步都可介入 / 仅关键决策点)

### 2. Prompt 设计
- 输出格式必须机器可解析(避免自然语言散文)
- 推荐 JSON:`{ steps: [{ idx, type, content, confidence }], final: "..." }`
- 步骤 type 分类:observation / hypothesis / decision / elimination / final

### 3. 实现
- 流式接收时,边收边解析边渲染
- 节点可点击 → 弹窗显示完整 prompt + AI 原始输出
- 介入后保存旧路径,可对比"AI 原始 vs 介入后"
- 推理过程存 localStorage,可回放

### 4. 评估
- 至少 3 个真实任务跑一遍,看 CoT 是否真在"推理"还是"装样子"
- 用户介入频率 ≥ 30% → 说明 AI 真在不确定,可视化有价值
- 介入后成功率 ≥ 70% → 说明介入接口有效

## 交付清单(checklist)

- [ ] CoT 输出格式机器可解析
- [ ] 步骤可视化(树状 + 时间线二选一)
- [ ] 节点可介入(暂停/修改/重跑)
- [ ] 不确定度可视化(进度条/颜色)
- [ ] 多模型推理路径可对比
- [ ] 推理过程可回放/导出
- [ ] 响应式(手机可看)
- [ ] 有"AI 装样子"提示(说明 CoT 性质)

