ai-reasoning-process-visualizer
触发条件
需要将 AI 的中间推理步骤、排除选项、不确定节点暴露给用户时使用。让用户在执行过程的中间节点介入修正,而非只能接受或拒绝最终结果,打破 AI 输出黑箱。
反触发(不适用)
- 简单单步任务无需可视化(展示中间步骤反而干扰)
- 用户明确不需要了解推理过程时
- 模型本身不支持 chain-of-thought 输出时退化为普通对话
- 实时性要求高、不能等待用户介入时(批量任务)
Gotchas(易错点)
- 强制 CoT 输出,部分模型不配合 → prompt 要明确"用
steps [1]...格式,不要解释",并加 few-shot 示例 - 步骤粒度难控 → 太粗看不出推理,太细视觉爆炸;建议"3-7 步"为目标,超过 7 步合并,少于 3 步不展示
- "确定度分数"AI 自评会撒谎 → 简单任务报 99%,难任务报 50% 都见过;不能当真理,只能参考
- 节点介入后,上下文怎么重传是个难题 → 不能简单"回到第 N 步重跑",因为 LLM 不知道中间所有状态;用"把第 N 步的 prompt + 用户修改 + 第 N+1 步原输出"作为新 prompt 重跑
- 推理路径对比 N 模型 × M 步开销大 → 默认只对比 2 个模型,3+ 要用户明确选
- 可视化要响应式 → 时间线在手机上看 7 步要滚动,提供"折叠早期步骤"功能
- 推理 ≠ 思考过程 → CoT 输出的"步骤"是 LLM 模拟的,不是真思考;不要给用户"这是 AI 真在想"的错觉
覆盖操作(必须支持)
- 结构化 CoT prompt 设计(强制 AI 输出步骤标记,
[STEP 1] ... [STEP 2] ...或 JSON) - 推理步骤解析与树状/时间线可视化渲染
- 节点级介入 UI(在任意步骤暂停、修改前提、让 AI 从该点重新推理)
- 不确定度标注(AI 自评信心分数 0-100 的提取与展示)
- 推理路径对比(同一任务不同模型的推理差异可视化)
- 折叠/展开早期步骤
- 导出推理过程(markdown / 图片)
工作流(分阶段)
1. 立项
- 决定 CoT 强制方式(prompt 强制 / 微调 / few-shot)
- 决定步骤粒度(粗 3-4 步 / 中 5-7 步 / 细 8+ 步)
- 决定介入粒度(每步都可介入 / 仅关键决策点)
2. Prompt 设计
- 输出格式必须机器可解析(避免自然语言散文)
- 推荐 JSON:
{ steps: [{ idx, type, content, confidence }], final: "..." } - 步骤 type 分类:observation / hypothesis / decision / elimination / final
3. 实现
- 流式接收时,边收边解析边渲染
- 节点可点击 → 弹窗显示完整 prompt + AI 原始输出
- 介入后保存旧路径,可对比"AI 原始 vs 介入后"
- 推理过程存 localStorage,可回放
4. 评估
- 至少 3 个真实任务跑一遍,看 CoT 是否真在"推理"还是"装样子"
- 用户介入频率 ≥ 30% → 说明 AI 真在不确定,可视化有价值
- 介入后成功率 ≥ 70% → 说明介入接口有效
交付清单(checklist)
- CoT 输出格式机器可解析
- 步骤可视化(树状 + 时间线二选一)
- 节点可介入(暂停/修改/重跑)
- 不确定度可视化(进度条/颜色)
- 多模型推理路径可对比
- 推理过程可回放/导出
- 响应式(手机可看)
- 有"AI 装样子"提示(说明 CoT 性质)