# AI Failure Pattern Collector

> ai-failure-pattern-collector

- Skill: `tybiefh-beep/ai-failure-pattern-collector` (Agent Skill)
- Install (CLI): `npx skillmds@latest add tybiefh-beep/ai-failure-pattern-collector`
- Raw SKILL.md: https://api.skillmd.com/api/skills/tybiefh-beep/ai-failure-pattern-collector/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: tybiefh-beep (https://skillmd.com/u/tybiefh-beep)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/tybiefh-beep/ai-failure-pattern-collector

---


# ai-failure-pattern-collector

## 触发条件

需要系统性记录 AI 执行偏差、误解指令、输出质量不达标等失败案例时使用。不记录成功路径,专门收集需要人工干预的节点、AI 误解的原因分析、以及有效的修正方式。

## 反触发(不适用)

- 成功率统计场景使用其他工具
- 实时任务中不应中断去记录
- 失败原因明显是网络/API 问题而非模型理解问题时跳过
- 用户没明确同意记录时(隐私边界)

## Gotchas(易错点)

- **失败定义主观,先定标准** → "失败" = 用户最终修改/拒绝/重新生成的回复;不是 AI 自己说"我不确定"
- **记录时机卡对话流畅** → 不能打断主线,要么对话结束钩子,要么用户主动标记
- **根因归类容易贴错标签** → 别用"幻觉"概括一切,区分:指令误解/事实幻觉/格式偏差/边界判断/上下文丢失
- **高频失败 = 模型 + 任务的组合问题,不是模型单方面问题** → 同一模型在不同任务表现差异巨大,记录时必须带任务类型
- **聚类预警容易误报** → 阈值设太严漏报,太松噪音淹没;建议单类型 ≥ 3 次/月 才预警
- **数据隐私** → 不要记录用户输入的敏感内容(密码/医疗/财务),只记 AI 输出偏差本身

## 覆盖操作(必须支持)

- [ ] 失败条目数据结构(任务描述 / 偏差描述 / 根因分析 / 修正方式 / 标签 / 模型版本)
- [ ] 快速记录 UI(对话中一键标记当前轮次为失败案例,≤ 3 次点击)
- [ ] 失败模式分类(指令误解 / 幻觉 / 格式偏差 / 边界判断失误 / 上下文丢失)
- [ ] 按标签/提供商/模型版本/时间检索
- [ ] 定期 AI 聚类分析:自动发现高频失败模式并生成预警规则
- [ ] 导出失败清单(给模型供应商反馈或自己回看)

## 工作流(分阶段)

### 1. 立项
- 决定记录粒度(每轮对话 vs 每任务完成时)
- 决定存储(纯本地文件 / SQLite / 第三方笔记工具)
- 定失败判定标准(用户主动标记 / AI 自评低分 / 事后回看)

### 2. 数据设计
- 字段最小集:时间戳 / 任务摘要 / AI 输出 / 用户修正 / 根因标签 / 模型版本
- 根因标签控制在 5-8 类(多了记不住)
- 提供"补充说明"自由文本字段(每条 ≤ 200 字)

### 3. 实现
- 记录入口要"零摩擦"(1 次点击标记,不要让用户填表)
- 检索界面按"最近 + 高频"两个维度展示
- 聚类分析放后台,主对话不阻塞
- 隐私脱敏自动跑(检测到敏感关键词 → 标记 → 二次确认)

### 4. 运营
- 每周看一次高频失败 → 调整 prompt 或加约束
- 每月导出一次 → 找模型供应商反馈或发 issue
- 季度清理:删除已修正的旧条目,避免数据膨胀

## 交付清单(checklist)

- [ ] 失败条目数据结构定义清楚
- [ ] 一键标记 UI 集成到对话流
- [ ] 至少支持按时间/标签/模型 3 个维度检索
- [ ] 聚类分析能输出"高频失败 top 5"
- [ ] 失败数据可导出(JSON/CSV)
- [ ] 隐私脱敏自动跑
- [ ] 有清理策略(避免无限堆积)

