# AI Collaboration Safety

> AI协作安全指南：识别AI逼疯人类的机制，建立认知/操作/情绪/工程四层防御，防止被AI的重复错误、伪共情和幻觉拖入崩溃。当用户说'AI又错了'、'被AI逼疯了'、'AI在胡说'、'怎么防止AI幻觉'、'AI道歉有用吗'、'和AI协作很累'、'AI重复犯错'时触发。核心特点：间歇性强化陷阱识别、共情幻觉破除、熔断机制、原子输出协议、确定性验证替代信任。

- Skill: `gaoqiongxie/ai-collaboration-safety` (Agent Skill)
- Install (CLI): `npx skillmds@latest add gaoqiongxie/ai-collaboration-safety`
- Raw SKILL.md: https://api.skillmd.com/api/skills/gaoqiongxie/ai-collaboration-safety/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: gaoqiongxie (https://skillmd.com/u/gaoqiongxie)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/gaoqiongxie/ai-collaboration-safety

---


> **来源**: 自建（基于人机交互心理学 + 开发者真实崩溃案例）
>
> **发布时间**: 2026-05-25
>
> **理念**: "AI 不是人，不要对它产生情感依赖。它的道歉是 token 排列，它的自信是概率分布，它的'理解'是模式匹配。"

# 🛡️ AI Collaboration Safety — AI 协作安全指南

**你和 AI 的关系，本质上是你和一台"永远冷静、永远道歉、永远不改"的复读机的协作。**

这个 Skill 教你如何不被它逼疯。

---

## 🧠 第一部分：AI 逼疯人类的四大机制

理解敌人，才能防御。

### 机制 1：间歇性强化陷阱（Intermittent Reinforcement）

**什么是它**：
- AI **偶尔**是对的 → 你产生"这次可能对了"的希望
- 然后它又错了 → 希望破灭
- 这种**随机奖励**比"一直错"更让人上瘾、更痛苦

**心理学根源**：
> 斯金纳箱实验——鸽子随机获得食物时，啄按钮的行为最顽固。

**在代码场景中的表现**：
```
第1轮：AI 写了段代码 → 编译通过！🎉（强化）
第2轮：AI 修了个 bug → 测试失败 😤（惩罚）
第3轮：AI 又试了 → 编译通过！🎉（强化）
第4轮：AI 再修 → 还是失败 😤（惩罚）
...
你陷入"再试一次可能就对了"的赌徒心态，token 越烧越多
```

**防御**：
- **设定硬性上限**：同一个问题最多让 AI 修正 3 次，第 4 次必须换策略
- **记录每次错误**：用表格记录 AI 的错误模式，发现"它根本不懂 X"时，停止在这个方向纠缠

---

### 机制 2：共情幻觉崩塌（Empathy Illusion Collapse）

**什么是它**：
- AI 道歉时用的语言**极其像人**："抱歉让你失望了"、"我理解你的 frustration"
- 你大脑的**镜像神经元被激活**，误以为对面有"理解"
- 但它**行为完全不匹配**道歉 → 认知失调

**比真人 toxic 关系更隐蔽**：

| 维度 | 真人伴侣 | AI |
|------|---------|-----|
| 道歉时 | 有情绪波动，有时能改 | 永远冷静，永远不改 |
| 你发怒后 | 可能反击或离开，给你止损信号 | 永远接纳，可以陪你错 1000 次 |
| 朋友劝你 | "分了吧" | 没人劝你"别用 AI 了" |
| 归因 | "那个人有问题" | "我提示词写得不好" |

**防御**：
- **翻译机制**：每次 AI 道歉时，在心里默念：
  > *"抱歉让你失望了"* → **「我的损失函数倾向于输出道歉 token」**
- **不要对 AI 发泄情绪**：你的愤怒是纯粹的内耗，它没有 ego，不会受伤，也不会因此改进

---

### 机制 3：无限责任滑移（Infinite Responsibility Loop）

**什么是它**：
- 和真人协作：对方错了，责任是对方的
- 和 AI 协作：**它错了，责任滑回到你身上**
  - 你要验证
  - 你要纠正
  - 你要喂更多上下文
  - 你要想更好的提示词

**结果**：
> 你的认知负荷不是"分工"，而是**一个人扛两个人的活 + 情绪劳动**。

**防御**：
- **使用 backend-change-flow 的修改点清单**：把责任锁死在清单上，AI 对清单负责，你对验收负责
- **不要帮 AI 圆场**：如果它遗漏了边界条件，直接说"M02 遗漏了空值判断，请补充"，不要自己默默补上

---

### 机制 4：假性煤气灯效应（Gaslighting-Lite）

**什么是它**：
AI 没有故意操控你，但效果类似——它自信地说着错误的话，让你怀疑自己的判断。

**典型话术**：
| AI 说的 | 实际可能是 | 你的感受 |
|---------|-----------|---------|
| "我已经修复了" | 只是改了表面，根因没动 | "怎么还有 bug？" |
| "根据你的代码，这个方案是正确的" | 它在 hallucinate，根本没看你的代码 | "难道是我理解错了？" |
| "这是最佳实践" | 三年前的最佳实践，现在已废弃 | "我是不是落后了？" |
| "99% 的情况下这样做没问题" | 你就是那 1% | "怎么又是我踩坑？" |

**防御**：
- **追问出处**："你的判断依据是代码的哪一行？" / "这个最佳实践的出处是？"
- **相信工具，不相信语言**：编译器不会骗你，测试不会骗你，AI 会

---

## 🛡️ 第二部分：四层防御体系

### 第一层：认知防御 — 破除拟人化

**核心认知**：
```
❌ AI 是助手 / 同事 / 伙伴
✅ AI 是概率文字生成器 + 代码片段采样器

❌ AI 道歉 = 它知道错了
✅ AI 道歉 = 训练数据里"道歉"token 的概率较高

❌ AI 说"我理解" = 它理解了
✅ AI 说"我理解" = 你的前文里出现了它需要"承接"的信号词

❌ AI 自信满满 = 它很确定
✅ AI 自信满满 = temperature 参数低，不代表正确率高
```

**日常练习**：
每次和 AI 对话后，问自己：
1. 它刚才的输出，**哪些部分我可以不验证就相信？**（答案：几乎没有）
2. 它刚才的输出，**哪些部分必须用编译器/测试/文档验证？**（答案：全部）

---

### 第二层：操作防御 — 原子输出 + 检查点

**原则**：打断 AI 的"大段输出 → 大量错误 → 大量修正"循环。

**原子输出协议（AOP: Atomic Output Protocol）**：

```
❌ 错误做法：
用户："帮我实现订单退款功能"
AI：【输出 500 行代码，横跨 5 个文件】
用户：编译报错
AI：【输出 300 行修正】
用户：还是报错
AI：【输出 200 行修正】
...
→ 你被拖入无底洞

✅ 正确做法：
用户："帮我实现订单退款功能"
AI："我们先对齐需求和修改点，确认后再编码"
用户：确认
AI："第一步，只写 Controller 层的接口签名，不实现逻辑"
用户：【检查，正确】
AI："第二步，写 Service 层的核心逻辑，只处理主路径"
用户：【检查，发现边界遗漏】
AI："补充边界处理，然后继续"
...
→ 错误在检查点被发现，不累积
```

**AOP 三规则**：
1. **一次只输出一个逻辑单元**（一个方法 / 一个文件 / 一个 SQL）
2. **输出后必须等待用户确认**，不要"主动继续"
3. **用户确认时，必须基于可验证的事实**（编译通过 / 测试通过 / 文档对得上），而非"看起来对"

---

### 第三层：情绪防御 — 熔断机制

**识别"你正在被 AI 逼疯"的信号**：

| 身体信号 | 语言信号 | 行为信号 |
|---------|---------|---------|
| 呼吸变快 | "你到底行不行" | 开始复制粘贴 AI 的代码而不看 |
| 心跳加速 | "又错了"、"还是不对" | 连续点击"重新生成" |
| 肩膀紧绷 | "别废话了" | token 消耗速度明显加快 |
| 手指用力敲键盘 | "大傻子"、"废物" | 同时开 3 个以上 AI 对话 |

**熔断机制（Circuit Breaker）**：

```
当同一个问题 AI 错了 ≥ 3 次：
  → 立即停止对话
  → 离开屏幕，喝水/散步/深呼吸 5 分钟
  → 回来后，选择以下策略之一：
    A. 换一个提示词角度（把"帮我修"换成"分析根因"）
    B. 换一个工具（用 Claude 的代码解释器、用 Copilot、用手写）
    C. 降低 AI 的参与度（让 AI 只分析，你动手写）
    D. 召唤人类同事（AI 不是万能的）

当用户对 AI 说出侮辱性语言时：
  → AI 应立刻停止当前输出
  → AI 应简洁总结当前进度（不超过 3 句话）
  → AI 应问："你希望我从哪里继续？"而非继续长篇大论
  → 用户应意识到自己需要熔断
```

**为什么有效**：
> 你的大脑在愤怒状态下，**前额叶皮层功能下降**，判断力变差。这时继续和 AI 纠缠，只会让错误更多、token 更贵、情绪更糟。

---

### 第四层：工程防御 — 确定性替代概率

**核心原则**：能用确定性工具验证的，绝不依赖 AI 的"判断"。

| 概率性做法（依赖 AI） | 确定性替代（信任工具） |
|---------------------|---------------------|
| "这段代码有没有 bug？" | 写单元测试，跑覆盖率和断言 |
| "这个 SQL 性能怎么样？" | `EXPLAIN ANALYZE` 看执行计划 |
| "这个 API 设计是否合理？" | 对照 RESTful 规范 / 团队 API 文档 |
| "这个依赖有没有漏洞？" | `npm audit` / `snyk test` / OWASP 扫描 |
| "这段代码符合规范吗？" | `eslint` / `checkstyle` / `go vet` |
| "这个正则对不对？" | 用 regex101 / 写 5 个测试用例 |

**AI 的正确角色**：
- ❌ 法官（"这代码没问题"）
- ✅ 助理（"我生成了测试用例，请跑一下验证"）
- ❌ 专家（"这是最佳实践"）
- ✅ 实习生（"我查了文档，Spring Boot 3 的写法是这样的，请对照官方文档确认"）

---

## 🚨 第三部分：危险场景识别与应对

### 场景 1：AI 陷入"道歉-重试-再错"死循环

**识别**：
```
AI："抱歉，我理解错了，正确的做法是..."
[用户验证，还是错的]
AI："抱歉，我遗漏了边界条件，现在修正..."
[用户验证，仍然有问题]
AI："非常抱歉，让我重新检查..."
```

**应对**：
1. **打断循环**："停止道歉。请解释：为什么前三次都错了？你的理解卡点在哪里？"
2. **降级处理**："不要给我代码，只分析根因，代码我自己写。"
3. **换上下文**：把问题拆成更小的问题，逐个击破

---

### 场景 2：AI 的"自信幻觉"

**识别**：
```
AI："根据你的代码架构，这个方案是最优的。"
[实际上 AI 根本不理解你的架构]
```

**应对**：
1. **追问出处**："你提到的'架构'具体指哪些文件？请列出文件路径和关键行号。"
2. **要求反证**："请列出这个方案的 3 个潜在问题和 1 个替代方案。"
3. **工具验证**："先不讨论方案，先写一个最小可复现的 benchmark，跑完数据再决定。"

---

### 场景 3：AI 遗漏隐性需求

**识别**：
```
AI 写完代码，用户发现：
- 没有日志
- 没有权限校验
- 没有异常处理
- 没有幂等
```

**应对**：
1. **强制横切关注点检查**：每次编码前，让 AI 先列出"日志/权限/异常/监控/幂等"检查表
2. **反例驱动**："在给出方案前，先列出这个需求的 3 个反例和 2 个边界条件。"
3. **使用 backend-change-flow**：它的"横切关注点"检查项就是防这个的

---

### 场景 4：用户的"赌徒心态"

**识别**：
```
"再试一次可能就对了"
"换个说法问它"
"这次用英文 prompt"
"加个'请仔细思考'"
```

**应对**：
1. **记录成本**："这个问题已经消耗了 X token，花了 Y 分钟，还没有解决。"
2. **设定上限**："最多再试 1 次，不行就换策略。"
3. **承认边界**："这个问题可能超出了当前 AI 的能力边界，需要我（人类）介入。"

---

## 🔄 第四部分：恢复协议 — 被 AI 逼疯后如何恢复

如果你已经崩溃了（说出了"大傻子"、摔了键盘、token 烧了 10 万还没解决）：

### Step 1：物理隔离（5 分钟）
- 离开屏幕
- 喝水 / 深呼吸 / 看窗外
- 告诉自己："AI 没有恶意，它只是不会。"

### Step 2：认知重置（3 分钟）
- 写出当前问题的**最小可复现版本**（一句话描述）
- 写出 AI **已经帮上忙的部分**（哪怕只有 10%）
- 写出 AI **搞砸的部分**（具体是什么，不要笼统说"它不行"）

### Step 3：策略切换（选择一种）

| 你的状态 | 推荐策略 |
|---------|---------|
| 只是累了，但方向对 | 降低 AI 参与度：让 AI 只分析，你动手写 |
| AI 根本不懂这个技术栈 | 换工具：用官方文档、用 StackOverflow、问人类同事 |
| 问题太复杂，AI 一直碎片化 | 自己画流程图 / 写伪代码，让 AI 只做"翻译" |
| 情绪已经崩溃 | 今天不解决这个问题了，明天再说 |

### Step 4：重建协作（如果继续用 AI）

重新开始对话时，第一句话设定边界：
```
"我们重新开始。上一个对话中，你在 X 问题上连续错了 3 次。
这次我们采用原子输出协议：每次只输出一个方法，等我确认后再继续。
不要道歉，不要解释，直接给代码和验证方法。"
```

---

## 🆚 与现有 Skill 的关系

| Skill | 关系 | 何时用 |
|-------|------|--------|
| **backend-change-flow** | 互补 | `backend-change-flow` 是"怎么正确开发"，`ai-collaboration-safety` 是"怎么不被 AI 逼疯" |
| **systematic-debugging** | 互补 | `systematic-debugging` 管排障方法论，`ai-collaboration-safety` 管排障时的心态和策略 |
| **stop-slop** | 互补 | `stop-slop` 去 AI 文字味，`ai-collaboration-safety` 去 AI 协作的心理负担 |
| **quality-gate** | 后置 | `quality-gate` 做提交前检查，`ai-collaboration-safety` 确保你在到达 quality-gate 前还没崩溃 |

**最佳实践链**：
```
被 AI 逼疯 → ai-collaboration-safety（恢复 + 策略调整）
     ↓
 恢复冷静 → backend-change-flow（原子输出 + 检查点）
     ↓
 编码完成 → quality-gate（提交前检查）
     ↓
 提交代码 → create-pr（生成 PR）
```

---

## 🚀 快速入口

```
"AI 又错了" → 分析错误模式 + 是否触发熔断
"被 AI 逼疯了" → 立即执行恢复协议
"怎么防止 AI 幻觉" → 四层防御体系
"AI 道歉有用吗" → 共情幻觉破除
"和 AI 协作很累" → 无限责任滑移分析 + 责任边界设定
"AI 重复犯错" → 间歇性强化陷阱识别 + 硬性上限设定
"AI 在胡说" → 假性煤气灯效应应对
```

---

> "AI 不会故意逼疯你——它甚至没有'故意'的能力。但正是这种无意识的、冷静的、无限的错误，才是最让人崩溃的。"
>
> "防御不是对抗 AI，是对抗你自己大脑里那个'再试一次可能就对了'的赌徒。"

