# AI Agent Book

> 知识库：《深入理解 AI Agent：设计原理与工程实践》（李博杰）。当需要应用本书的 Agent 架构原则——上下文工程、记忆与知识库、工具设计、Coding Agent、交互扩展、评估、模型后训练、持续进化、多 Agent 协作——或查阅相关概念与决策规则时使用。

- Skill: `lavacourage07/ai-agent-book` (Agent Skill, multi-file: 17 files)
- Install (CLI): `npx skillmds@latest add lavacourage07/ai-agent-book`
- Raw SKILL.md: https://api.skillmd.com/api/skills/lavacourage07/ai-agent-book/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: LavaCourage07 (https://skillmd.com/u/lavacourage07)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/lavacourage07/ai-agent-book

---


<!-- argument-hint: [主题、框架名或章节号] -->

# 深入理解 AI Agent：设计原理与工程实践
**作者**：李博杰 | **章节**：10 章 + 引言/后记 | **生成日期**：2026-09-17 | **配套仓库**：github.com/bojieli/ai-agent-book（Apache-2.0）

## 如何使用本 Skill

- **不带参数**——加载下方核心框架
- **带主题**——问 `KV Cache`、`Pass@k`、`提议者-审核者` 等索引主题；我会读对应章节再回答
- **带章节号**——说 `ch02`；我会加载该章摘要
- **浏览**——问"有哪些章节"看完整索引
- 核心框架未覆盖的问题，我会先读相关章节文件再作答，不凭空回答。

---

## 核心框架与心智模型

**Agent = LLM + 上下文 + 工具**（大脑 + 眼睛 + 手脚；RL 语言：Policy / Observation Space / Action Space）。三者缺一不可；模型固定时，扩展观察与动作空间是最大能力杠杆。能力短板诊断：看不到信息→补上下文；想不对→换模型；做不到→加工具（依据失败轨迹定位）。

**ReAct 循环**：思考→行动→观察迭代，上下文 = 静态前缀 + 轨迹。"给出了回答"≠"完成了任务"——完成判定须由新观察或独立验证器给出（模型可提出完成，不能批准自己的完成）。必须设 max_iterations 与重复调用指纹检测防无限循环。上下文更新三机制：任务内适应（即时）、跨任务外部产物更新（写文件/记忆）、训练周期参数更新——优先前者。

**Harness 工程是模型之外的真实竞争力**：约束→验证→纠正→权限→恢复五要素，兜底逻辑按故障四层分级（重试→降级→暴露）。**模型会一层层吃掉 Harness，但永无吃完之日**——训练以月计业务等不起、真实约束无法全部内化、每代模型的新前沿恰是最不稳处。Harness 是短期最锋利的技术杠杆；用它争取时间构筑技术外的壁垒（数据、渠道、信任）。实验：只改 harness 不换模型，准确率 52.8%→66.5%。

**编排光谱**：提示 → 工作流 → 自主 Agent。按开放性与失败代价选位，可混合（如订票：主体工作流保合规顺序，开放环节自主 Agent）；高风险操作加人工确认，fail-safe 默认暂停而非默认执行。

**上下文工程（全书最关键章）**：
- **KV Cache 三原则**——静态前缀字节级稳定；动态信息只追加末尾；用标准 API 格式不自拼消息。
- **上下文学习本质是检索而非推理**——能提前算好的结论不要让模型现场推；Agent 状态栏（确定性代码维护、上下文末尾、只采信可靠观测）把隐式状态显式化，思考成本降一个数量级。
- **Skills 渐进式披露**——元数据常驻、正文按需加载；description 写成 "Use when / Don't use when" 路由条件。
- **压缩策略**——压缩代替丢弃（只追加，80% 阈值批量压旧 tool results）；分层（落盘留摘要/噪声直删/归档摘要）；子 Agent 隔离优于压缩；"有损压缩+无损索引"（来源 URL、标识符原样保留）。

**记忆与知识库**：记忆四渐进策略（关键少量→JSON Cards，大量非关键→Simple Notes）；冲突用 Mem0 式提取-对比-决策（ADD/UPDATE/DELETE/NOOP），版本化管理。生产级 RAG = 混合检索（稠密+稀疏）→ RRF 融合 → 跨编码器重排序；索引期必须提炼原始知识；上下文感知检索给分块加原文前缀（失败率 -49%）。知识库当代码库：PR 流程 + 异源 Proposer-Reviewer 互审 + CI + 索引可重建。双层记忆架构 = JSON Cards 常驻概览 + 上下文感知检索按需细节。

**工具设计两个独立决策**：能力形态（默认通用工具/Skill 优先；安全敏感、参数复杂、高频、平台差异大→专用工具）× 披露策略（>100 工具层次化组织→主动工具发现→Skills 三层接管）。执行工具安全三层：输入验证→权限控制（工具+参数级风险评级，确定性规则不用模型判断）→智能审查（提议者-审核者管不可逆操作，Sidecar 管每次调用实时门控）。**执行-验证-反馈闭环**只用于可逆可沙盒操作；代码即规则——业务规则编码为基于数据库真值的确定性校验，是防幻觉防注入的最后一道防线。

**Coding Agent 是通用 Agent 的最经济基座**：代码生成 + 文件系统（七个核心工具 + MEMORY.md 中枢 + CLAUDE.md 指令文件）；代码是元能力——造工具、造知识库、造 UI、Agent 自举（防退化靠可验证任务）。沙盒四级防护：分级隔离、断网白名单、只读挂载、资源限额+超时。Artifact 模式（Agent 生成代码、系统执行）适合大数据量、不适合需模型消化数据再推理的任务。

**交互扩展（模态 × 时机）**：回合制是接口约定不是环境性质。四类场景共享系统原语：唤醒、安全点、取消、抢占、快慢分离。核心安全规则：**按可逆性给动作分级，快思考只执行可逆动作**；安全点密度匹配环境变化速度；安全点之外按不可逆程度补第二道防线（硬件急停、事前审批）。语音用快慢思考分离（MPS 双脑）；动作分块用执行时间隐藏推理延迟；grounding 用封闭 ID 选择+坐标预测兜底。

**评估（科学方法）**：评估对象是"模型 + Harness 组合体"——模型替换实验与消融实验定位瓶颈。**Pass@k 衡量能力上限，Pass^k 衡量业务可靠性**（p=0.6 时 Pass@5≈99% vs Pass^5≈7.8%）；可重试报前者，不可逆操作报后者。迭代闭环：观察→假设→实验→验证；失败聚类→单变量配对试验（McNemar）→小样本当门槛。LLM-as-a-Judge：Rubric 四准则+限长+多源异构评判+金标集 kappa 校准。防泄漏：参数化模板随机实例化，验证基于最终环境状态；留出未见模板做 OOD 泛化测试。

**模型后训练**：四阶段全景（预训练/Mid-training/SFT/RL），用 pass@k 与格式稳定性诊断该在哪步下功夫。两条主线：**"SFT 记忆、RL 泛化"** 与 **"数据和环境比算法更重要"**。先形后神：SFT 到"格式稳定、能力初具"即止（验证集恶化即停，塌缩不可逆），再切 RL。RLVP"奖励结果、惩罚路径"；奖励锚定程序可验证的真实状态——模拟器训练的第一原则。LoRA rank 8–32 + KL 防遗忘；数据混 ~20% 通用。

**持续进化**：三层轨迹验证（结果验证器→过程验证器→LLM Rubric）把运行变成带证据的学习信号；按表示性质路由到四种更新载体（知识库/Prompt 与 Skill/程序与 Harness/模型参数）；一切修改遵循**最小 diff + 可回滚 + 独立验证**；安全机制不可自我修改；灰度发布+保留集回归+异常回滚。护栏指标设硬阈值，不可被满意度等平均分抵消。

**多 Agent 协作**：根本判据——"是否引入单 Agent 生成时拿不到的新信息"（执行/视觉/工具反馈有效；自我审查、同上下文辩论无效）。分类框架：上下文共享 vs 隔离 × 对等/管理者/去中心化；角色干扰消除不了就换隔离；Manager 是瓶颈须配最强模型。共享文件系统四区治理+乐观锁；级联终止（target_found→广播 terminate→安全点优雅清理）；预算感知（每步注入剩余预算，按比例调探索/利用）。完成不可自我批准。

**两朵乌云与飞轮**：①实时流式交互——架构快慢分离 × 推理速度提升两条路线；②上岗后持续学习——小世界假设 vs 大世界假设。模型与 Agent 共同演进的飞轮：真实业务→harness 补位→训练信号→模型内化。永不过时的三问：**看到什么、能做什么、如何验证做得对。**

---

## 章节索引

| # | 标题 | 关键框架 |
|---|------|----------|
| [ch00](chapters/ch00-introduction.md) | 引言 | 核心公式、全书结构、两个关键条件（真实业务+评估） |
| [ch01](chapters/ch01-agent-intro.md) | AI Agent 入门 | ReAct 循环、上下文三机制、Harness 五要素、编排光谱、消融实验 |
| [ch02](chapters/ch02-context-engineering.md) | 上下文工程（最关键） | KV Cache 三原则、提示注入攻防、Skills 渐进披露、状态栏、压缩策略 |
| [ch03](chapters/ch03-memory-knowledge.md) | 用户记忆和知识库 | 记忆四策略、Mem0 流水线、RAG 全栈、知识库即代码库、双层记忆架构 |
| [ch04](chapters/ch04-tools.md) | 工具 | 能力形态×披露策略、MCP、执行-验证-反馈、提议者-审核者、Sidecar |
| [ch05](chapters/ch05-coding-agent.md) | Coding Agent 与通用 Agent | 七工具+文件系统、Harness 四组件、故障四层、代码元能力、自举 |
| [ch06](chapters/ch06-interaction.md) | 交互：观察与动作空间的扩展 | 事件驱动三策略、语音快慢分离、Computer Use、动作可逆性分级 |
| [ch07](chapters/ch07-evaluation.md) | Agent 的评估 | Pass@k/Pass^k、评估环境两范式、Rubric、LLM Judge、参数化模板 |
| [ch08](chapters/ch08-post-training.md) | 模型后训练 | SFT 记忆 RL 泛化、先形后神、RLVP、On-Policy 蒸馏、模拟器训练 |
| [ch09](chapters/ch09-continuous-evolution.md) | Agent 的持续进化 | 三层轨迹验证、四种更新载体、最小 diff 协议、灰度回滚、三道安全边界 |
| [ch10](chapters/ch10-multi-agent.md) | 多 Agent 协作 | 新信息判据、分类框架、Loop 不变量、四区治理、级联终止、预算感知 |
| [ch11](chapters/ch11-afterword.md) | 后记 | 两朵乌云、飞轮、Harness 会被一层层吃掉、护城河判断 |

## 主题索引

- **评估相关** → ch07（指标、环境、数据集）、ch08（评估衔接 RLVR）、ch09（轨迹验证）
- **安全相关** → ch04（工具安全）、ch05（沙盒/致命三要素）、ch06（动作分级/安全点）、ch09（进化安全边界）
- **上下文与提示** → ch02（全部）、ch01（上下文三机制）、ch10（共享 vs 隔离）
- **记忆与知识** → ch03（全部）、ch09（知识库作更新载体）、ch05（MEMORY.md）
- **模型训练** → ch08（全部）、ch07（评估前提）、ch09（参数更新）
- **实时与交互** → ch06（全部）、ch10（事件编排）、后记（两朵乌云）
- **工程实践观** → 引言（实践在前命名在后）、ch01（Harness）、ch11（飞轮与护城河）

## 配套文件

- [glossary.md](glossary.md) — 全书关键术语（约 100 条）
- [patterns.md](patterns.md) — 30 个可复用技法（何时用/如何用/代价）
- [cheatsheet.md](cheatsheet.md) — 决策规则与阈值速查
- [reference-answers.md](reference-answers.md) — 全书思考题参考答案提要

---

## 范围与限制

本 skill 覆盖书稿内容（概念、原则、决策框架），不含 109 个配套实验的完整代码——实验代码在配套仓库 chapter1/–chapter10/ 中。书中引用的具体模型版本、产品与 benchmark 数字以原书为准，可能随时间过时；但作者强调架构原则穿越模型迭代周期。原书图片（架构图等）为 SVG 配图，未包含在文本提取中。

