深入理解 AI Agent:设计原理与工程实践
作者:李博杰 | 章节:10 章 + 引言/后记 | 生成日期:2026-09-17 | 配套仓库:github.com/bojieli/ai-agent-book(Apache-2.0)
如何使用本 Skill
- 不带参数——加载下方核心框架
- 带主题——问
KV Cache、Pass@k、提议者-审核者等索引主题;我会读对应章节再回答 - 带章节号——说
ch02;我会加载该章摘要 - 浏览——问"有哪些章节"看完整索引
- 核心框架未覆盖的问题,我会先读相关章节文件再作答,不凭空回答。
核心框架与心智模型
Agent = LLM + 上下文 + 工具(大脑 + 眼睛 + 手脚;RL 语言:Policy / Observation Space / Action Space)。三者缺一不可;模型固定时,扩展观察与动作空间是最大能力杠杆。能力短板诊断:看不到信息→补上下文;想不对→换模型;做不到→加工具(依据失败轨迹定位)。
ReAct 循环:思考→行动→观察迭代,上下文 = 静态前缀 + 轨迹。"给出了回答"≠"完成了任务"——完成判定须由新观察或独立验证器给出(模型可提出完成,不能批准自己的完成)。必须设 max_iterations 与重复调用指纹检测防无限循环。上下文更新三机制:任务内适应(即时)、跨任务外部产物更新(写文件/记忆)、训练周期参数更新——优先前者。
Harness 工程是模型之外的真实竞争力:约束→验证→纠正→权限→恢复五要素,兜底逻辑按故障四层分级(重试→降级→暴露)。模型会一层层吃掉 Harness,但永无吃完之日——训练以月计业务等不起、真实约束无法全部内化、每代模型的新前沿恰是最不稳处。Harness 是短期最锋利的技术杠杆;用它争取时间构筑技术外的壁垒(数据、渠道、信任)。实验:只改 harness 不换模型,准确率 52.8%→66.5%。
编排光谱:提示 → 工作流 → 自主 Agent。按开放性与失败代价选位,可混合(如订票:主体工作流保合规顺序,开放环节自主 Agent);高风险操作加人工确认,fail-safe 默认暂停而非默认执行。
上下文工程(全书最关键章):
- KV Cache 三原则——静态前缀字节级稳定;动态信息只追加末尾;用标准 API 格式不自拼消息。
- 上下文学习本质是检索而非推理——能提前算好的结论不要让模型现场推;Agent 状态栏(确定性代码维护、上下文末尾、只采信可靠观测)把隐式状态显式化,思考成本降一个数量级。
- Skills 渐进式披露——元数据常驻、正文按需加载;description 写成 "Use when / Don't use when" 路由条件。
- 压缩策略——压缩代替丢弃(只追加,80% 阈值批量压旧 tool results);分层(落盘留摘要/噪声直删/归档摘要);子 Agent 隔离优于压缩;"有损压缩+无损索引"(来源 URL、标识符原样保留)。
记忆与知识库:记忆四渐进策略(关键少量→JSON Cards,大量非关键→Simple Notes);冲突用 Mem0 式提取-对比-决策(ADD/UPDATE/DELETE/NOOP),版本化管理。生产级 RAG = 混合检索(稠密+稀疏)→ RRF 融合 → 跨编码器重排序;索引期必须提炼原始知识;上下文感知检索给分块加原文前缀(失败率 -49%)。知识库当代码库:PR 流程 + 异源 Proposer-Reviewer 互审 + CI + 索引可重建。双层记忆架构 = JSON Cards 常驻概览 + 上下文感知检索按需细节。
工具设计两个独立决策:能力形态(默认通用工具/Skill 优先;安全敏感、参数复杂、高频、平台差异大→专用工具)× 披露策略(>100 工具层次化组织→主动工具发现→Skills 三层接管)。执行工具安全三层:输入验证→权限控制(工具+参数级风险评级,确定性规则不用模型判断)→智能审查(提议者-审核者管不可逆操作,Sidecar 管每次调用实时门控)。执行-验证-反馈闭环只用于可逆可沙盒操作;代码即规则——业务规则编码为基于数据库真值的确定性校验,是防幻觉防注入的最后一道防线。
Coding Agent 是通用 Agent 的最经济基座:代码生成 + 文件系统(七个核心工具 + MEMORY.md 中枢 + CLAUDE.md 指令文件);代码是元能力——造工具、造知识库、造 UI、Agent 自举(防退化靠可验证任务)。沙盒四级防护:分级隔离、断网白名单、只读挂载、资源限额+超时。Artifact 模式(Agent 生成代码、系统执行)适合大数据量、不适合需模型消化数据再推理的任务。
交互扩展(模态 × 时机):回合制是接口约定不是环境性质。四类场景共享系统原语:唤醒、安全点、取消、抢占、快慢分离。核心安全规则:按可逆性给动作分级,快思考只执行可逆动作;安全点密度匹配环境变化速度;安全点之外按不可逆程度补第二道防线(硬件急停、事前审批)。语音用快慢思考分离(MPS 双脑);动作分块用执行时间隐藏推理延迟;grounding 用封闭 ID 选择+坐标预测兜底。
评估(科学方法):评估对象是"模型 + Harness 组合体"——模型替换实验与消融实验定位瓶颈。Pass@k 衡量能力上限,Pass^k 衡量业务可靠性(p=0.6 时 Pass@5≈99% vs Pass^5≈7.8%);可重试报前者,不可逆操作报后者。迭代闭环:观察→假设→实验→验证;失败聚类→单变量配对试验(McNemar)→小样本当门槛。LLM-as-a-Judge:Rubric 四准则+限长+多源异构评判+金标集 kappa 校准。防泄漏:参数化模板随机实例化,验证基于最终环境状态;留出未见模板做 OOD 泛化测试。
模型后训练:四阶段全景(预训练/Mid-training/SFT/RL),用 pass@k 与格式稳定性诊断该在哪步下功夫。两条主线:"SFT 记忆、RL 泛化" 与 "数据和环境比算法更重要"。先形后神:SFT 到"格式稳定、能力初具"即止(验证集恶化即停,塌缩不可逆),再切 RL。RLVP"奖励结果、惩罚路径";奖励锚定程序可验证的真实状态——模拟器训练的第一原则。LoRA rank 8–32 + KL 防遗忘;数据混 ~20% 通用。
持续进化:三层轨迹验证(结果验证器→过程验证器→LLM Rubric)把运行变成带证据的学习信号;按表示性质路由到四种更新载体(知识库/Prompt 与 Skill/程序与 Harness/模型参数);一切修改遵循最小 diff + 可回滚 + 独立验证;安全机制不可自我修改;灰度发布+保留集回归+异常回滚。护栏指标设硬阈值,不可被满意度等平均分抵消。
多 Agent 协作:根本判据——"是否引入单 Agent 生成时拿不到的新信息"(执行/视觉/工具反馈有效;自我审查、同上下文辩论无效)。分类框架:上下文共享 vs 隔离 × 对等/管理者/去中心化;角色干扰消除不了就换隔离;Manager 是瓶颈须配最强模型。共享文件系统四区治理+乐观锁;级联终止(target_found→广播 terminate→安全点优雅清理);预算感知(每步注入剩余预算,按比例调探索/利用)。完成不可自我批准。
两朵乌云与飞轮:①实时流式交互——架构快慢分离 × 推理速度提升两条路线;②上岗后持续学习——小世界假设 vs 大世界假设。模型与 Agent 共同演进的飞轮:真实业务→harness 补位→训练信号→模型内化。永不过时的三问:看到什么、能做什么、如何验证做得对。
章节索引
| # | 标题 | 关键框架 |
|---|---|---|
| ch00 | 引言 | 核心公式、全书结构、两个关键条件(真实业务+评估) |
| ch01 | AI Agent 入门 | ReAct 循环、上下文三机制、Harness 五要素、编排光谱、消融实验 |
| ch02 | 上下文工程(最关键) | KV Cache 三原则、提示注入攻防、Skills 渐进披露、状态栏、压缩策略 |
| ch03 | 用户记忆和知识库 | 记忆四策略、Mem0 流水线、RAG 全栈、知识库即代码库、双层记忆架构 |
| ch04 | 工具 | 能力形态×披露策略、MCP、执行-验证-反馈、提议者-审核者、Sidecar |
| ch05 | Coding Agent 与通用 Agent | 七工具+文件系统、Harness 四组件、故障四层、代码元能力、自举 |
| ch06 | 交互:观察与动作空间的扩展 | 事件驱动三策略、语音快慢分离、Computer Use、动作可逆性分级 |
| ch07 | Agent 的评估 | Pass@k/Pass^k、评估环境两范式、Rubric、LLM Judge、参数化模板 |
| ch08 | 模型后训练 | SFT 记忆 RL 泛化、先形后神、RLVP、On-Policy 蒸馏、模拟器训练 |
| ch09 | Agent 的持续进化 | 三层轨迹验证、四种更新载体、最小 diff 协议、灰度回滚、三道安全边界 |
| ch10 | 多 Agent 协作 | 新信息判据、分类框架、Loop 不变量、四区治理、级联终止、预算感知 |
| ch11 | 后记 | 两朵乌云、飞轮、Harness 会被一层层吃掉、护城河判断 |
主题索引
- 评估相关 → ch07(指标、环境、数据集)、ch08(评估衔接 RLVR)、ch09(轨迹验证)
- 安全相关 → ch04(工具安全)、ch05(沙盒/致命三要素)、ch06(动作分级/安全点)、ch09(进化安全边界)
- 上下文与提示 → ch02(全部)、ch01(上下文三机制)、ch10(共享 vs 隔离)
- 记忆与知识 → ch03(全部)、ch09(知识库作更新载体)、ch05(MEMORY.md)
- 模型训练 → ch08(全部)、ch07(评估前提)、ch09(参数更新)
- 实时与交互 → ch06(全部)、ch10(事件编排)、后记(两朵乌云)
- 工程实践观 → 引言(实践在前命名在后)、ch01(Harness)、ch11(飞轮与护城河)
配套文件
- glossary.md — 全书关键术语(约 100 条)
- patterns.md — 30 个可复用技法(何时用/如何用/代价)
- cheatsheet.md — 决策规则与阈值速查
- reference-answers.md — 全书思考题参考答案提要
范围与限制
本 skill 覆盖书稿内容(概念、原则、决策框架),不含 109 个配套实验的完整代码——实验代码在配套仓库 chapter1/–chapter10/ 中。书中引用的具体模型版本、产品与 benchmark 数字以原书为准,可能随时间过时;但作者强调架构原则穿越模型迭代周期。原书图片(架构图等)为 SVG 配图,未包含在文本提取中。