深入理解 AI Agent:设计原理与工程实践
全书结构
如何阅读本书
前置知识
致谢
观察空间与动作空间:模型与世界的接口
工具:Agent 的手脚
LLM:Agent 的大脑
上下文:Agent 的眼睛
ReAct 循环
从提示工程到 Loop 工程:工程范式的演进
构建有效 Agent 的核心原则
如何选择模型
编排模式:工作流与自主
护栏与安全性
Harness 五要素与「构建」部分的对应
贯穿全书的设计模式
本章小结
思考题
上下文:决定 Agent 能力上限的关键
消息的四种角色
单轮对话:最简单的 API 调用
带工具调用的多轮交互:Agent 的核心循环
用代码实现 Agent 的核心循环
从 API 视角看上下文的构成
从 API 消息到模型 Token:Chat Template
KV Cache 的原理与约束
KV Cache 与 Prompt Cache:两个层级的缓存
缓存作为架构约束
KV Cache 未必是一次性的:可编辑、可组合的“笔记”
语气与风格:系统提示词的“人格”
结构化提示:系统提示词的“格式”
流程驱动 vs 规则堆砌:系统提示词的“组织方式”
业务规则细化:系统提示词的“内容”
Few-shot 示例:何时给模型看例子
工具定义的设计
提示注入:上下文安全的核心威胁
Skills:领域能力的可组合单元
如何编写一份可用的 Skill
Skills 在上下文中的位置
Skills 与工具的关系
Agent 状态栏的理论基础
Agent 状态栏的构成
Agent 状态栏在上下文中的具体位置
状态更新的两种实现与缓存代价
为什么需要压缩:不只是长度问题
上下文学习的内部机制:检索而非推理
压缩与 KV Cache:看似矛盾,实则互补
生产级的分层压缩机制
压缩策略的设计原则
隔离优于压缩:子 Agent 上下文隔离
本章小结
思考题
记忆能力的评估:三层次框架
记忆的层次结构
用户记忆的四种存储格式
进阶知识表示形态:可执行代码
用户记忆的认知科学基础
记忆框架案例
记忆压缩与整理机制
隐私保护:日志脱敏
文档分块(Chunking)
稠密嵌入:从词汇关联到语义理解
稀疏嵌入:精确匹配的关键词检索
混合检索:两全其美的艺术
结构化索引:从信息检索到知识建模
文件系统范式:用目录结构组织知识
知识应该如何更新
智能体化 RAG:将知识检索工具化的范式转变
RAG 技巧:上下文感知检索
从数据集中提取深度知识:从信息检索到知识发现
前沿探索:多模态记忆
本章小结
思考题
工具的分类
能力的表达形式:专用工具、通用执行器与 Skill
工具描述的艺术
参数传递的保真性
工具生态:MCP 与 Skill Hub
层次化组织与按需加载
模型原生的主动工具发现
Skills:把工具发现变成“按需查阅”
多模态感知
执行工具
协作工具
本章小结
思考题
Coding 是 Agent 的基础能力
案例:从 Manus 到 OpenClaw——通用 Agent 的 Coding 内核
Coding Agent 的整体流程
Harness 工程在 Coding Agent 中的实践
故障与错误恢复
Coding Agent 的实现技巧
Coding Agent 中的搜索工具
Coding Agent 中的文件编辑工具
Coding Agent 的安全
代码作为思考工具
代码作为业务规则的约束
代码驱动的多媒体生成
代码作为系统适配器
代码作为生成式 UI
代码创造代码:Agent 自举
本章小结
思考题
模态与触发时机的扩展
为什么需要异步
OpenClaw 的事件驱动机制实现
事件触发工具
用户沟通工具
虚拟身份与隔离执行环境
事件处理机制
如何让同步模型支持异步打断
深层矛盾与未来方向
交互时序:从级联到全双工
范式一 · 级联流水线(Cascading)
范式二 · 端到端全模态模型(Omni)
范式三 · 全双工交互模型
认知时序:实时交互与深度思考
更像人的语音合成
动作空间设计
视觉定位(Grounding)
能看动画、能听声音的 Computer Use Agent
Computer Use 的世界模型
移动端:生态壁垒比技术更难
硬件与算法的分工
机器人控制的基本结构
长程规划与任务分解
VLA 控制
VLA 的局限
世界模型
从仿真环境到真实机器人
本章小结
思考题
任务定义的四个组成部分
一次真实运行的轨迹
技术奇观:用 Pass@k 看能力上限
业务可靠性:关注 Pass^k
五个组成要素
人机交互型与工具调用型评估环境
基准设计的横向对照
验证器
任务的难度划分
数据泄漏防范
质量控制与长期维护
评估集的三个来源
LLM-as-a-Judge:自动化评估的核心
失败归因:从整条轨迹定位首个错误
端到端回归任务与轨迹前缀回归任务
配对比较与模型排名
选型的关键维度
模型的行为策略
Agent 系统的成本分析
评估驱动的持续迭代
评估结果的统计显著性
Agent 的可观测性
读懂 Benchmark 报告:发现问题的艺术
从数据到假设:构建改进路线图
从结果到决策:数据驱动的权衡
持续迭代:从第一次改进到系统演化
消融基础设施:理解每个特性的真实贡献
AB 测试方法论:区分机制与目标
双层特性开关系统
提示词敏感性评估
以隐私感知分析为评估基础
从外部到内部:评估思维的转变
保真度权衡与领域随机化
本章小结
思考题
预训练在做什么:预测下一个词
Mid-training 的本质:在目标分布上继续学习
SFT 的本质:换了数据的“预测下一个词”
什么时候需要先补底座,再做 SFT/RL
SFT 与 RL 的本质区别
Agent 与环境的交互
两种动作表示:经典 RL 设置与 LLM 的变长策略
模型预训练基础 [可选阅读]
Mid-training 数据如何构造
SFT(监督微调)
SFT 数据合成:从示范到可训练轨迹
何时选择 Mid-training、SFT 与 RL
单轮强化学习:记忆与泛化的对照
为什么 LLM RL 通常优先 On-Policy
环境:模型练习的场地
造不出环境怎么办:让模型扮演环境
环境、任务分布与评估隔离
多轮任务的核心挑战
工具调用:把环境带进 Agent
奖励来自哪里:规则、人类偏好与模型评判
奖励在什么时候给:结果还是过程
奖励需要表达多少信息:标量、向量与生成式诊断
结果正确还不够:路径约束与 RLVP
在轨蒸馏:让一次 rollout 产生密集监督
没有更强的教师怎么办:On-Policy 自蒸馏
案例 1:Coding Agent 过早结束
案例 2:中文引号
案例 3:编辑文件经常失败
后训练实践要点
本章小结
思考题
从运行轨迹中获得学习信号
将经验沉淀为知识
将经验写成指令
将经验写成程序
将经验写入参数
从更新产物到更新“更新方法”
可验证闭环的边界:当“完成”不等于“进步”
持续进化的安全边界
睡眠学习:整合、遗忘与能力保鲜
本章小结
思考题
维度一:上下文是否共享
维度二:协作拓扑
多 Agent 何时真正优于单 Agent
共享上下文的多 Agent 协作
Agent 眼中的文件系统
Agent 间的通信与控制
对等协作模式:相互制衡与迭代改进
管理者模式:中心化协调
去中心化模式
跨组织协作:A2A 协议
失败模式一:共享文件系统的并发冲突
失败模式二:错误的级联放大
失败模式三:同质趋同
失败模式四:互相扯皮
失败模式五:循环失控
失败模式六:理解债与认知投降
斯坦福 AI 小镇:生成式 Agent 的社会模拟
Agentopia:十年尺度的长期生活模拟
Moltbook:当 Agent 拥有自己的社交网络
从虚拟社会到经济竞争:Vending-Bench Arena
Agent 经济:Pinchwork 与 RentAHuman
信息不对称下的策略博弈:狼人杀
本章小结
思考题
两朵乌云
模型与 Agent 的共同演进
Guide
深入理解 AI Agent:设计原理与工程实践
Pages
1
2
3
4
5
6
7
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
fn7
1
2
3
4
5
6
7
8
9
10
11
12
13
14
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
fn7
fn8
fn9
fn10
fn11
fn12
fn13
fn14
1
2
3
4
footnotes
fn1
fn2
fn3
fn4
1
2
3
4
5
6
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
1
2
3
footnotes
fn1
fn2
fn3
1
2
3
4
5
6
7
8
9
10
11
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
fn7
fn8
fn9
fn10
fn11
1
footnotes
fn1
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
fn7
fn8
fn9
fn10
fn11
fn12
fn13
fn14
fn15
fn16
fn17
fn18
fn19
fn20
fn21
fn22
fn23
fn24
fn25
fn26
fn27
fn28
fn29
fn30
fn31
fn32
fn33
fn34
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
fn7
fn8
fn9
fn10
fn11
fn12
fn13
fn14
fn15
fn16
fn17
fn18
fn19
fn20
fn21
fn22
fn23
fn24
fn25
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
footnotes
fn1
fn2
fn3
fn4
fn5
fn6
fn7
fn8
fn9
fn10
fn11
fn12
fn13
fn14
fn15
fn16
fn17
1
2
footnotes
fn1
fn2
Prev
Contents
Bookshelf
Next