深入理解 AI Agent
Save Offline
Back
全书结构
如何阅读本书
前置知识
致谢
观察空间与动作空间:模型与世界的接口
工具:Agent 的手脚
LLM:Agent 的大脑
上下文:Agent 的眼睛
ReAct 循环
从提示工程到 Loop 工程:工程范式的演进
构建有效 Agent 的核心原则
如何选择模型
编排模式:工作流与自主
护栏与安全性
Harness 五要素与「构建」部分的对应
贯穿全书的设计模式
本章小结
思考题
上下文:决定 Agent 能力上限的关键
消息的四种角色
单轮对话:最简单的 API 调用
带工具调用的多轮交互:Agent 的核心循环
用代码实现 Agent 的核心循环
从 API 视角看上下文的构成
从 API 消息到模型 Token:Chat Template
KV Cache 的原理与约束
KV Cache 与 Prompt Cache:两个层级的缓存
缓存作为架构约束
KV Cache 未必是一次性的:可编辑、可组合的“笔记”
语气与风格:系统提示词的“人格”
结构化提示:系统提示词的“格式”
流程驱动 vs 规则堆砌:系统提示词的“组织方式”
业务规则细化:系统提示词的“内容”
Few-shot 示例:何时给模型看例子
工具定义的设计
提示注入:上下文安全的核心威胁
Skills:领域能力的可组合单元
如何编写一份可用的 Skill
Skills 在上下文中的位置
Skills 与工具的关系
Agent 状态栏的理论基础
Agent 状态栏的构成
Agent 状态栏在上下文中的具体位置
状态更新的两种实现与缓存代价
为什么需要压缩:不只是长度问题
上下文学习的内部机制:检索而非推理
压缩与 KV Cache:看似矛盾,实则互补
生产级的分层压缩机制
压缩策略的设计原则
隔离优于压缩:子 Agent 上下文隔离
本章小结
思考题
记忆能力的评估:三层次框架
记忆的层次结构
用户记忆的四种存储格式
进阶知识表示形态:可执行代码
用户记忆的认知科学基础
记忆框架案例
记忆压缩与整理机制
隐私保护:日志脱敏
文档分块(Chunking)
稠密嵌入:从词汇关联到语义理解
稀疏嵌入:精确匹配的关键词检索
混合检索:两全其美的艺术
结构化索引:从信息检索到知识建模
文件系统范式:用目录结构组织知识
知识应该如何更新
智能体化 RAG:将知识检索工具化的范式转变
RAG 技巧:上下文感知检索
从数据集中提取深度知识:从信息检索到知识发现
前沿探索:多模态记忆
本章小结
思考题
工具的分类
能力的表达形式:专用工具、通用执行器与 Skill
工具描述的艺术
参数传递的保真性
工具生态:MCP 与 Skill Hub
层次化组织与按需加载
模型原生的主动工具发现
Skills:把工具发现变成“按需查阅”
多模态感知
执行工具
协作工具
本章小结
思考题
Coding 是 Agent 的基础能力
案例:从 Manus 到 OpenClaw——通用 Agent 的 Coding 内核
Coding Agent 的整体流程
Harness 工程在 Coding Agent 中的实践
故障与错误恢复
Coding Agent 的实现技巧
Coding Agent 中的搜索工具
Coding Agent 中的文件编辑工具
Coding Agent 的安全
代码作为思考工具
代码作为业务规则的约束
代码驱动的多媒体生成
代码作为系统适配器
代码作为生成式 UI
代码创造代码:Agent 自举
本章小结
思考题
模态与触发时机的扩展
为什么需要异步
OpenClaw 的事件驱动机制实现
事件触发工具
用户沟通工具
虚拟身份与隔离执行环境
事件处理机制
如何让同步模型支持异步打断
深层矛盾与未来方向
交互时序:从级联到全双工
范式一 · 级联流水线(Cascading)
范式二 · 端到端全模态模型(Omni)
范式三 · 全双工交互模型
认知时序:实时交互与深度思考
更像人的语音合成
动作空间设计
视觉定位(Grounding)
能看动画、能听声音的 Computer Use Agent
Computer Use 的世界模型
移动端:生态壁垒比技术更难
硬件与算法的分工
机器人控制的基本结构
长程规划与任务分解
VLA 控制
VLA 的局限
世界模型
从仿真环境到真实机器人
本章小结
思考题
任务定义的四个组成部分
一次真实运行的轨迹
技术奇观:用 Pass@k 看能力上限
业务可靠性:关注 Pass^k
五个组成要素
人机交互型与工具调用型评估环境
基准设计的横向对照
验证器
任务的难度划分
数据泄漏防范
质量控制与长期维护
评估集的三个来源
LLM-as-a-Judge:自动化评估的核心
失败归因:从整条轨迹定位首个错误
端到端回归任务与轨迹前缀回归任务
配对比较与模型排名
选型的关键维度
模型的行为策略
Agent 系统的成本分析
评估驱动的持续迭代
评估结果的统计显著性
Agent 的可观测性
读懂 Benchmark 报告:发现问题的艺术
从数据到假设:构建改进路线图
从结果到决策:数据驱动的权衡
持续迭代:从第一次改进到系统演化
消融基础设施:理解每个特性的真实贡献
AB 测试方法论:区分机制与目标
双层特性开关系统
提示词敏感性评估
以隐私感知分析为评估基础
从外部到内部:评估思维的转变
保真度权衡与领域随机化
本章小结
思考题
预训练在做什么:预测下一个词
Mid-training 的本质:在目标分布上继续学习
SFT 的本质:换了数据的“预测下一个词”
什么时候需要先补底座,再做 SFT/RL
SFT 与 RL 的本质区别
Agent 与环境的交互
两种动作表示:经典 RL 设置与 LLM 的变长策略
模型预训练基础 [可选阅读]
Mid-training 数据如何构造
SFT(监督微调)
SFT 数据合成:从示范到可训练轨迹
何时选择 Mid-training、SFT 与 RL
单轮强化学习:记忆与泛化的对照
为什么 LLM RL 通常优先 On-Policy
环境:模型练习的场地
造不出环境怎么办:让模型扮演环境
环境、任务分布与评估隔离
多轮任务的核心挑战
工具调用:把环境带进 Agent
奖励来自哪里:规则、人类偏好与模型评判
奖励在什么时候给:结果还是过程
奖励需要表达多少信息:标量、向量与生成式诊断
结果正确还不够:路径约束与 RLVP
在轨蒸馏:让一次 rollout 产生密集监督
没有更强的教师怎么办:On-Policy 自蒸馏
案例 1:Coding Agent 过早结束
案例 2:中文引号
案例 3:编辑文件经常失败
后训练实践要点
本章小结
思考题
从运行轨迹中获得学习信号
将经验沉淀为知识
将经验写成指令
将经验写成程序
将经验写入参数
从更新产物到更新“更新方法”
可验证闭环的边界:当“完成”不等于“进步”
持续进化的安全边界
睡眠学习:整合、遗忘与能力保鲜
本章小结
思考题
维度一:上下文是否共享
维度二:协作拓扑
多 Agent 何时真正优于单 Agent
共享上下文的多 Agent 协作
Agent 眼中的文件系统
Agent 间的通信与控制
对等协作模式:相互制衡与迭代改进
管理者模式:中心化协调
去中心化模式
跨组织协作:A2A 协议
失败模式一:共享文件系统的并发冲突
失败模式二:错误的级联放大
失败模式三:同质趋同
失败模式四:互相扯皮
失败模式五:循环失控
失败模式六:理解债与认知投降
斯坦福 AI 小镇:生成式 Agent 的社会模拟
Agentopia:十年尺度的长期生活模拟
Moltbook:当 Agent 拥有自己的社交网络
从虚拟社会到经济竞争:Vending-Bench Arena
Agent 经济:Pinchwork 与 RentAHuman
信息不对称下的策略博弈:狼人杀
本章小结
思考题
两朵乌云
模型与 Agent 的共同演进