引言

2025 年 8 月至 10 月,我在图灵《AI Agent 实战营》中讲授了一系列课程。课程围绕一个核心问题展开:如何以可解释、可验证、可复用的工程原则设计 AI Agent,而不是依赖经验和直觉反复试错?因此,课程不以跑通一个演示系统为终点,而是进一步分析 Agent 为何采用特定架构,以及每项设计决策对应的能力边界与工程取舍。本书以课程讲义和配套实验为基础,经过系统整理、补充与重构而成。

本书的形成过程本身也是一次人机协作实践。从最初构思到书稿定型,我主要采用 whisper coding(口述式协作)的方式,与 Pine 的语音 Agent 共同完成资料整理和文本迭代。准备课程时,我先口述章节提纲,由 Agent 调研相关工作并形成材料草稿;课程结束后,再结合学员反馈,对论证、案例和实验反复核查与修订。语音降低了将想法外化为文本的成本,也缩短了“提出问题—检索资料—形成草稿—复核修改”的迭代周期。因而,这本书不仅讨论 Agent,也记录了一种由 Agent 深度参与的知识生产方式。

自 2025 年初 DeepSeek R1 发布以来,AI 研究与产业实践的重心逐步从基座模型能力扩展到 Agent 的系统化落地。在模型侧,智能体强化学习(Agentic Reinforcement Learning)开始将工具调用及环境交互能力内化到模型参数中,使模型在编程(coding)、数学推理和图形界面操作(computer use)等领域表现出更强的通用能力。在产品侧,Manus、Claude Code、OpenClaw 等通用 Agent 则推动了人机交互方式的变化,并使“代码生成 + 文件系统”成为重要的系统架构范式。

重新审视课程中总结的 Agent 架构原则,可以发现:尽管模型和产品快速迭代,这些原则仍然具有稳定的解释力。业界后来广泛使用 Skill、harness、loop engineering 等术语,但相应的工程实践往往更早出现;概念的形成,是对大量实践经验的归纳,而不是实践的起点。换言之,实践在前,命名在后。

这些原则主要来自长流程、高风险场景中的工程实践。作为 Pine AI 的首席科学家,我与团队共同研发了 Pine,使 Agent 能够代表用户与真人沟通,并处理账单协商、退款投诉和订阅取消等涉及真实经济利益的复杂任务。这类任务通常跨越较长时间、包含多轮交涉,且单个步骤的错误就可能造成实际损失。对可靠性、安全性和可审计性的严格要求,促使我们逐步形成了本书所强调的架构原则。下面几个例子均来自这段实践。

这些方法并非 Pine 所独有。许多模型与 Agent 团队在解决相似问题时,都独立形成了相近的工程方法;这种趋同说明,它们反映的是 Agent 系统的共性约束。基于这些认识,我于 2025 年在图灵开设《AI Agent 实战营》,并于 2024—2026 年持续在中国科学院大学讲授 AI Agent 实践课程。本书选择开源发布,也希望让这些可复用的知识和经验服务于更多研究者与工程实践者。

实践在前,命名在后。对企业级 Agent 开发而言,这意味着实践不能始终滞后于概念的普及:当一个术语成为行业共识时,其对应的问题往往已经在领先系统中经过了长期探索。要更早识别并解决这些问题,我认为有两个关键条件。

第一,选择对 Agent 能力上限提出足够高要求的真实业务,并持续获取真实反馈。 以 Pine 为例,一项任务可能持续数小时乃至数周,期间需要与多个利益相关方反复沟通,完成长时间通话、复杂表单操作和多轮邮件往来;同时还必须保证关键数字准确、操作可控,并始终维护用户利益。足够复杂的场景会持续暴露模型能力与业务要求之间的差距,从而促使团队构建 harness,系统解决模型暂时无法独立处理、业务却必须完成的问题。如果业务需求很容易被下一次模型升级覆盖,团队也较难积累稳定的系统设计原则。

第二,建立系统的评估(Evaluation)机制。 没有评估,就无法判断一次改动带来的提升究竟源于设计本身,还是仅仅来自随机波动。评估把 Agent 的迭代从经验判断转化为可比较、可复现的工程过程,是以科学方法开展系统开发的基础。第七章将专门讨论这套方法。

不管底层模型如何升级,不管产品形态如何创新,几乎所有成功的 Agent 系统都遵循着相同的架构模式。这并非巧合:好的设计原则本就应该穿越模型的迭代周期,因为它们描述的不是某个模型的用法,而是智能系统与世界交互的基本模式。

图灵奖得主、强化学习之父 Richard Sutton 曾说,宇宙演化经历了从尘埃到恒星、从恒星到生命、从生命到智能体(原文为设计实体,designed entities)的 4 个阶段。生物进化是盲目的:随机变异,自然选择。大多数生物并不理解自身的运作原理,也无法自主设计和改造自己。而智能体(Agent)是宇宙演化史上一种全新的存在:它能通过生成代码实现自举(bootstrap)和自我进化,就像一个程序员编写了另一个程序员,然后新的程序员又能继续编写下一个。也就是说,Agent 能够理解自身的运作机制,并根据目标创造全新的智能体,甚至改进自己。本书的使命,就是帮助你理解和掌握这种创造的原则。

本书的核心公式只有一句话:Agent = LLM + 上下文 + 工具。三者缺一不可。

更直观地说,就是大脑 + 眼睛 + 手脚。大脑(LLM)负责思考和决策,眼睛(上下文)决定 Agent 能看到什么信息,手脚(工具)决定 Agent 能做什么事情。(严格来说,“眼睛”只是一个粗略的类比:上下文不仅包含环境信息和对话历史,还包含工具定义等内容,也就是说 Agent “看到”的信息中也包括了“有哪些手脚可用”。这个隐喻旨在传达核心直觉:上下文是模型能感知到的一切信息。)

图0-1 Agent = LLM + 上下文 + 工具

对熟悉强化学习的读者,这三者也可以映射到 RL 的形式化语言。具体来说,LLM 对应 Policy(策略),上下文对应 Observation Space(观察空间),工具对应 Action Space(动作空间)。三种说法对应同一个对象,只是表达层次不同。

全书结构

本书共十章,围绕两个相互衔接的问题组织(图0-2)。第一部分“如何构建 Agent”包括第一至六章:从基本概念出发,依次讨论上下文、记忆与知识、工具、Coding Agent,以及观察与动作空间的扩展。第二部分“如何提升 Agent 能力”包括第七至十章:先用评估建立可度量的反馈,再通过模型后训练、基于运行经验的持续进化和多 Agent 协作,分别从模型参数、单体系统和群体系统三个层面扩展能力。

图0-2 全书结构:构建 Agent 与提升 Agent 能力

如何阅读本书

本书的各章节相对独立,你可以根据自己的需求选择不同的阅读路径:

每章都包含大量的实验思考题,编号格式为“实验 X-Y”(X 为章节号,Y 为章节内序号)。实验和思考题的标题中用星级标注难度:★ 表示入门级,适合所有读者;★★ 表示中等难度,需要一定的工程实践基础;★★★ 表示进阶挑战,通常涉及开放性问题或复杂的系统设计。大部分实验配有完整的可运行代码,组织在配套的开源仓库中:

配套代码仓库https://github.com/bojieli/ai-agent-book

可以使用 Git 获取全部配套代码:

git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book

不熟悉 Git 的读者也可以在仓库页面点击 Code → Download ZIP 下载。实验代码按章节组织在 chapter1/chapter10/ 中;要查找“实验 X-Y”,请先打开对应的 chapterX/README.md,根据实验编号找到项目目录,再按照项目自身的 README 安装依赖并运行。部分标为“复现指南”的实验依赖外部仓库,具体获取方式也会在相应的 README 中说明。

我强烈建议你动手跑一遍这些实验。AI Agent 是一个实践性极强的领域,很多设计上的直觉需要在动手调试的过程中才能真正建立起来。

前置知识

本书面向有一定技术背景的读者,但不要求你是某个特定领域的专家。以下按“必需”和“推荐”两个层次列出前置知识,帮助你评估自己的准备程度。

必需:阅读全书的基础

推荐:提升特定章节的阅读体验

如果你在某些前置知识上有所欠缺,不必因此却步。本书的核心价值在于架构设计原则和工程实践的方法论,而非某个具体的算法或技巧。除第八章后训练以外,全书对数学和机器学习的要求很低,完全可以作为起点。

Agent 技术仍在快速演进,但好的架构设计原则具有穿越时间的力量。掌握了“为什么要这样设计”,你就能在技术浪潮的变化中保持清醒的判断力。希望这本书能成为你构建 AI Agent 的可靠指南。

致谢

感谢图灵的梦鸽老师和刘美英老师的辛勤编辑,以及为组织图灵《AI Agent 实战营》课程付出的努力;感谢刘俊明老师在国科大开设 AI Agent 实战课程。也要特别感谢图灵《AI Agent 实战营》的所有学员,以及国科大 AI Agent 实战课程的所有同学——在我讲授这些课程的过程中,大家给了我许多有价值的反馈与建议,也让我对这些概念本身有了更清晰的理解。

感谢 Pine AI 的所有同事。如果没有 Pine AI 这样优秀的产品,以及它所带来的种种挑战,我不可能在 Agent 领域获得如此深入的理解与实践;在一次次思想碰撞中,同事们也提出了许多宝贵的见解。

也要感谢 AI 业界的许多朋友(在此不一一具名)。在各种行业讨论中,大家对我的观点给予了坦诚的反馈,纠正了我不少错误的判断,提升了我对模型与 Agent 的认知。

最要感谢的,是我的家人,特别是我的太太孟佳颖。她始终支持我完成本书的写作,还为本书提出了许多宝贵的意见。

Prev
Contents
Bookshelf
Next