AI Agent 最容易被复杂名词吓退:模型、提示词、RAG、MCP、工作流、多 Agent、强化学习。把这些词先放到一边,真正需要建立的是一张判断地图:它看见了什么,能够做什么,怎样决定下一步,以及做错后能否被发现和纠正。
这也是这份学习笔记的原则:每学到一个概念,都要能在真实产品里找到对应部分;每完成一个实验,都要能说明它改变了哪一种能力,而不只是“代码跑通了”。
学习 Agent,不是记住更多框架名称,而是学会设计一次可靠的“观察—行动—验证”循环。
01 / TWO FORMULAS先记住两条公式。
第一条是最小可工作公式。模型负责理解与决策,上下文提供当前能看见的信息,工具把决定变成现实动作。
第二条是生产公式。Harness 是围绕模型搭起来的工程外壳:它组织上下文与工具,同时补上约束、验证和纠正。前一条回答“为什么它能做事”,后一条回答“为什么它有机会长期把事做对”。
02 / ANATOMY把正在使用的 Codex 拆成五个部分。
不必先写代码。打开一次真实任务,就能观察到一个 Agent 的完整结构:
模型
理解“我要学这本书”背后的目标,安排学习顺序,并决定下一步做什么。
上下文
包括用户问题、仓库正文、当前项目、历史约定,以及工具返回的中间结果。
工具
读取网页和文件、运行代码、修改页面、构建网站,并把结果发布到真实环境。
约束
限制可修改范围、保护敏感信息,对外发送、删除和发布等动作设置明确边界。
验证与纠正
检查构建、页面与真实终态;失败时定位原因、调整方案,再重新验证。
以后看到任何 Agent 产品,都可以先问这五个问题。能回答清楚,产品架构就已经看懂了一半。
03 / REACT LOOPAgent 为什么会持续行动?
普通对话模型往往是“用户提问—模型回答—结束”。Agent 则把工具结果重新放回上下文,让模型基于新观察继续决定下一步:
接收目标 ↓ 观察当前环境 ↓ 决定下一步行动 ↓ 调用工具 ↓ 检查工具结果 ↓ 继续行动,或在满足停止条件后结束
这就是常说的 ReAct。重点不在模型“想了多久”,而在每次行动之后有没有获得真实反馈。没有反馈,Agent 只是在连续猜测;有反馈,它才可能修正路线。
04 / WORKFLOW OR AGENT先判断该不该用 Agent。
并非所有自动化都需要自主 Agent。如果执行路径稳定、规则明确,固定工作流通常更便宜、更快,也更容易审计。
- 路径能够提前写死:优先工作流。
- 步骤取决于中间结果:考虑自主 Agent。
- 涉及资金、隐私、法律期限或外部发送:保留确定性流程与人工确认。
- 实际系统往往是混合形态:灵活部分交给 Agent,关键节点交给规则。
05 / HARNESS从“能做事”走向“可靠做事”。
一个 Demo 只要能调用工具就很惊艳,真实产品却必须处理更朴素的问题:权限是否过宽、输入是否可信、调用是否超时、结果是否真的生效、连续失败后何时停止。
同一个模型,有没有 Harness,表现可能完全不同。因此真正值得长期学习的,不只是怎样让模型更聪明,还包括怎样把不稳定的智能引导成可观察、可恢复、可负责的系统。
06 / LEARNING ROADMAP一条应用优先的学习路线。
原书从基础讲到训练和持续进化。第一次学习可以稍微调整顺序,先建立可见成果,再进入需要深度学习背景的章节。
建立地图
第 1 章:Agent 组成、ReAct、工作流、自主性与 Harness。
补齐眼睛
第 2—3 章:上下文工程、记忆、知识库与 RAG。
接上双手
第 4 章:工具设计、MCP、权限、事件与协作。
做出作品
选择一个真实小任务,做出最小 Agent,并保留运行轨迹。
把它做稳
第 5—6 章:Coding Agent、评估、错误恢复与可比较指标。
再扩展边界
先学第 9—10 章的多模态和多 Agent;第 7—8 章训练与进化放在最后。
每学一章,至少做一次“改坏—观察—修好”的对比实验。只跑通默认示例,很难真正理解系统。
07 / FIRST EXERCISE用“新案件整理”做第一道练习。
假设要让 Agent 帮律师整理一个新案件。先不要写代码,只画出它的上下文和工具边界:
- 列上下文:用户目标、案件材料、时间线、办案规则、当前进度分别来自哪里?
- 列工具:它需要读取什么、搜索什么、生成什么、写入哪里?
- 列约束:哪些材料不得外传,哪些动作必须人工确认,哪些结论只能标为待核验?
- 列验证:怎样检查文件完整、日期一致、引用可追溯、输出真实保存?
- 写停止条件:什么叫完成,什么情况下必须停止并请律师判断?
如果这五组问题还答不清,直接写 Agent 通常只会把模糊放大。先完成系统设计,再选择模型与框架。
08 / NEXT从 10 章原书,扩成 20 篇网站课程。
原书面向愿意进入工程细节的读者,网站则不能默认每个人都会 GitHub、写代码或已经理解大模型。课程因此分成两层:先用 10 篇前置内容补齐普通读者需要的地基与现实使用常识,再进入 10 章工程主线。原书内容不删,入口变得更平缓。
零基础前置 · 无需代码与 GitHub
- 零基础 00:AI、模型与 Agent 到底是什么——先把常被混用的四个词拆开。
- 零基础 01:一次 AI 对话里发生了什么——聊天框背后有哪些消息和上下文?
- 零基础 02:从聊天助手到 AI Agent——会回答怎样变成会推进任务?
- 零基础 03:怎样验证 AI 的结果——普通人怎样识别事实、推断和危险动作?
- 零基础 04:现在流行的大模型怎样选——怎样读懂 GPT、Claude、Gemini、DeepSeek、Qwen 与 Kimi?
- 零基础 05:开源、闭源与开放权重——能下载、能商用和能本地跑分别意味着什么?
- 零基础 06:美国模型在中国大陆能不能用——网络可达与服务正式支持有什么不同?
- 零基础 07:网页、桌面、终端与 CLI——入口怎样改变模型的手和眼睛?
- 零基础 08:Homebrew、Ollama 与本地部署——怎样把模型稳妥地放进自己的电脑?
- 零基础 09:Token、上下文与生成数量——128K 到底能装多少、生成多少?
工程主线 · 对应原书第 2—10 章
- 第 2 章:上下文工程——模型此刻究竟看见了什么?
- 第 3 章:记忆、RAG 与知识库——怎样记对、找对,也能忘得掉?
- 第 4 章:工具与 MCP——怎样把能力接入现实,又不失去控制?
- 第 5 章:Coding Agent——代码怎样成为创造新工具的工具?
- 第 6 章:评估与可观测性——怎样知道系统真的变好了?
- 第 7 章:模型后训练——什么时候才需要 SFT 或 RL?
- 第 8 章:持续进化——怎样把运行轨迹变成新能力?
- 第 9 章:多模态与实时交互——听、看与操作带来哪些新约束?
- 第 10 章:多 Agent 协作——什么时候分工真的优于单 Agent?
原书与学习入口
- bojieli/ai-agent-book:李博杰《深入理解 AI Agent:设计原理与工程实践》开源主仓库。
- 官方学习建议:章节路径、难度分级与实践方法。
- 第一章正文:Agent 公式、工具调用、Harness 与编排模式。
- 第一章配套实验:学习效率、搜索 Agent、搜索与代码生成、上下文消融。
- 本页是面向应用的学习整理与转述,不替代原书;原仓库采用 Apache License 2.0,准确表述以原文和代码为准。
不知道从哪里开始?从零基础 00 开始。
无需代码与 GitHub。先建立概念直觉,再用交互实验观察“有与无”,最后进入原书工程主线。
直接体验实验室 开始零基础路线

读者评论
把这篇文章留给你的想法写下来。
还没有评论。你可以留下第一条。