胡泽贤 律师RULES & BEYONDLEARNING NOTE 07 / 2026

AI AGENT / 第 7 章应用笔记

先问该不该训练,再问怎样训练。

很多 Agent 问题可以通过上下文、工具和 Harness 修好。只有当行为模式需要进入模型参数,且有足够数据与评估环境时,后训练才值得开始。

数据、环境、监督与奖励组成模型后训练阶梯的编辑视觉
VISUAL METAPHOR / 主题隐喻训练阶梯 · 数据、环境、监督与奖励信号

模型后训练很容易被当成能力升级的万能按钮。实际选择顺序应相反:先确认提示词、上下文、工具和评估都已稳定,再判断问题是否真的需要改参数。

SFT 擅长模仿高质量示范,RL 擅长在可验证环境中探索更优策略。两者依赖不同的数据和反馈。

训练算法不是起点;高质量数据、可交互环境和可信奖励才决定模型学到什么。

01 / THREE STAGES预训练、SFT 与 RL 解决不同问题。

预训练建立通用语言与世界知识,SFT 用示范塑造行为格式,RL 根据奖励优化策略。通常先有稳定的 SFT 基线,再进入 RL。

1

预训练

从大规模数据学习通用表示与预测能力。

2

SFT

模仿高质量输入输出,建立可靠行为起点。

3

RL

在环境反馈中探索,优化可度量目标。

02 / SFT OR RL有标准示范先用 SFT,有可靠奖励再考虑 RL。

当正确行为可以被专家演示、输出格式明确时,SFT 更直接。当解法很多、结果可自动验证、需要超越示范时,RL 才显出价值。

如果奖励不可信,模型会学会钻指标空子;如果环境不真实,训练出来的策略也难以迁移。

03 / MULTI-TURN REWARD多轮任务要处理信用分配。

最终失败可能源于很早的一次工具选择。过程奖励能提供密集反馈,但容易限制探索;结果奖励更客观,却稀疏。实践中常用结果奖励为主,再约束明显违规路径。

04 / TRAINING READINESS先做一张后训练准备清单。

训练前应确认基线评估、数据来源、隐私许可、环境重置、奖励防作弊、回滚方案和成本预算。缺少这些条件,调参数只会放大不确定性。

第一道练习:挑一个 Agent 失败案例,分别写出提示词修复、工具修复、SFT 和 RL 四种方案,再说明为什么优先选择其中一种。

原书与章节来源

  • bojieli/ai-agent-book:开源主仓库与全书目录。
  • 7 章正文:本页概念主线与术语来源。
  • 7 章实验:配套代码、复现说明与读者练习。
  • 本页是面向应用的学习整理与转述,不替代原书;准确表述以原文和代码为准。

下一篇:Agent 如何持续进化

继续沿着“理解结构—动手改变—观察结果—形成判断”的方式学习。

继续学习

读者评论

把这篇文章留给你的想法写下来。

0 / 300

还没有评论。你可以留下第一条。