模型后训练很容易被当成能力升级的万能按钮。实际选择顺序应相反:先确认提示词、上下文、工具和评估都已稳定,再判断问题是否真的需要改参数。
SFT 擅长模仿高质量示范,RL 擅长在可验证环境中探索更优策略。两者依赖不同的数据和反馈。
训练算法不是起点;高质量数据、可交互环境和可信奖励才决定模型学到什么。
01 / THREE STAGES预训练、SFT 与 RL 解决不同问题。
预训练建立通用语言与世界知识,SFT 用示范塑造行为格式,RL 根据奖励优化策略。通常先有稳定的 SFT 基线,再进入 RL。
预训练
从大规模数据学习通用表示与预测能力。
SFT
模仿高质量输入输出,建立可靠行为起点。
RL
在环境反馈中探索,优化可度量目标。
02 / SFT OR RL有标准示范先用 SFT,有可靠奖励再考虑 RL。
当正确行为可以被专家演示、输出格式明确时,SFT 更直接。当解法很多、结果可自动验证、需要超越示范时,RL 才显出价值。
如果奖励不可信,模型会学会钻指标空子;如果环境不真实,训练出来的策略也难以迁移。
03 / MULTI-TURN REWARD多轮任务要处理信用分配。
最终失败可能源于很早的一次工具选择。过程奖励能提供密集反馈,但容易限制探索;结果奖励更客观,却稀疏。实践中常用结果奖励为主,再约束明显违规路径。
04 / TRAINING READINESS先做一张后训练准备清单。
训练前应确认基线评估、数据来源、隐私许可、环境重置、奖励防作弊、回滚方案和成本预算。缺少这些条件,调参数只会放大不确定性。
第一道练习:挑一个 Agent 失败案例,分别写出提示词修复、工具修复、SFT 和 RL 四种方案,再说明为什么优先选择其中一种。
原书与章节来源
- bojieli/ai-agent-book:开源主仓库与全书目录。
- 第 7 章正文:本页概念主线与术语来源。
- 第 7 章实验:配套代码、复现说明与读者练习。
- 本页是面向应用的学习整理与转述,不替代原书;准确表述以原文和代码为准。
下一篇:Agent 如何持续进化
继续沿着“理解结构—动手改变—观察结果—形成判断”的方式学习。
继续学习 →

读者评论
把这篇文章留给你的想法写下来。
还没有评论。你可以留下第一条。