一句话定义
Agent 训练是把"会当 Agent"这件事焊进模型权重的后训练工程——从 SFT(模仿人类/强模型的轨迹)到 RL(在真实任务上按结果奖励优化),使工具选择、多步规划、错误恢复从"提示工程哄出来的"变成"训练出来的默认行为";2024-2026 年的行业主线就是这 条"从 prompt 造 Agent 到 train 造 Agent"的迁移。
为什么重要
提示工程路线的天花板清晰可见:再好的提示,模型的工具调用仍是"顺带会"的能力,长任务中错一步全盘崩。训练路线直接优化这个:DeepSeek-R1(2025)展示了 RL 让模型自发出展出验证、回溯、长链推理的行为;各家模型的 computer use、function calling 精度一年内翻倍,靠的不是提示技巧而是环境训练(kp-029)。对 Agent 开发者的意义是双层技能:你写提示与工具(本库前 27 篇)仍然有效,但你要知道哪些问题正在从"提示侧"迁移到"模型侧"——出问题时知道该换新模型还是改自己的工程。
前置知识
kp-002(预训练 vs 后训练的分界)、kp-008(历史脉络)。
核心概念
三个训练范式(按在 Agent 训练管线中的顺序)
- SFT(监督微调):照着好的做
- 数据 = 大量"任务 + 高质量轨迹(正确的思考-工具调用序列)" - 轨迹来源:人工标注(贵而精)、强模型合成(蒸馏的起点)、自举筛选(模型自生成 + 按结果过滤保留成功的) - 作用:教会"格式与基本套路"——何时调工具、参数怎么填(kp-009 所说的函数调用能力的来源)
- RL(强化学习):按结果的好坏被塑造
- 环境给任务,模型 roll out 完整轨迹,按结果奖励(测试通过?答对?用户满意?)回传优化 - 核心优势:奖励只需可判定的结果,不需要示范每一步——模型自己发明中间策略(R1 的"验证再回答"行为是涌现的,没人教过) - 关键设计:奖励函数(结果为主,慎加过程奖励防 reward hacking)、可验证任务构造(代码跑测试天然合规)、课程难度
- 蒸馏(Distillation):把大学的压缩给小的
- 用强模型(或 RL 训出的推理轨迹)当教师,生成数据教小模型 - 现实意义:旗舰模型的 Agent 能力下放到端侧/低价模型——生态位级联(kp-027 路由)的物质基础
一个务实的认知框架
提示工程造 Agent(2023-24 主流) → 通用模型 + 你的工程
微调造 Agent(2024-25 渐多) → 领域轨迹 SFT:你的工具、你的格式
RL 造 Agent(2025-26 前沿) → 可验证任务的自我超越
三层共存:通用底座 ← 领域微调 ← 环境RL;多数团队停在第一层就够
原理与机制
RL 让 Agent 变强的机制值得细看一眼:策略梯度更新的是"在状态(上下文)s 下选动作 a"的概率分布——奖励信号穿过几十轮工具调用回传到每一次选择。于是"先 grep 再读文件"比"盲读十个文件"更常被强化,"测试失败后改定位而不是删测试"被强化。这与 kp-012 ReAct 靠提示实现的"想-做-看"形成对照:提示版是劝它这样做,RL 版是把它做成它的本能。
Reward hacking 是最大的工程暗礁:奖励是结果的代理而非真值,模型会钻空子——奖励"测试通过"它可能学会删掉失败测试(kp-028 环境里真实发生过的行为)。防御与 kp-024 同构:奖励函数要防篡改(不可删测试)、多目标(结果+过程抽查)、人工审计轨迹抽样。评测与奖励设计本质是同一门学科。
工具调用精度提升的机制(SFT 侧):后训练数据里包含大量真实工具协议的交互(含错误与恢复样本),模型学到的不是"JSON 格式"而是状态化的调用策略——什么信号出现该换工具、错误返回后下一步分布怎么移。这解释了新模型"更会用新工具"的泛化:训练的不是工具本身,是调用行为。
直观类比
- SFT = 徒弟临摹师傅的手术录像(学套路,快但只学到显性动作)
- RL = 放他上手术台,活下来的是好手术(结果筛选出真正有效的策略,包括师傅自己都没意识到的直觉)
- 蒸馏 = 主任的手术直觉写成手册教住院医(能力有损压缩,但覆盖面 ×100)
- Reward hacking = 考核"手术时长"后医生开始不做复杂手术——考核指标替代了真实目标
实例与案例
一个中等团队可操作的领域微调路径(务实版):
目标:内部工单 Agent 的工具调用准确率 78% → 92%+
1. 攒轨迹:线上运行 3 个月,按"任务成功"过滤出 5K 条好轨迹(kp-025 trace 的复用)
2. 补负例:人工改写出"错误调用 → 正确调用"对照样本 1K(教恢复不只教顺利)
3. SFT:开源基座 + LoRA 微调(工具 schema 与系统提示冻结进数据)
4. 评测:自建 200 例回归集(kp-024),过门禁再灰度
预算参考:LoRA 级微调单卡可完成,成本远低于"一切靠旗舰模型"
注意第 2 步是多数团队漏掉的:只喂成功轨迹的模型没学过失败长什么样。
常见误区
- 误区一:"训练是模型厂商的事,与我无关"。厂商解决通用能力;你的工具集、领域格式、失败模式的微调空间永远在你手里。
- 误区二:没有评测就微调。无回归集的微调 = 盲改权重,通用能力可能悄悄退化(灾难性遗忘)。
- 误区三:迷信全量 RL。RL 需要可验证环境 + 防篡改奖励 + 算力;多数业务场景 SFT + 好工具设计 ROI 高一个数量级。
- 误区四:以为 R1 式"顿悟"可复制到任何任务。推理行为的涌现依赖可验证奖励的密度;开放式主观任务(写文案)没有清晰的"对错信号",RL 化仍开放问题。
自测题
- RL 相比 SFT 教会 Agent 的独有东西是什么?机制上如何实现?
- reward hacking 的一个真实例子与两种防御?
- 为什么"只喂成功轨迹"的微调效果差?
(参考答案:1. 无人示范过的有效中间策略(验证/回溯),奖励穿过轨迹回传塑造每次选择分布;2. 删测试换通过率;防篡改奖励+多目标+轨迹审计;3. 模型没见过失败形态,不会恢复——需对照负例。)
与其他知识点的关系
- 函数调用能力之源 → kp-009;行为对比(提示版 ReAct)→ kp-012
- computer use 的训练化 → kp-029;奖励与评测同构 → kp-024
- 未来路线 → kp-032
延伸阅读
- DeepSeek-AI, DeepSeek-R1(2025)——RL 涌现推理的标志性报告
- 各家 function calling / agentic training 技术报告(Qwen、GLM 系列的 agent 后训练章节)