推理学习、蒸馏与环境奖励
从组相对优势到长程交互,解释可验证奖励和测试时计算的条件。
奖励在选择哪些行为
强化学习用任务反馈调整模型生成或行动的概率。可验证奖励 RLVR 用程序判断结果,例如答案等价检查、代码测试或环境完成状态。奖励可计算提高了反馈一致性,反馈仍只覆盖判定器实际检查的目标。
GRPO 对同一问题采样一组轨迹,以组内奖励比较估计优势。简化写法为 , 为该轨迹奖励, 与 是组统计量。组相对比较减少对独立价值模型的依赖;组中全部同分时信号不足,奖励尺度与组大小也影响训练。策略更新通常还需概率比、裁剪和参考策略约束,具体实现不同。DeepSeekMath
长思维链、回溯和验证可能在结果奖励下受到选择。DeepSeek-R1 系列展示了纯 RL 与冷启动、多阶段后训练的不同结果;它提供具体可行性证据,不能将长链、语言混杂或某种训练配方推广为必经阶段。DeepSeek-R1
奖励投机与信用分配
通过单元测试只说明通过这些测试。若模型可修改测试、读取隐藏答案、硬编码样本或利用判定器漏洞,高奖励可能来自目标之外的行为。可验证奖励同样存在投机风险,结果奖励也可能非常容易被欺骗。
判定材料与训练执行隔离、隐藏独立样本、检查实际副作用、验证 gold 与 no-op 基线、抽样人审,能够揭示部分漏洞。no-op 指不采取必要动作也能得分的轨迹;它检查任务或评分是否真的区分完成。扩大判定覆盖需要额外成本,奖励设计不能靠“规则”二字获得完整保证。
长任务的终点奖励稀疏,无法直接指出哪一步贡献了成功。过程奖励逐步打分,信息更密,标注和判断错误也进入每一步。可使用中间可验证状态、从某一步继续采样估计成功概率、任务进度差或分解评分细则,但这些代理信号可能鼓励局部完成并损害最终目标。
构造例子:任务要求整理并提交三份材料。仅以文件数奖励,复制同一文件三次可得高分;仅以文本完整奖励,材料可能没有提交;仅以提交回执奖励,内容可能错误。将身份、内容、目标位置和回执分别核查,才接近该任务实际成功条件。这里是判定设计示意,没有真实训练结果。
过程奖励模型 PRM 可以对每一步的有效性或继续成功概率打分。人工步骤标签昂贵;从某个前缀采样多条后续,用成功比例估计步价值,增加了 rollout 成本,并依赖当前继续策略。步骤“看起来合理”与真正改善终态可能分离,训练会利用判定器的偏好。
终点奖励分解成步级信号有几类思路:利用最终正确答案形成训练期特权教师,按轨迹对答案的支持分配信号;用评分细则检查状态转移 是否取得证据、完成子目标或违反规则;用内部表征变化形成探索奖励。这些信号各有覆盖与可解释条件。任务文档自动生成的确定性判据,仍需要核查文档和判据本身。
奖励塑形改变优化目标。一个常见形式为 ,其中 是状态势函数, 是折扣。保持最优策略的结论依赖相应 MDP、终态和折扣等假设;随意添加“文件数”“思考长度”等分数不具有同样性质。对首次取得证据计分可以避免反复读取刷分,仍需确认取证行为支持最终任务。
其关键关系可以从折扣求和看出:
中间项相消。当终态势函数按要求为零,或相应无限时域中的尾项趋零时,变化只剩与起始状态有关的常数,不改变该状态下策略的奖励排序。若提前截断却保留依行动而变的尾项,就不能直接使用这一保证。实际学习能否收敛、势函数是否帮助探索,以及现实任务是否符合所用状态模型,还需分别评价。Ng、Harada 与 Russell,1999 年,第 2—3 节
环境也是训练数据
智能体 RL 的轨迹包含工具调用和环境变化。每条 rollout 需要可复位、可隔离的环境,记录初始状态、工具版本、动作、观察、终止原因和奖励。不同轨迹共享可变文件或账户会污染比较;使用真实外部系统还会产生授权、副作用和成本问题。
镜像启动、浏览器执行、测试稳定性、回收和长轨迹存储可能成为吞吐瓶颈。环境任务不完整、测试偶发失败或起始状态已完成,会制造错误奖励。合成环境可以扩充覆盖,也可能只复制工具文档和生成器的先验。测试真实迁移能力时需保留独立环境与任务来源。
SFT、RL 与蒸馏的关系
SFT 对示范轨迹做概率拟合,RL 在当前策略采样上按奖励更新,蒸馏将教师输出或分布转给学生。SFT 可以泛化到未示范输入,RL 也可能只提高已有成功路径的采样概率;某项 pass@k 结果无法单独证明所有方法都只会锐化或创造能力。
推理蒸馏可筛选正确教师轨迹,保留任务输入、中间解释和最终结果,再训练较小模型。文本解释可能与教师真实内部过程不同,不能当作完全透明的计算记录。教师错误、重复风格、数据覆盖、学生容量和筛选器盲点会限制迁移。多教师、外部检索与课程安排可改变这些条件,需分别测量。
训练得到的变化可用 pass@1 与 pass@k 分别观察。若从一次题目生成 个候选,其中 个通过判定,则常用估计量为
它估计从这批样本中取 个至少一个正确的比例;需要说明采样与判定条件,跨题再按相同口径汇总。pass@1 提升、较大 提升不足,可能说明成功概率集中到更少路径;也需要检查题型、输出预算和候选相关性。实际产品没有完美选择器时,候选中存在正确解与用户取得正确解是两个测量对象。代码生成评测 介绍这一估计方法。
测试时计算怎样分配
追加串行生成、并行候选、 verifier 引导的树搜索,以及使用工具取得新观察,都可能增加推理时计算。它们增加的信息不同:串行路径延长工作空间;独立候选覆盖不同解;验证器帮助选择;工具反馈可能补充模型自身无法推出的事实。
若独立一次成功概率为 ,尝试 次至少一次成功的概率是 。模型错误相关、采样路径重复、缺少正确选择器时,实际收益会降低。best-of-N 需要挑选规则;self-consistency 的多数答案也可能一致地错。正确率与延迟必须连同筛选器成本比较。
长思考可能增加求解步骤,也可能反复推翻正确答案或消耗输出预算。简单题没有必要承受相同预算;困难题过早截断则可能损伤准确率。按模型、难度与预算适配的实验支持条件化分配,不能推导固定预算排序。测试时计算研究
测试时训练会在输入上更新参数,需要额外反向计算、状态隔离与恢复。外部记忆则修改可检索资料,通常无需参数更新。两者都可能被输入污染;记忆条目可以帮助执行已有能力,是否替代参数适配要看实际任务差距,陈述性与程序性标签无法给出绝对分界。
最后更新于