Salesforce:大模型后训练的协同效应与避坑指南

发布时间:2026/10/11 7:17:05
Salesforce:大模型后训练的协同效应与避坑指南 📖标题:Understanding the Synergy between SFT, RLVR, and OPD in LLM Post-Training🌐来源:arXiv, 2609.31900v1🛎️文章简介🔸研究问题:在大模型后训练中,监督微调(SFT)、可验证奖励强化学习(RLVR)和在线策略蒸馏(OPD)通常被串联使用,但如何安排这些阶段的顺序和搭配才能避免“好心办坏事”,让每一步都为下一步创造更好的学习条件?🔸主要贡献:论文揭示了后训练各阶段之间存在强烈的相互依赖关系,提出了一套基于“学习接口”优化的组合策略,即先用RLVR增强教师模型,再短暂SFT预热学生模型,最后进行OPD蒸馏,显著提升了最终性能。📝重点思路🔸通过控制变量实验,系统研究了Qwen3系列模型在数学和科学推理任务上,SFT、RLVR和OPD三个阶段在不同顺序和配置下的交互影响。🔸引入“可强化分数”作为衡量师生模型兼容性的新指标,发现蒸馏效果取决于师生配对兼容性,而非单纯依赖教师模型的规模或参数量。🔸对比了不同学生预热方式对后续OPD的影响,发现短暂的SFT预热能拉近学生与教师的分布,而经过RLVR强化的学生虽然能力强,但在面对同一教师进行蒸馏时反而会出现性能回退。🔸研究了教师模型适配对蒸馏的影响,发现用RLVR提升教师能力能有效传递给学生,且学生增益与教师能力提升成正比,直到教师性能达到瓶颈。🔸比较了OPD和SFT作为后续RLVR初始化的效果,发现在起始准确率相当时,OPD能为后续的RLVR提供更好的初始化状态,支持更强的扩展性。🔎分析总结🔸单纯增加教师模型规模并不总能提升蒸馏效果,甚至可能因兼容性差导致效果下降;师生模型的初始兼容性比教师绝对能力更重要。🔸学生能力的提升不等于可蒸馏性的提升。RLVR虽能大幅提升学生独立解题能力,但会破坏其与教师的分布一致性,导致后续OPD

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询