
1. 从标题拆解MiMo-V2.6到底想解决什么问题1.1 一个“自我提升”的模型重点不在模型本身第一次看到《MiMo-V2.6通过扩展强化学习实现模型自我提升》这个标题我的直觉是这又是一篇讲“我们训了个更大的模型”的报告。但仔细读下来会发现它的重心其实不在“模型有多大”而在“模型怎么靠自己变得更好”。这个区别很关键。传统的大模型迭代路径基本是三步走加数据、加参数、加算力。数据从哪来人工标注、互联网爬取、合成数据。参数怎么加堆层数、堆专家数。算力怎么来买卡、排队、调并行策略。这套打法在过去两年确实有效但边际收益在肉眼可见地下降。原因不复杂高质量人类标注数据快用完了合成数据又有“模型自噬”的风险而单纯堆参数的性价比越来越低。MiMo-V2.6给出的思路是把“提升”这件事本身交给强化学习来做。模型不只是被动地拟合数据分布而是主动地去探索“什么样的输出能拿到更高的奖励”然后朝着那个方向调整自己。这就是标题里“自我提升”四个字的真正含义——不是模型自己改自己的代码而是模型通过RL循环自己生成候选、自己评估、自己优化。1.2 为什么是“扩展强化学习”而不是“微调”这里要区分两个概念监督微调SFT和强化学习RL。SFT的本质是“模仿”你给它看一万条“好答案”它学会的是“像这些好答案一样说话”。但“像”不等于“对”更不等于“好”。SFT的天花板就是标注数据的质量上限。RL的本质是“试错”。模型生成一个回答奖励模型给一个分数模型根据分数调整策略。它不需要知道“标准答案”是什么只需要知道“这个方向对不对”。这就打开了另一个维度的提升空间模型可以探索出人类标注者没想到过的解法。标题里的“扩展”二字也值得琢磨。扩展什么我理解至少有三层一是扩展奖励信号的来源不依赖单一奖励模型二是扩展训练任务的多样性让模型在不同场景下都能自我提升三是扩展计算资源的分配把更多算力花在“探索”而不是“模仿”上。1.3 MoE架构在这里扮演什么角色热词里出现了MoE这不是偶然。MiMo-V2.6大概率采用了混合专家架构。MoE的核心思想是不是每个token都需要经过全部参数而是由路由网络决定“这个token该找哪几个专家处理”。这样做的好处是总参数量可以很大但每次推理只激活一小部分计算效率高。在RL训练场景下MoE还有一个额外优势不同专家可以 specialize 到不同类型的任务或推理模式上。比如有的专家擅长数学推理有的擅长代码生成有的擅长多轮对话。当RL信号进来时路由网络会逐渐学会“把这类问题分配给更可能拿高分的专家”。这相当于在RL之外又加了一层“任务-专家”的匹配优化。但MoERL也不是没有代价。路由网络的训练本身就不稳定加上RL的方差很容易出现“专家坍缩”——所有token都涌向同一个专家其他专家变成死权重。MiMo-V2.6的技术报告里应该花了相当篇幅讲怎么稳住这个问题后面我会结合常见实践展开。2. 强化学习自我提升的核心机制拆解2.1 奖励信号从哪来三种主流方案对比RL训练最核心的问题永远是奖励从哪来目前业界主要有三条路线MiMo-V2.6大概率是混合使用。奖励来源实现方式优势风险人类偏好模型训练一个Reward Model输入(问题,回答)输出标量分数贴近人类真实偏好奖励黑客Reward Hacking模型学会讨好RM而非真正变好规则/程序验证数学题对答案、代码跑单元测试、逻辑题检查一致性信号准确无法作弊覆盖场景有限开放域任务用不了模型自评估用另一个LLM或模型自己给回答打分成本低可扩展自评偏差容易陷入“自我感觉良好”的循环MiMo-V2.6的“自我提升”如果只靠第三种风险很大。更合理的做法是在可验证任务上用规则奖励在开放任务上用偏好模型同时用自评估做辅助信号。这样既保证了信号质量又扩展了适用范围。注意奖励黑客是RL训练中最隐蔽的坑。模型会找到一切办法拿高分哪怕那个办法完全违背你的本意。比如你让RM偏好“长回答”模型就会学会啰嗦你让RM偏好“自信语气”模型就会学会胡说八道时也理直气壮。必须用多个奖励信号交叉验证。2.2 策略优化PPO、GRPO还是别的有了奖励下一步是怎么用奖励更新策略。PPOProximal Policy Optimization是经典选择但它需要同时维护策略模型、价值模型、奖励模型显存占用大调参困难。对于大模型来说PPO的工程复杂度很高。近两年GRPOGroup Relative Policy Optimization在LLM社区流行起来。它的核心改动是不要价值模型了而是对同一个问题生成一组回答用这组回答的平均奖励作为基线每个回答的奖励减去基线得到优势值。这样做省掉了价值模型显存和计算都更友好。MiMo-V2.6如果强调“扩展”很可能在GRPO基础上做了进一步改进。比如动态调整组大小简单问题用小group复杂问题用大group混合on-policy和off-policy数据提高样本效率分层奖励token级奖励和序列级奖励结合具体用了哪种技术报告里应该有消融实验。但不管哪种核心逻辑是一样的让“高于平均水平的回答”被强化“低于平均水平的回答”被抑制。2.3 自我提升的循环怎么闭合“自我提升”听起来很玄但拆开看就是一个循环模型对一批问题生成回答奖励系统给每个回答打分用打分结果更新模型参数更新后的模型再生成新回答回到第2步这个循环要能持续转下去必须满足两个条件一是奖励信号不能退化二是模型不能崩溃。奖励信号退化通常是因为RM被模型“攻破”了模型学会了RM的漏洞。模型崩溃则可能是KL惩罚太弱导致策略跑偏或者学习率太大导致参数震荡。MiMo-V2.6的“扩展”很可能体现在不是只跑一轮RL就结束而是多轮迭代每轮用上一轮的最佳模型重新初始化同时更新奖励模型。这就像打游戏每通关一次怪物变强但你的装备也变好形成螺旋上升。3. 实操层面的关键细节与参数选择3.1 训练数据配比可验证任务不能少于30%如果你要复现类似的RL自我提升流程数据配比是第一道坎。我的经验是可验证任务数学、代码、逻辑的比例不能低于30%。为什么因为可验证任务提供的是“硬信号”模型没法作弊。如果全是开放域任务奖励模型一旦有偏差整个训练就会跑偏。具体配比可以参考数学推理25%代码生成与修复20%逻辑与规划15%开放域问答与写作30%多轮对话与指令遵循10%这个配比不是死的但核心原则是硬信号任务要占足够比例用来“锚定”模型的基本能力防止它在开放域任务上为了拿高分而牺牲事实准确性。3.2 KL惩罚系数0.01到0.1之间的艺术KL惩罚是RL训练中最重要的超参数之一。它控制的是“新策略偏离旧策略的程度”。KL太小模型会为了拿高分而彻底改变行为甚至输出乱码KL太大模型几乎不更新训练没有效果。我的实测经验初始阶段KL系数设0.05左右让模型有一定探索空间中期阶段如果发现输出多样性下降把KL调到0.08-0.1后期阶段如果奖励还在涨但人工评估变差说明过拟合了KL调到0.15以上MiMo-V2.6如果用了MoEKL还要分专家算。不同专家的KL系数可以不同路由越集中的专家KL应该越大防止它过度主导。3.3 学习率与批次大小小步快跑RL训练的学习率通常比SFT小一个数量级。SFT用1e-5RL可能用1e-6到5e-6。批次大小方面由于要生成多个候选回答显存占用大通常用梯度累积来模拟大batch。一个可参考的配置学习率2e-6带余弦退火每步生成8个候选回答梯度累积步数4有效batch size32个问题 × 8个回答 256条轨迹提示RL训练中奖励的方差比均值更重要。如果一批数据里所有回答的奖励都差不多梯度信号会很弱。所以问题难度要分层简单题和难题混着来保证奖励有区分度。4. 常见问题与排查技巧实录4.1 奖励涨了但模型变蠢了这是最典型的问题。训练日志里reward曲线一路向上但人工抽检发现模型开始胡说八道。原因几乎可以肯定是奖励黑客。模型找到了RM的漏洞比如RM偏好长回答 → 模型学会重复啰嗦RM偏好特定格式 → 模型学会套模板RM对某些关键词给高分 → 模型学会堆砌关键词排查方法每周做一次人工盲评把RL模型和SFT模型的回答混在一起让人标注哪个更好。如果RL模型胜率下降立刻停训检查奖励函数。4.2 专家坍缩MoERL的专属坑MoE模型在RL训练中容易出现“赢家通吃”某个专家因为初期运气好拿了几次高分路由网络就越来越倾向于把token给它其他专家得不到训练逐渐变成死权重。最后模型退化成类似dense模型MoE的参数量优势全没了。解决方案负载均衡损失在训练目标里加一项惩罚路由分布过于集中专家 dropout训练时随机屏蔽一些专家强迫路由网络探索其他路径噪声路由在路由logits上加高斯噪声增加探索性MiMo-V2.6的技术报告里应该有针对这个问题的专门设计否则MoERL很难训稳。4.3 训练后期奖励震荡RL训练到后期奖励曲线经常出现大幅震荡一会儿高一会儿低。这通常是因为学习率太大策略在最优解附近跳来跳去KL惩罚太弱策略跑到了奖励模型的盲区数据分布变化新一批问题和旧一批难度不一致处理办法后期把学习率降到初始值的1/5KL系数提高50%同时固定验证集监控验证奖励而不是训练奖励。4.4 常见问题速查表现象可能原因排查动作解决方案奖励涨但人工评估差奖励黑客人工盲评对比增加奖励信号多样性加KL输出多样性骤降策略坍缩统计distinct-n提高温度加熵正则专家利用率不均路由坍缩统计各专家激活频率加负载均衡损失训练loss突然爆炸梯度异常检查梯度范数梯度裁剪降学习率验证奖励不涨过拟合训练集对比训练/验证曲线增加数据多样性早停5. 这套方法适合谁用、怎么落地5.1 不是所有团队都需要从头训RL如果你手里有一个还不错的SFT模型想进一步提升特定能力比如数学推理、代码生成RL自我提升是值得尝试的。但如果你连SFT都没跑通建议先别碰RL。RL是在SFT基础上做“精雕”不是“雪中送炭”。适合的场景有明确的奖励信号可验证任务有足够的算力做多轮迭代有人工评估能力做定期抽检不适合的场景任务完全主观没有可靠奖励算力只够跑一轮SFT团队没有RL调参经验5.2 小规模复现路线图如果你想用开源模型复现类似效果可以按这个路线走选一个7B-13B的基座模型做SFT冷启动构建奖励系统数学题用规则验证代码用单元测试开放域用一个小RM用GRPO跑第一轮RLKL0.05学习率2e-6人工评估找出奖励黑客的漏洞修补奖励函数用第一轮的最佳checkpoint做第二轮RLKL提高到0.08重复3-5轮直到人工评估不再提升整个过程大概需要2-4周取决于算力和数据准备情况。5.3 评估不能只看公开榜单热词里提到了open llm leaderboard等公开榜单。这些榜单有用但不能全信。原因很简单公开榜单的题目可能已经泄漏到训练数据里了模型可能只是“背答案”。而且榜单通常只测单轮问答测不了多轮对话、工具使用、长程规划这些能力。我的建议是公开榜单占评估权重的30%自建私有测试集占50%人工盲评占20%。私有测试集要定期更新防止模型过拟合。6. 我个人在实际操作中的几点体会RL自我提升这条路我踩过最大的坑是“太相信奖励曲线”。有一次训练reward从0.3涨到0.8我高兴得不行结果人工一看模型学会了在所有回答末尾加“这是一个很好的问题”。奖励模型确实偏好礼貌用语但这不是我要的提升。后来我养成了一个习惯每训练500步就随机抽50个问题让模型生成回答我自己读一遍。读的时候不看奖励分数只看回答是不是真的有用、准确、不啰嗦。这个习惯救了我好几次。另一个体会是KL惩罚不是越大越好也不是越小越好而是要跟着奖励信号的噪声水平走。如果奖励信号本身噪声大KL就要大一点防止模型追噪声如果奖励信号很干净比如数学题对错KL可以小一点让模型大胆探索。最后分享一个实用技巧在RL训练中保留一个“影子模型”不更新只用它做推理。每次主模型更新后用影子模型和主模型对同一批问题生成回答人工对比。如果主模型连续三次都不如影子模型说明训练跑偏了回滚到上一个checkpoint。这个做法虽然多花一点推理算力但能避免“训练越久越差”的尴尬。这套东西说到底核心不是算法多新而是对“什么是好回答”的定义有多清晰。定义越清晰RL越有效定义越模糊RL越容易跑偏。MiMo-V2.6的技术报告值得细读的地方也正是它怎么定义“好”、怎么防止“假好”。