三阶段训练 + Agentic RL Scaling:拆解 KAT 系列的训练范式

发布时间:2026/10/11 8:37:11
三阶段训练 + Agentic RL Scaling:拆解 KAT 系列的训练范式 三阶段训练 Agentic RL Scaling拆解 KAT 系列的训练范式【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev如果说 2024 年的代码大模型比拼的是单点代码生成那么 2025 年以来的 Agentic Coding 赛道比拼的已经是端到端解决真实软件工程问题的能力读懂一个 GitHub Issue、规划修改路径、调用工具读写文件、跑测试验证、提交修复。快手 Kwaipilot 的 KAT 系列正是在这条赛道上跑出了一组行业标杆数字——闭源旗舰 KAT-Coder 在 SWE-Bench Verified 上拿到 73.4%开源版本 KAT-Coder-V2.5-Dev 以 35B 总参、3B 激活的 MoE 架构把 SWE-Bench Verified 做到 69.40%并在 SWE-bench Multilingual、SWE-bench Pro、Terminal-Bench 2.1、PinchBench 等基准上全面领先同类模型。分数背后真正值得研究的东西是它的训练范式Mid-Training → SFT RFT → Agentic RL Scaling 的三阶段流水线以及其中对RL 如何稳定地训练 Agent这一开放问题的工程化回答。本文结合社区公开信息与仓库源码逐层拆解这套范式。为什么会写代码不等于会做工程传统代码模型的训练目标是给定输入补全正确代码评测集是 HumanEval 式的单函数问题。但 Agentic Coding 的工作负载完全不同模型要在一个真实仓库环境中自主行动——理解 Issue 描述、搜索代码、编辑多个文件、执行命令、根据报错迭代、最终提交。这要求模型同时具备三类此前很少被同时训练的能力指令遵循把自然语言需求稳定地翻译成可执行的动作序列不跑题、不答非所问工具调用按照既定协议调用git、编译器、测试运行器等外部工具且不能幻觉出环境里根本不存在的工具多轮与长程在数十上百轮的交互中保持上下文一致不重复、不遗忘。KAT 系列的三阶段设计正是让模型依次跨过这三道门槛先用 Mid-Training 打 Agent 素质基础再用 SFT RFT 对准真实开发场景最后用 Agentic RL Scaling 在试错—反馈中打磨决策质量。第一阶段Mid-Training把Agent 素质焊进底座Mid-Training 阶段解决的核心问题是通用基座模型并不天然具备当一名软件工程师 Agent的素质。这一阶段围绕六大能力做定向强化——指令遵循、工具使用、多轮交互、代码知识注入、通用推理、场景适配。其中工具使用的训练目标非常具体让模型学会调用 Git、编译器、调试器等开发常用工具例如根据需求自动完成 Git 提交、PR 操作的代码生成而不是把工具调用当成一个纯文本格式问题。这一设计在仓库里有直接的工程载体。看 chat_template.jinja模型被要求使用一套严格的 XML 式工具调用协议内层function.../function必须嵌套在tool_call/tool_call之中参数以parameternamevalue/parameter形式给出工具执行结果则包裹在tool_response/tool_response标签中回填给模型。模板里甚至写明了约束Function calls MUST follow the specified formatIf there is no function call available, answer the question like normal——这种把工具协议焊死在模板层的做法本质上是为 RL 阶段提供一个稳定、可解析的动作空间动作格式不确定奖励就无从谈起。第二阶段SFT RFT从会写到写好Mid-Training 解决能不能做 AgentSFT RFT 阶段解决做得好不好、贴不贴真实场景。据公开资料KAT-Coder 系列的 SFT 数据覆盖 8 大用户任务应用开发、功能实现、Bug 修复、代码重构、性能优化、测试用例生成、代码理解等与 8 大编程场景前端 UI/UX、数据科学、机器学习、数据库、基础设施、安全工程、配置部署等让模型在进入强化学习前就对开发者的真实工作负载有充分覆盖。RFTRejection Fine-Tuning 类方法阶段引入多 Ground Truth机制对同一需求采集多种可行的代码实现方案作为监督数据而不是只保留单一标准答案。其收益在后续 RL 阶段才真正显现——多样化的轨迹起点让 rollout 更丰富减少训练冗余也避免模型因单一数据形成思维固化。到 KAT-Coder-V2.5-Dev 这里SFT 阶段的具体规模是可考的团队以广受认可的 Qwen3.6-35B-A3B 为基座在 127K 条样本上完成监督微调再对 SFT 模型做 RL 训练见 README.md。与从头做三阶段的 KAT-Coder 系列不同V2.5-Dev 走的是成熟基座 SFT RL的精简路线但其 RL 配方完整继承了 KAT-V2.5 的四大技术设计——这正是第三阶段的核心看点。第三阶段Agentic RL Scaling范式真正的护城河Agentic RL 的难点不在于定义奖励而在于在异步 rollout、真实沙盒执行、超长轨迹的条件下让训练稳定收敛。KAT 系列在 Agentic RL Scaling 阶段沉淀了四项关键技术在 README.md 中有明确记载Token-in-Token-outTITO一致性保证 rollout 与训练阶段的 token 序列严格一致杜绝因聊天模板、序列化或分词器行为差异导致的训练信号错位——在异步分布式 RL 里这类隐蔽的不一致会被放大成灾难截断重要性采样TIS异步 rollout 天然带来策略陈旧与 off-policy 问题TIS 通过截断重要性权重压制过大权重造成的方差与训练不稳定可靠沙盒与验证器系统性检查沙盒与验证器的稳定性和正确性防止执行超时、环境错误、验证器误判这类基础设施故障被当成模型错误惩罚从而污染奖励信号基于执行反馈的层级奖励把工具执行返回的细粒度反馈拆解为多层奖励——模型即使最终没有跑通也能在失败轨迹中获得有意义进展的信用提高失败样本的训练价值。更值得借鉴的是团队处理Qwen3.6 水土不服的过程这几乎是每个做 Agentic RL 的人都会踩的坑。初始实验里简单的 0-1 二元奖励在第二个 epoch 就让模型崩溃分析轨迹发现模型越来越倾向于在单回合内发起大量并行工具调用最多一次超过 70 个导致上下文爆炸、无效轨迹和错误堆积。团队的解法不是推翻框架而是在层级奖励之上追加针对性的惩罚项单回合过多并行工具调用、工具调用失败、空工具调用块、大量重复内容。这些纠偏让 RL 稳定推进了10 个 epoch。效果直接反映在行为健康度上——这是比基准分更见训练功力的指标异常工具标签出现率从 9.34% 降到 0.28%-9pp单回合连续重复从 0.34% 降到 0%。也就是说经过 RL 训练模型不再胡乱调用环境中不存在的工具也不再陷入无意义的自我重复。对照同类模型的评测报告如某些竞品在 Agent 环境中反复尝试调用不支持的 MultiEdit 工具、因上下文溢出而崩坏更能理解这套行为优化的稀缺性——基准分数可以被算力堆出来行为稳定性只能靠训练设计抠出来。在更大的 KAT-Coder 系列尺度上Agentic RL Scaling 还叠加了工程侧创新熵引导树剪枝把海量轨迹组织成前缀树按熵与访问概率剪枝把计算预算集中到高信号节点与 SeamlessFlow 异构调度训练流程与 Agent 逻辑解耦让 CPU/GPU 集群资源接近零气泡运行。这些是支撑RL 规模化Scaling的基础设施正是它与普通给模型做一轮 RL的本质区别。Agent 增强在源码里的落点思考保留、工具协议与长上下文指令遵循、工具调用、Git 操作这三类 Agent 能力最终都要落到推理期的协议与配置上。仓库里可以逐项对证工具调用的协议与容错如前述 chat_template.jinja 定义的tool_call协议同时模板支持enable_thinking关闭思考直接回答与preserve_thinking保留历史轮次的推理痕迹两种模式。preserve_thinking对 Agent 场景尤其关键完整推理上下文能提升多轮决策一致性、减少重复思考的 token 开销、优化 KV 缓存利用——这解释了 RL 训练中重复内容惩罚为何能同时改善行为与推理成本。超长上下文支撑多文件工程任务模型原生支持 262,144 token 上下文config.json 中max_position_embeddings: 262144并可经 YaRN 缩放扩展至约百万 tokenREADME 给出的配置为factor: 4.0、max-model-len 1010000。代码库级任务动辄数万 token 的上下文是 Agent 范式成立的前提。MoE 架构的成本结构config.json 显示该模型 40 层、256 个专家、每 token 激活 8 个专家且层类型采用 linear attention 与 full attention 每 4 层交替的混合注意力设计——3B 激活参数意味着单卡即可运行这是开源复刻在经济性上的关键。这套范式对开源复刻的参考价值把 KAT 系列的范式压缩成可迁移的清单大致是四句话第一动作空间要先于奖励设计。工具协议、模板、token 序列的一致性TITO没有做好之前RL 奖励再精巧也是空中楼阁。V2.5-Dev 在 SGLang/vLLM 部署时要求--tool-call-parser qwen3_coder、--reasoning-parser qwen3见 README.md正是为了保证推理时生成的结构与训练时一致。第二奖励必须防崩溃优先于求最优。Qwen3.6 案例说明0-1 奖励在 Agent 场景下极易被刷并行调用这类捷径击穿对病态行为的显式惩罚并行过多、调用失败、空调用块、重复内容是稳定训练的必需品层级奖励则是提升失败样本价值的放大器。第三沙盒可靠性是奖励信号的护城河。执行超时、环境错误、验证器误判一旦混入奖励模型会把环境坏了学成我错了污染难以逆转。KAT 团队将其列为四大支柱之一复刻者应同样重视。第四用行为健康度而非单一分数验收 RL。异常工具标签率、重复率这类指标比总分更能暴露训练信号的质量9.34% → 0.28% 的收敛背后是完整一套检测病态行为—定位轨迹原因—设计惩罚项的闭环方法论。最后回到开源本身KAT-Coder-V2.5-Dev 以 Apache-2.0 协议开放权重配套 config.json、generation_config.json、tokenizer_config.json 等完整推理配置API 兼容 OpenAI 格式覆盖 SGLang、vLLM、KTransformers、Transformers 四大推理框架。对于想复刻 Agentic RL 训练范式的团队它同时提供了结果35B/3B 的 SOTA 权重与过程可验证的训练配方与踩坑记录。当训练范式的每一步都有源码与数据可查、每个奖励设计都有崩溃案例与修复记录可循时Agentic Coding 的训练才真正从玄学变成了工程。【免费下载链接】KAT-Coder-V2.5-Dev项目地址: https://ai.gitcode.com/hf_mirrors/Kwaipilot/KAT-Coder-V2.5-Dev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询