
今天分享一篇来自清华大学关于 Agent 强化学习的最新论文个人感觉写的很好故分享给大家。这篇文章没有设计一个更复杂的 RL 框架而是抓住了一个很现实、也很容易被忽略的问题我们现在训练 Agent往往只告诉模型一件事最后任务有没有完成。但一个 Agent 真正出问题的地方通常不在最后一刻。它可能前面搜索路径是对的只是在核对商品规格时漏了一项也可能最终完成了任务但中间绕了很多无效步骤。也就是说模型拿到了“成败结果”却没有真正学到“过程经验”。 这篇论文想解决的正是这个问题能不能让 Agent 在训练时学会复盘自己把成功经验和失败教训变成下一次行动的能力。Figure 1: Overall performance overview对短任务来说这个问题还不致命。答一道数学题、写一段代码、做一次单轮问答最终结果本身就能提供相当强的信号。但 Agent 不一样。它要多轮交互要查信息要调用工具要从环境反馈里修正动作。一次失败轨迹里可能前 80% 都是对的只是最后买错了商品规格一次成功轨迹里也可能藏着一套可复用的搜索策略。传统 outcome-based RL 只看终局奖励很容易把这些中间经验压扁成一个标量。这就是论文里说的 supervision gap终局级奖励和 token 级策略学习之间存在监督粒度差距。SEED 的判断是完整轨迹结束之后里面其实多了很多“在线决策时看不到的信息”。结束之后再看才知道哪个观察是关键哪个工具调用是多余的哪个动作导致失败哪套流程可以复用。这件事很像工程团队做 postmortem。线上事故发生时大家只能救火事故结束后复盘才知道真正的问题是监控缺口、回滚流程还是某个隐含假设错了。SEED 把这种复盘机制放进了 Agent 训练。SEED 怎么做先复盘再蒸馏SEED 分两步。第一步先让模型学会“看轨迹、写技能”。研究团队先收集离线轨迹再用外部分析器给每条完成轨迹生成 hindsight skill也就是事后技能。成功轨迹里技能可能是可复用工作流失败轨迹里技能可能是避错规则。第二步进入真正的自进化训练循环。当前模型先作为 actor 去环境里跑轨迹。轨迹结束后同一个模型又切换成 analyzer分析自己的完整轨迹生成 hindsight skill。Figure 2: Overview of SEED然后关键动作来了SEED 不把这个 skill 直接塞到推理 prompt 里而是在训练时做一次对照。同样的动作 token模型分别在普通上下文和“带复盘技能”的上下文下重新打分。如果某个 token 在带技能上下文里概率明显更高说明这个技能支持这个动作SEED 就把这种概率变化转成稠密的 token 级蒸馏信号。最后这个 OPD 蒸馏损失和 GRPO 这样的结果奖励一起优化。所以 SEED 的训练信号有两层一层来自环境最终结果告诉模型“这局有没有赢”另一层来自复盘技能告诉模型“哪些具体动作更像是好决策”。推理时则不需要额外技能库、检索模块或加长 prompt。论文强调hindsight skill 只作为训练期特权信息最终被内化到模型参数里。这点很重要。因为很多 Agent 方案的代价是推理时越来越重更长上下文、更多记忆、更多检索、更多规则。SEED 走的是另一条路训练时多做复盘部署时保持干净。结果最有意思的地方小模型也明显吃到红利以 Qwen2.5-3B-Instruct 为例SEED 在 ALFWorld 平均成功率达到 91.8%而 GRPO 是 75.0%WebShop 成功率从 GRPO 的 63.3% 提升到 78.9%。在 Qwen3-1.7B-Instruct 上差距更夸张ALFWorld 平均成功率从 GRPO 的 46.1% 提升到 92.0%WebShop 成功率从 38.3% 提升到 77.3%。Figure 3: Training curves and interaction efficiency这说明 SEED 的价值不只是“多一个技巧”。它尤其适合那些还没有强大规划能力的小模型。小模型最缺的往往不是最终奖励而是中间过程里的可学习信号。更值得注意的是样本效率。论文显示在 ALFWorld 上SEED 只用 60% 训练数据就达到 80.7%超过 GRPO 用 100% 数据得到的 75.0%。在 WebShop 上SEED 也在不同数据比例下持续优于 GRPO。Figure 4: Sample efficiency analysis这背后的含义很现实Agent 训练贵不只是因为模型大还因为环境交互、轨迹采样、评估验证都很贵。如果每条轨迹只能提供一个最终奖励数据利用率就很低。SEED 试图从同一条轨迹里榨出更多监督。它和“写更好的 prompt”不是一回事很多人看到 hindsight skill第一反应可能是这不就是把经验总结成 prompt 吗不是。论文里对比了 Skill-Prompt 和 Skill-GRPO。结果显示只在推理时把技能塞进上下文效果不如把技能蒸馏进模型。SEED 在大多数聚合指标上都超过了带技能推理的 Skill-GRPO。这点对 Agent 产品很有启发。过去一年很多 Agent 系统都在堆 prompt、堆 memory、堆 workflow。短期看有效但长期会遇到几个问题上下文膨胀、规则冲突、检索噪声、推理成本上升。SEED 的方向更像是把经验从“外部提示”变成“内部能力”。这并不意味着 memory 和 workflow 不重要而是说明真正可规模化的 Agent 训练不能只靠运行时把说明书越写越长。它需要把高频、稳定、可迁移的行为模式压进模型本身。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】