
26年9月来自NV公司、南洋理工NTU和MIT的论文“SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness”。这篇论文最有价值的地方是展示如何通过自动化实验改进智能体的驾驭框架降低长任务中的重复开销。实验支持“以一定性能代价换取明显成本下降”也展示了部分单项机制能同时改善性能和成本但对于“持续递归自我改进”和“扩大搜索规模就能持续获益”目前证据仍不充分。方法的核心是把智能体框架作为可搜索、可修改的程序。这里的 驾驭Harness可以理解为模型周围的运行系统它决定如何调用工具、组织上下文、处理工具输出以及把哪些工作交给辅助模型。论文保持底层模型权重不变通过修改这些环节来降低完成任务的成本。如图 1 所示SoL-Pi 通过自动化研究发现一种更具 Token 效率的驾驭框架harness。(a) SoL-Pi自动化研究循环的扩展Scaling Auto-Research Loop。预设的研究环境向运行基础框架的 AI 提供任务研究型 AI 检查执行轨迹提出改进方案并通过能力与效率门控机制筛选候选方案池。在框架定型以用于未见基准测试评估之前四个被保留的机制被整合并优化为 SoL-Pi。图中的轨迹、构想和门控符号仅为示意能力检查在固定容差范围内进行且留存测试集held-out的结果不会反馈至搜索过程。(b) EdgeBench上的示例结果展示了原生框架基于 GPT-5.6 Sol 的 Codex 和基于 Opus 5 的 Claude Code、Pi 以及包含全部四种机制的 SoL-Pi 框架的平均得分与 API 成本。与基于 GPT-5.6 Sol 的 Codex 相比SoL-Pi 的 API 成本降低了 50.0%与基于 Opus 5 的 Claude Code 相比成本降低了 54.3%。它包含两个层次外层自动研究循环分析已有执行轨迹提出改进假设实现候选方案经过独立审查和实验后保留有效机制。内层任务执行循环把保留下来的机制集成到 Pi让智能体以更低成本完成实际任务。搜索从152 个候选方向、535 个可执行环境开始经历超过3,000 次运行、60,000 次智能体—环境交互。其中495 个环境来自 GitHub Issue–PR 对40 个为带可执行验证器的合成任务。仓库任务使用修复前的代码并隐藏参考补丁与回归测试。筛选规则体现“能力约束下的效率优化”先要求各项能力指标在预设容差以内再要求至少一项效率指标改善保留不存在其他候选全面优于它的方案。外层广泛探索不同方向内层反复完善有潜力的方向。第 2–4 页最终框架由四项机制组成分别处理不同来源的浪费。下图是运行时关系的简化示意机制具体做法节省什么以及适用边界Action Fusion动作融合把“编辑文件”和可预知的后续测试、构建命令放入同一次工具请求合并返回结果减少一次模型往返如果必须先检查编辑结果才能决定下一步则仍分开执行Online Context Compact在线上下文压缩在计划步骤完成时根据剩余步骤、历史请求频率和上下文增长估计未来收益再决定是否调用 Pi 原生压缩减少历史上下文反复输入考虑缓存重写成本避免压缩过于频繁ObservationPack工具输出归档与按需读取超过 10 KiB 的结果先完整发送两次第三次请求开始替换为稳定句柄、大小及约 1 KB 首尾摘录减少大段输出的重复传输原文保存在本地可精确分页取回Evidence-Preserving Reducer保留证据的日志缩减器对特定构建、测试命令产生的至少 4 KiB 日志使用低成本模型抽取证据验证格式、哈希、退出状态、原文引用和大小减少主模型读取冗长日志的开销验证失败则返回原文文件读取和搜索结果不经过该机制其中辅助模型使用 GPT-5.6 Luna仅负责证据提取诊断与行动仍由主模型负责。Reducer 先于 ObservationPack 执行已验证的证据摘要会被后者跳过避免再次缩减。第 4–5 页图 4所示这里最有价值的设计是在缩短当前上下文的同时尽量保留原始证据的可访问性。它把“当前需要看什么”和“以后还能查到什么”分开处理。不过可取回原文并不保证智能体一定意识到自己需要取回这也是后面的关键问题。实验显示了明确的成本收益同时也显示了能力损失。最直接的比较是同一模型下原始 Pi 与完整 SoL-Pi 的差异EdgeBench51 个公开任务GPT-5.6 SolOpus 5Pi 平均得分44.83344.756完整 SoL-Pi 平均得分42.00342.224得分相对下降6.3%5.7%记录的 token 流量下降49.0%44.7%API 成本$1,339 → $894$1,741 → $1,158API 成本下降33.2%33.5%这里有三个口径需要区分“token 减少近一半”不等于“费用减少近一半”。减少的主要部分是重复上下文及缓存读取不同 token 类型的价格不同。图 1 中50.0%–54.3% 的成本降幅参照的是原生 Codex、Claude Code相对 Pi 的增量收益约为三分之一。文中的“token efficiency”实际用API 成本任务总得分衡量并非单纯的 token 数。价格统一采用论文指定的 2026 年 8 月 17 日价格。表 1–2其他实验也呈现类似权衡Terminal-Bench 463 个 CPU 任务中Pi 完成 18 个SoL-Pi 完成 15 个总成本下降 26.3%每完成任务成本下降 11.6%。IMO 2026SoL-Pi 与 Pi 均通过 3/6 题SoL-Pi 更便宜Codex 通过 5/6 题但总成本更高。多智能体内核优化SoL-Pi 集群比 Pi 集群更便宜最终结果也更好但单个 Codex 智能体仍是三个配置中费用最低的。每种配置只运行了一次两小时实验。第 7–8 页因此这些结果更适合支持“改善成本与能力之间的权衡”还不足以支持普遍的“能力无损降本”。论文的贡献主要有三点。给出了可执行的自动化框架研发流程。从轨迹分析、候选实现、独立审查到开发验证形成闭环并强调冻结候选后才进行留出评估。这比单纯让模型“反思如何改进自己”具体得多。把四类常见开销放进同一系统中处理。动作往返、上下文重放、大型工具输出、长日志阅读分别有对应机制而且包含原文归档、确定性验证及失败回退。创新重心在机制的自动发现、细化和系统集成。提供了初步的跨模型、跨任务迁移证据。完整方案主要在 GPT-5.6 Sol 轨迹上开发直接应用到 Opus 5 仍能显著降低成本额外基准扩展了证据范围。作者也公开了可安装在 Pi 上的扩展便于进一步验证。官方代码仓库从研究定位看它的系统与工程贡献较强关于自动搜索为何有效、如何随规模变化的科学解释仍有待补足。最值得追问的问题是收益能否被可靠归因以及这些机制什么时候会伤害任务完成。首先“性能相当”缺少足够的统计支撑。完整方案在两个模型上都有约 6% 的相对得分下降Terminal-Bench 的完成数量也下降。文中未给出主要结果的重复运行分布、置信区间或充分的非劣效检验虽然声称预先固定能力容差但没有清晰列出足以复现判断的完整阈值。不同应用对这类损失的接受程度会很不同。其次评估集与配置选择需要更清楚地区分。第 6 页说明EdgeBench 的 51 个任务中11 个用于冻结候选的单向验收40 个用于最终泛化评估主结果却汇总报告 51 个任务最好另列纯 40 题结果。此外所谓SoL-Pi [Performance]是从表 4 中为每个模型挑选得分最高的单项机制Sol 选 ObservationPackOpus 选 Action Fusion。它包含依据评估结果进行配置选择的因素证据强度应与“预先固定完整方案、直接迁移”区分开。这些疑点不等于已经发生数据泄漏但会影响泛化结论的解释。第三四项机制全开未必是最合适的配置。表 4 中有一个很有启发性的例子Opus 5 配置总成本平均得分每单位总得分成本越低越好仅 ObservationPack$1,17647.0470.4899四项机制全部启用$1,15842.2240.5376仅启用 ObservationPack费用只高约1.6%得分却高约11.4%单位得分成本更低。完整方案在绝对费用上最低但并非所有效率目标下都最好。而且论文主要做“基线加一个组件”的消融缺少系统性的两两组合、移除组件和交互效应分析。图 7 比较的还是各配置自身触发机制的任务子集不能直接证明机制之间存在正向协同作者也承认这一限制。第四证据的真实性验证不能保证证据完整。Reducer 可以验证某段引用确实来自原日志却无法证明关键错误没有被遗漏。一个摘要可能每句话都真实但恰好漏掉决定下一步行动的那一行。ObservationPack 的固定“两次完整展示”也未必适合跨文件、跨阶段依赖很强的任务。这需要专门测量遗漏率、原文取回率、错误恢复和最终失败而不仅是摘要大小。第五成本控制与递归收益还没有完全闭合。上下文压缩门控估计了缓存重写开销但没有单独计入摘要调用费用剩余请求数也依赖启发式预测。更大的问题是超过 3,000 次搜索运行本身需要多少成本、部署多少任务才能回本论文没有给出完整答案。同时152 个方向、535 个环境只是一个较大规模的实验点没有固定预算下的宽度深度对照。论文第 5.1 节明确承认让更便宜的框架帮助搜索出下一代框架形成连续多代收益目前仍是未来愿景。下一步工作中最优先考虑“自适应机制选择”和“证据充分性”再推进真正的递归实验。作者提出的方向包括扩大环境与假设覆盖、多模型共同优化、用 SoL-Pi 启动下一代搜索。下面是这些方向的具体化优先方向可实施的研究方案要回答的问题1. 自适应机制控制器根据任务阶段、模型、上下文大小、日志类型、缓存价格动态选择是否融合、归档、缩减或压缩与全开、单项和静态组合比较能否保留大部分降本收益同时收回约 6% 的得分损失2. 从“引用真实”走向“证据充分”构造关键错误位于日志中部、多处证据必须联合判断等任务增加关键事实覆盖检查、不确定性判断和自动补读压缩是否遗漏决定性信息如何及时发现并恢复3. 严格分析组件交互在固定任务集上评估四项机制的 16 种开关组合重复运行并分析任务类别差异哪些组件互补哪些重复工作哪些组合导致过度压缩4. 验证搜索规模与递归收益固定总预算比较搜索宽度、深度和环境多样性连续运行数代并设置每代都从原始 Pi 开始的对照更好的框架是否真正提高下一代研究效率收益是否超过搜索成本5. 跨模型、跨仓库的稳健优化多模型共同参与开发按仓库、时间和任务类型隔离测试采用预先声明的能力下限能否获得稳定迁移的策略而不是适合某个模型的触发习惯如果要以此发展一篇后续论文“具有证据充分性约束的自适应智能体驾驭框架”。研究目标可以明确为在预先规定的任务成功率下降上限内最小化完整任务成本。它既能直接回应本文暴露出的组件组合问题也能把“何时应该压缩、何时必须保留信息”变成可学习、可验证的核心问题。