HarnessDev:LLM 能否创建和发展自己的智能体驾驭?

发布时间:2026/9/12 19:06:14
HarnessDev:LLM 能否创建和发展自己的智能体驾驭? 26年9月来自字节跳动 Seed 团队、新加坡科技设计大学 SUTD、M-A-P和佐治亚理工学院和TokenWave.AI等机构的论文“HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?”。1. 论文速览与核心贡献提出了 HARNESSDEV 基准测试,将大模型(LLM)评估的对象从“单次任务的输出答案”转移到“可运行、持久化且可复用的 Agent 执行脚手架(Harness Infrastructure)”。如图1所示HarnessDev涵盖Harness开发的两个阶段。在创建阶段,创建者基于一个功能较弱但可运行的初始版本和少量开发用例构建完整的Harness。在演进阶段,创建者利用下游执行反馈不断改进其持久化的Harness。这两个阶段都评估跨任务持久化的可运行基础设施,而非一次性任务输出。2. 研究背景与动机(Why Harness?)随着 AI Agent 从实验原型走向生产落地(如 Claude Code, OpenHands, Codex CLI 等),决定 Agent 能力的不再仅仅是模型本身的权重,还有包裹模型的模型外执行基础设施(Agent Harness)。Harness 的关键作用:负责管理执行循环(Execution loop)、工具使用(Tool policy)、上下文管理(Context)、持久化状态(State)、失败恢复(Lifecycle/Recovery)和结果验证(Verification)。论文发现:在不改变模型权重的前提下,将 GPT-5 放入 Terminus 2 脚手架中时 Terminal-Bench 求解率为 35.2%,而换入 Codex CLI 脚手架后性能升至 49.6%。现有基准痛

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询