“AI干活,人拍板“:769条人机协作记录首次公开,96.5%的AI使用率有了官方数字

发布时间:2026/10/9 22:40:29
“AI干活,人拍板“:769条人机协作记录首次公开,96.5%的AI使用率有了官方数字 AI干活人拍板769条人机协作记录首次公开96.5%的AI使用率有了官方数字【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview2026年9月14日上海人工智能实验室将智能体大模型 Atria Dawn Preview 的权重与配套论文一同推向开源社区。相比744B 参数 MoE16 项基准 5 项第一这类常规卖点真正在技术圈引发讨论的是论文里一项此前极少有厂商愿意公开展示的实证研究研发团队把开发 Atria Dawn 这一模型本身的过程当作人机协作案例公开了来自 56 名参与者的 769 条任务记录与完整 agent 日志。数据给出了一组此前只有感受、没有数字的答案——在 739 个对是否使用 AI有明确回复的任务中713 个实际启用了 AI使用率高达 96.5%但与此同时人类在 85.5% 的方法与参数决策中握有最终拍板权。AI 干活、人拍板从一句直觉判断第一次有了可审计的官方样本。本文基于论文全文arXiv 2609.15818与本仓库源码拆解这三组数字背后的实验设计、分工真相与叙事含义。一、769 条记录怎么来的把研发过程本身做成实证样本从研究问题到可验证结果的训练设计要理解这批协作数据的可信度先得看 Atria Dawn 的训练范式。仓库的 README_CN.md 将其定位为面向需要持续理解环境、调用工具并完成多步任务的研究与工程场景的智能体模型基于 744B MoE 的 GLM-5.2 基座训练。而论文中披露的训练核心是一条Verifiable Experience Pipeline可验证经验流水线每一条训练任务都被连接到真实执行环境模型观察状态、调用工具、产出中间产物、根据反馈迭代最终结果必须通过测试、指标、文件状态、几何结构、来源证据或人工定义标准等外部信号验证只有任务—轨迹—产物—验证证据完整闭环的经验才会沉淀为模型能力。架构层面可以从仓库的 config.json 读出具体支撑78 层隐藏层、256 个路由专家、每 token 激活 8 个专家、max_position_embeddings高达 1,048,5761M权重以 BF16 分片为 353 个文件model.safetensors.index.json 显示总大小约 1.5TB。结合 chat_template.jinja 中完整的tool_call/observation/think结构可以看到这套模板为思考—工具调用—环境反馈—再思考的长链智能体行为做了显式编码thinking 推理与工具协议是模型默认能力的一部分而非事后补丁。56 人、769 条任务一个 4 周的真实研发样本论文的实证部分没有另起炉灶设计实验室场景而是直接采集了 Atria Dawn 自身研发周期内的协作记录56 名参与者、769 条任务记录连同 agent 日志一并分析。其中 739 个任务对是否使用 AI有明确回复713 个使用了 AI——96.5% 的使用率由此而来。更有信息量的是参与度的时间演变。对同一批 22 名参与者从 8 月 7 日到 9 月 4 日每人类提示对应的 agent 动作数的日度中位数从 11.0 攀升到 28.5且四分位距同步扩大——协作强度在整体加深但个体之间的分化也在加大。也就是说短短四周内同样一句人类指令平均会触发近 30 个 agent 动作。论文特别指出参与者委托给 AI 的任务呈现高度规律的模式汇报运行状态、在指定数据集上跑训练-评估循环、调试失败的实验、准备数据与扩容资源、总结 agent 改动内容——这些全部集中在执行与汇报而非研究什么。二、数据里的分工真相提案权与拍板权是两回事55.4% 的提案来自 AI85.5% 的最终决策留在人类手中这组数字是全篇最容易被误读、也最值得细读的部分。论文将研发决策拆成三类——目标/范围、方法/参数、验收标准——并分别统计谁提出选项与谁做最终选择在方法/参数类决策中AI 提出、人类选择是最常见的模式占55.4%人类在 85.5% 的方法决策中做出最终选择无论选项来自人类还是 AIAI 最终拍板的仅 9.2%目标/范围决策中人类最终选择占93.4%验收标准占81.9%关键对比在于AI 的提案份额从目标/范围类的 16.9% 摆动到方法/参数类的 55.4%三倍以上而最终决策份额始终被压在 6.1%–9.2% 的窄区间。随决策类型变化的是谁生成选项而不是谁拍板。这在那些被评定为离开 AI 不可行的任务上体现得更极端151 个此类任务中人类在 144 个95.4%任务上选择了最终目标。依赖度最高的任务恰恰是人类主权保留最完整的任务——把任务整体划给某一方的二分法叙事在这里站不住脚。33.2% 的任务没有 AI 不可行AI 改变的不只是效率论文让参与者对已完成任务做反事实评估在任务范围、质量要求与资源条件不变的前提下自己负责的部分离开 AI 是否还能完成。在 455 个有可用回复的已完成 AI 辅助任务中151 个33.2%被评定为不可行且这些任务分散在 56 名参与者中的 27 人——接近一半的样本量排除了少数重度用户拉高均值的解释。论文由此区分了两个常被混为一谈的量节省的时间与被创造出来的可能性。33.2% 不是慢一点也能做完的工作量而是根本不会被尝试的工作量。只测前者会系统性低估 AI 对研发边界的改变。76% 的困难任务靠人推人类介入以喂信息为主而非替动手当任务卡住时分工真相更为清晰。在 588 个记录了最重大困难的任务中76.0% 靠人类干预推进agent 自行恢复的占 23.0%仅 1.0% 未解决人类帮助的构成才是重点添加上下文/澄清需求占35.2%诊断问题/改变方法占34.7%而直接改代码的部分编辑仅 3.2%接管任务仅 0.7%——人类帮助改变 agent 知道什么的可能性是改变谁来做的约 18 倍输出修订呈现同样结构627 个有明确处置记录的任务中 354 个56.5%发生实质修订其中75.4% 由 AI 在收到人类反馈后自行重写人类直接编辑仅 19.2%95.9% 的 AI 输出以某种形式进入最终交付物。这三组数据合在一起论文给出的分工结论是人类决定目标是什么、补充失败运行缺失的上下文、指出必须改什么agent 生成绝大多数选项并产出几乎全部代码、文本与修订。稀缺输入是判断而非执行。这也解释了为什么每提示的 agent 动作数从 11.0 涨到 28.5 不应被读作自主性上升——每一次人类判断如今通过更多 agent 动作来传播而非通过更少。三、从AI 替代人到项目级伙伴关系叙事切换意味着什么96.5% 的使用率与 9.2% 的 AI 决策权并不矛盾论文把 AI 研发中人与模型的关系划为三个阶段早期模型只是研究对象完全由人操控实验全流程随着代码生成与指令遵循能力成熟模型成为人类设计工作流中的任务执行者而具备智能体能力后模型可以在人类给定的目标与评估标准下自行制定计划、根据实验反馈迭代方案进入项目级伙伴阶段。Atria Dawn 研发中观察到的正是第三阶段——agent 承担了方案设计与迭代修订人类收缩到更高层的判断与关键节点的定向干预。这一叙事切换的关键在于AI 使用率 96.5%与AI 决策权 9.2%在同一份数据里同时为真。此前的讨论往往把用了多少 AI直接等同于AI 取代了多少人而这份记录表明两者正交——使用深度上升时人类的权重没有按比例让渡而是转移到了提案之外的选择端。论文还援引了同行的独立观察OpenAI 报告称 4–8 小时的多数成功任务仍需至少一次人类干预与这里 76% 的困难任务介入率相互印证。通往 RSI 的两道坎研究方向生成与经验内化论文没有停留在伙伴关系的乐观叙事上而是明确指出了从项目级伙伴到递归自我改进RSI之间的技术缺口第一道坎是研究方向生成。AI 在 55.4% 的方法/参数决策中提出选项但在目标/范围决策中只提出 16.9%——绝大多数提案是对研究者已确定方向内的变体。且 agent 共享的先验会产生相关性盲区部署更多 agent 可能只是把同样的尝试重复更多次而没有真正拓宽探索范围。论文据此建议在不同工作 agent 之间建立沟通渠道并承认在 Atria 开发中同一个 agent 在研究者以其特定问题、偏好与权衡进行引导时探索范围会显著拓宽。第二道坎是经验内化。论文观察到agent 从一次失败运行中获得的经验往往停留在该会话或记录中而研究者则把教训带入了下一个任务通用基准的进步无法暴露研究能力的真实变化。所谓 RSI只有当模型能在连续轮次中生成更有价值的研究问题、识别更隐蔽的错误时才真正开始——这需要系统吸收经验而非仅仅检索经验甚至可能要求从根本上重新设计当前记忆与能力分离的架构。人类角色的再定义剪枝、破盲区与谁为授权负责既然执行已近乎全部交给 agent人类剩下的价值是什么论文给出三个可审计的答案其一研究者凭积累的经验与直觉在投入资源前低成本剪枝研究空间这种结果未知时的判断力目前仍难以被 AI 内化其二人类以多样背景对抗 agent 的同质化盲点其三跨项目迁移试错教训的能力仍主要积累在人类身上。论文同样坦诚了授权边界的现状许多研究者以 Codex 的 yolo 模式、Claude Code 的 skip-permissions 模式运行 agent授予宽泛执行权以避免长任务卡在审批上——边界由便利性而非深思熟虑的权限设计决定。论文对AI 是否应被授予像其他权限一样的安全保障权给出明确回答不该。每一轮能力跃升都应匹配成比例的 alignment 与监督投入并需明确谁的意图塑造对齐目标、谁承担风险、谁负责。结语这份数据值得反复读因为它自证了方法Atria Dawn Preview 的价值不止于基准分。AutomationBench 53.8、BFCL v4 77.0、DeepSearchQA 96.0、BrowseComp 92.5、CyberGym 86.5 这五项第一完整对比见仓库 assets/evaluation.png 与 README_CN.md 的评测表回答的是模型能干什么而 769 条协作记录回答的是一个更难的问题——当它被真实地用于生产自己的同类时人和它各自守住什么。96.5% 的使用率是执行侧的深度85.5% 的人类决策权是判断侧的保留76% 的人类干预是困难侧的兜底。三者并列恰恰是论文标题副题人类-AI 协作中不断演变的分工最浓缩的注脚每个决策背后是一条人类无法逐行检查的长链 agent 工作而人类的主权不在于看得更细而在于决定什么值得做、证据如何引导研究。在通向递归自我改进的路上这组数据既是一个里程碑也是一面镜子——它照出的不是AI 将取代人而是人的判断正成为稀缺资源。【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询