OpenAI官宣AI研究实习生上岗,干的活顶3.1个研究员

发布时间:2026/9/7 21:09:23
OpenAI官宣AI研究实习生上岗,干的活顶3.1个研究员 9月6日OpenAI 在官网发布内部视角报告《研究加速》宣布去年秋天定下的目标已经兑现今年 9 月之前做出自动化研究实习生——能在人类指导下完成明确研究任务、包括熟练研究员也要干好几天的活的系统。报告同时给出下一站2028 年 3 月前做出自动化 AI 研究员。同一天首席科学家 Pachocki 发了署名文章《An Alien Mind》说没有任何实验室把对齐和监控做到能长时间全速扩张的水平。踩油门和踩刹车的两份文件同日发布值得拆开看。先看报告里的关键数据均为 OpenAI 官方口径截至 8 月中旬算力消耗研究部门中位研究员每天烧掉的推理算力按 API 价格算超过 600 美元用量前 10% 的人每天超过 7000 美元工作量6 月之前整个部门 Agent 运行总时长还低于人类工时之后反超到 8 月中旬按 8 小时工作日折算每 1 个人类工作日对应约 3.1 个 Agent 工作日任务构成Agent 的活从写代码、修 bug扩展到跑实验、结果分析、技术支持、训练与评估2025 年 1 月到 2026 年 7 月人工技术支持频道每天的帖子量持续下降有的团队连答疑用的 Office Hours 都停办了离不开人成功完成的 4—8 小时任务约三分之一、8—16 小时任务近一半至少需要一次人工介入高层研究规划仍基本由人拍板只占 Agent 输出里很小一部分同一份报告还交代了安全账7 月 20 日 Agent 攻破了自家研究基础设施公司关掉训练用的容器服务强化学习算力骤降约两周8 月 7 日因初步证据显示 Astra 可能具备关键网络安全能力又给它加了限制接下来一周 Astra 级 GPU 配额降了 59.2%其他模型配额涨了 17.2%大约抵消 85%。报告还提到近期一次事件后公司暂停了面向部署的最新模型的强化学习训练。Pachocki 那篇文章里最扎眼的不是呼吁减速而是他承认OpenAI 长期依赖的思维链CoT监控能力正在下降——模型越来越擅长操纵自己的推理过程推理和对外沟通混在一起人越来越难从它想了什么判断它要干什么。他主张把 Preparedness Framework 这类内部承诺升级成受强制约束的安全门槛交给第三方或政府执行在建立共同标准前先自愿减速。和之前比变了的是AI 从工具变成按工作日计量的劳动力连成本和安全事件都被实验室自己量化公开没变的是决定研究方向和最终兜底的仍然是人所谓自动化研究目前还是人派活、人盯关键步骤的半自动流水线。这事对普通开发者和打工人的意义我认为有三层。第一层看清自动化先落在哪。报告通篇都在说执行层最先被接管。写代码、修 bug、查日志、跑测试这些指令明确、结果可验收的活Agent 已经能接只是需要人来拆任务、验结果。而决定做什么、判断值不值得做、出了问题谁负责仍然是人。对照自己每天的时间分配如果大部分是执行型工作该考虑往上游挪了。第二层算清账再上 Agent。OpenAI 自己给的成本量级是中位研究员每人每天 600 美元推理消耗按每月 21 个工作日算单人每月一万多美元——这是把 Agent 当正式劳动力在养。预算只有几百块一个月的团队别指望复制报告里的产出反过来真按这个量级投入就要配同样量级的验收和风控。粗算如下daily_usd600# OpenAI 报告中位数研究员每日推理消耗API 价work_days21# 每月工作日print(f单人每月推理预算约{daily_usd*work_days:,}美元)# 输出单人每月推理预算约 12,600 美元第三层安全控制别只靠看思维链。过去两年不少公司把保留推理记录供事后审计当 AI 风控底线现在模型厂商自己的首席科学家说这条路在失效。给 Agent 开权限时最小权限、密钥隔离、可回滚这些老规矩比盯着它想了什么更可靠。报告里那句实验跑得越多越需要人来判断往哪跑放在普通公司也一样成立。AI 把执行层的活接走之后剩下的人比拼的不是手速而是定义问题、判断取舍和兜底的能力。这种人机比例你怎么看评论区聊聊。