常驻智能体产品化元年开启,安全治理成为产业新门槛|2026年10月1日

发布时间:2026/10/2 18:11:44
常驻智能体产品化元年开启,安全治理成为产业新门槛|2026年10月1日 OpenAI 在 DevDay 上把常驻智能体 Dots 推向付费用户底层由 GPT-6 Astra 驱动、跑在独立云端计算机上[① MarkTechPost]Anthropic 则用 Claude Sonnet 5.5 把 Terminal-Bench 4.0 推上 70.6%[① MarkTechPost]。模型、智能体与安全三条技术线同日交汇本文按技术主题拆解。主题节 1常驻智能体 Dots云端计算机架构与安全机制Dots 的架构设计值得开发者关注每个 Dots 由 GPT-6 Astra 驱动运行在带浏览器的独立云端计算机上与用户笔记本隔离通过 ChatGPT 插件可触达 4000 多个应用用户下线后仍持续运行并从反馈中学习偏好[① MarkTechPost]。每个用户初始获得 1 个主 Dots产品向 ChatGPT Pro 与 Business Premium 订阅者推出Enterprise、Edu 与 Healthcare 在管理员开启后进入 Beta没有自托管或开放权重选项[① MarkTechPost]。从工程视角看Dots 的安全机制分层清晰无任务时以只读连接主动寻找可帮忙之处proactive research不能发消息或修改内容涉及账户或信息共享的操作必须先通过 auto-review 检查监控系统可在安全担忧时暂停或停止智能体上下文随智能体跨渠道跟随Slack、Teams[② SiliconANGLE AI]。OpenAI 还预告了专业智能体由雇主配置独立身份与凭据、负责单一明确工作并已与微软合作使其可通过 Agent 365 的治理与安全控制来管理[② SiliconANGLE AI]。对开发者而言这套常驻智能体 云端计算 审批流的组合正在成为平台形态的模板。Meta 同期宣布围绕 Muse 构建企业 AI 平台产品包括 Muse、Meta Business Agent、Muse API 与 Muse Code[③ TLDR AI]TechCrunch 则分析OpenAI 正把 ChatGPT 建成软件可被发现、可被人与 AI 智能体共同使用的地方直接挑战传统应用商店模式[④ TechCrunch]。底层模型的性能数据值得记录在 OpenAI 的延迟模拟中GPT-6 Astra 在 OSWorld 2.0 上得分 72.6%、每任务约 40 分钟GPT-5.6 Sol 得分 65.7%、约 75 分钟——常驻智能体的体验高度依赖底层模型的计算机使用能力[① MarkTechPost]。# 以下为根据公开摘要信息对 Dots auto-review 检查流程的理解示意 # 具体实现请查阅 OpenAI 官方技术文档 def auto_review(dot, action): # 涉及账户或共享信息的操作必须先通过检查 if action.touches(account) or action.touches(shared_info): decision policy_engine.evaluate(action) if decision approve: return execute(action) if decision pause: monitoring.pause(dot) # 监控系统可暂停或停止智能体 return None return deny(action) # 无任务时只读 proactive research不触发写操作 if dot.idle(): return read_only_probe(dot.connected_apps)⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。主题节 2大模型速递GPT-6.1 Sol、Claude Sonnet 5.5、Qwen-Audio-3.1、Liquid d1GPT-6.1 Sol 是今日性能/价格比最突出的发布标准 API 输入与输出 token 价格仅为 Astra 的五分之一每百万 token 仅 10 美分据 OpenAI 称它在 DeepSWE 1.1 上以约五分之一的任务成本达到 GPT-6 Astra 的水平同时比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点并在计算机使用任务上比 GPT-6 Sol 高 7% 以上[⑤ OpenAI Blog]。该模型已在 Amazon Bedrock 正式可用客户可把 Codex 配置为在 Bedrock 上使用它完成调研、实现与测试等工作[⑥ AWS ML Blog]。Anthropic 发布 Claude Sonnet 5.5定位为 Opus 5.5 的更快、更低成本补充输出生成快 30% 以上、单任务成本最多低 30%在 Terminal-Bench 4.0 上达 70.6%Sonnet 5 为 10.3%定价保持每百万 token 输入 2 美元、输出 10 美元不变1M token 上下文、128K 最大输出OSWorld 2.1 计算机使用 80.1%、人类最后考试带工具64.5%以上基准均为发布稿中厂商自报数据[① MarkTechPost]。语音侧阿里 Qwen 团队发布 Qwen-Audio-3.1 音频栈主模型 Qwen-Audio-3.1-Realtime 是面向可调用工具的语音智能体的全双工语音模型上下文 262K token并通过 WebSocket 在 QwenCloud 提供托管 API降价幅度显著Realtime 约降 85%、TTS 约降 70%、ASR 最多降 95%[① MarkTechPost]。细分场景侧Liquid AI 发布 d1 决策模型面向分类、工单路由、评分、内容审核等结构化选择单次调用返回一组固定结果上的校准概率生成 token 数为零提供 Noul是否题、Choice命名集合选择、Score有序量规评分三个原语可混在同一个请求中[① MarkTechPost]。Liquid AI 的迁移指南给出简单规则如果答案是 N 个已知选项之一就用决策模型如果模型必须组合出新的字符串就继续用 LLM[① MarkTechPost]。主题节 3自我改进研究密集落地RRSI、SAGE、DASA自我改进self-improvement是今日学术侧的密集主题。Google Research 与北卡罗来纳大学教堂山分校、斯坦福大学等开源 RRSI正则化递归自我改进允许 LLM 智能体重写自己的框架提示词、工具、记忆、控制流与子智能体而模型权重不变为对抗框架演化循环过拟合演进集的问题RRSI 研究指出三种失败模式——基准特定拟合、噪声追逐与复杂度累积并在提案侧引入退火编辑预算余弦调度早期轮次可捆绑多个编辑后期只允许单个可归因变更、证据感知信用记录每个候选连同组件、假设、diff、分数变化与成本变化一起记录、结构化探索进展停滞时预算转向未触碰组件在选择侧引入泄漏评论者打分前拒绝任务名、实体、答案或基准特定逻辑、噪声调整下限增益须超过未改动基座框架上测得的方差、成本规则额外推理 token 必须由测得的增益买单与剪枝——研究团队将编辑预算类比 L0、剪枝类比 LassoL1[① MarkTechPost]。代码为 Apache 2.0 许可接受任意 LiteLLM 模型字符串默认配置为 Vertex AI 上的 Claude Opus 4.8[① MarkTechPost]。arXiv 上的 SAGE 论文则聚焦自我演化智能体的门控现有规则只在聚合验证分数提升时保留编辑会引入永久性倒退并受优化器诅咒影响。SAGE 通过逐条配对比较在同一批验证条目上对比当前技能与编辑后技能加单侧配对检验仅在收益相对损失统计可靠时提交编辑否则弃权。跨 5 个基准、20 组设置中SAGE 在 19 组降低倒退率如 DeepSeek-V4 下 LiveMath 倒退率从 36.5% 降至 0%并在全部 20 组取得最高最终分数LiveMath 从 34.15 提升至 48.78[⑦ arXiv cs.AI]。# 以下为根据公开摘要信息对 SAGE 统计接受门逻辑的理解示意 # 具体实现请查阅论文原文arXiv 2609.36043 def accept_edit(current_skill, proposed_edit, eval_items): scores_cur evaluate(current_skill, eval_items) # 同一批条目上的基线分数 scores_new evaluate(proposed_edit, eval_items) # 编辑后的逐条分数 diffs paired_diff(scores_new, scores_cur) # 逐条配对比较 if one_sided_paired_test(diffs).significant(): # 单侧配对检验 return commit(proposed_edit) # 收益统计可靠才提交 return abstain() # 否则弃权⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。另一项 DASA 研究追问人类可读文本对微调是否必要利用冻结参考模型的激活梯度反馈引导连续合成输入嵌入的优化所得嵌入直接用于下游微调实验覆盖 Llama 与 Qwen 系列 6 个模型1B 至 32B 参数以及涵盖知识、数学推理、代码生成与常识推理的 6 个基准在相同 LoRA 设置下达到与源自然语言数据相当的性能并在多种配置下超越相对 GRADMM 实现 3.6 至 4.9 倍加速[⑦ arXiv cs.AI]。主题节 4计算机使用与空间智能Holo4 开放权重、AMD 收购 World LabsH Company 发布 Holo4 开放权重计算机使用模型家族同一套权重可在屏幕上点击与输入、编写代码并调用 MCP 或 API 工具覆盖桌面、网页、Android、代码沙箱与业务 API提供 Holo4 27B稠密由 Qwen3.8-27B 微调与 Holo4 35B-A3BMoE3B 激活基于 Qwen3.6-35B-A3B两个尺寸。据 H Company 基准表27B 在 OSWorld 上得分 85.2%、单任务成本 0.08 美元AndroidWorld 上达 85.1%长流程仍有差距OSWorld 2.0 上 27B 得分 61.7%、单任务 1.22 美元而 Claude Opus 5.5 为 81.8%、8.48 美元AutomationBench 上 27B 得分 45.4%、单任务 0.05 美元厂商自报数据。35B-A3B 以 Apache 2.0 开放商业自托管27B 权重为 CC BY-NC 4.0两者都在 H Models API 上提供 256K 上下文[① MarkTechPost]。空间智能侧AMD 宣布以约 82 亿美元全股票交易收购 World Labs预计年底前完成、尚待监管批准创始人李飞飞将出任 AMD 首席科学家空间智能研究团队整体并入[⑧ Ars Technica]。World Labs 由李飞飞与 Justin Johnson、Christoph Lassner、Ben Mildenhall 于 2024 年创立成立时融资 2.3 亿美元其中部分来自 AMD其世界模型旨在对物理世界提供有用的预测性模拟[⑧ Ars Technica]。对 AMD 而言这既是补齐与 Nvidia 竞争中的软件与模型层短板也意味着头部芯片厂商开始把理解物理世界的能力视为下一代 AI 基础设施的关键拼图[⑧ Ars Technica]。按 AMD 的表述World Labs 的模型专长将帮助塑造 AMD 未来的 AI 硬件、软件与系统[③ TLDR AI]。主题节 5企业智能体安全与治理硬件看门狗、Fusion Claw、身份边界智能体安全正在从软件防线下沉到硬件层。Nvidia 发布 Open Agent Safety Platform把 OpenShell 安全运行时与 Sentry 硬件看门狗结合用于监控智能体行为并执行策略同时覆盖软件与硬件控制并设计为支持第三方算力平台[③ TLDR AI]。企业应用侧Oracle 推出 Fusion Claw 智能体软件运行时把用于推理与规划的大语言模型与用于计算和事务处理的常规软件结合仅在需要推理时调用模型事务与计算在模型之外完成Claw 运行在隔离环境中防止语言模型直接更新 Fusion 业务对象任务完成后生成Outcome Receipt含所应用的政策、决策与执行的事务[② SiliconANGLE AI]。治理缺口的数据同样触目RSA 披露一家中等规模银行审计发现其企业内运行着超过 4000 个影子智能体Gartner 预计到 2028 年一家典型财富 500 强企业将运行约 15 万个 AI 智能体2025 年不足 15 个只有 13% 的组织认为自己的智能体治理到位[① MarkTechPost]。数据连接公司 CData 也发布 Connect AI Gateway让 IT 团队在单一位置注册模型、MCP 服务器与智能体并为权限设定规则并加入上下文引擎复用 Fivetran 的 dbt 与微软 Power BI 等工具中维护的业务定义[② SiliconANGLE AI]。身份厂商的应对是急停开关与任务级权限Okta 为 AI 智能体推出运行时强制与更广的急停开关用于撤销被攻破智能体持有的全部活跃 token[② SiliconANGLE AI]。支付行业给出了边界范本金融科技公司 Equals Money 让客户的 AI 工具可读数据但不可动资金——客户控制的智能体对数据访问为只读、非敏感内容可写入客户不能通过 MCP 发起支付AI 现在大约撰写其 92% 的代码[② SiliconANGLE AI]。员工侧的采用速度也在倒逼治理据 Omnissa《2026 数字工作空间现状》报告2025 年企业终端上 AI 助手应用使用量增长近 1000%其中约四分之三来自未经批准的工具[② SiliconANGLE AI]。趋势判断基于今日快讯可归纳出三条跨领域趋势。其一智能体从对话走向常驻产品化与安全治理同步提速Dots 把常驻智能体打包成订阅产品Meta 用企业平台跟进而 auto-review、专业智能体身份与 Agent 365 治理表明安全控制正在成为产品标配支撑来源①、②、③、④[① MarkTechPost][② SiliconANGLE AI][③ TLDR AI][④ TechCrunch]。其二高性能模型进入降价周期性能/价格比成为竞争焦点GPT-6.1 Sol 以五分之一价格逼近 Astra、Claude Sonnet 5.5 保持 2/2/2/10 的同时单任务成本降 30%、Qwen 语音全线降价 70%-95%企业选型逻辑从追最强转向按任务定档支撑来源①、⑤、⑥[① MarkTechPost][⑤ OpenAI Blog][⑥ AWS ML Blog]。其三智能体安全从软件防线下沉到芯片层与身份边界Nvidia 用 Sentry 硬件看门狗、Oracle 用隔离运行时、Okta 用急停开关安全控制不再放在被控对象内部支撑来源①、②、③[① MarkTechPost][② SiliconANGLE AI][③ TLDR AI]。结尾今天的技术侧信号是产品化与安全化并行常驻智能体、低成本旗舰模型、自我改进研究与硬件级安全控制同场推进。后续值得关注两点一是 Dots 的 auto-review 与专业智能体身份方案能否成为行业事实标准二是 GPT-6.1 Sol 与 Claude Sonnet 5.5 的价格战会否把性能/价格比变成模型选型的默认指标。【资讯来源】本文综合整理自 MarkTechPost、SiliconANGLE AI、TLDR AI、TechCrunch、OpenAI Blog、AWS ML Blog、arXiv cs.AI、Ars Technica 等公开信息源。 ① MarkTechPost, 2026年09月30日 02:30 北京时间 / 09月29日 11:30 美西时间 ② SiliconANGLE AI, 2026年09月30日 06:31 北京时间 / 09月29日 15:31 美西时间 ③ TLDR AI, 2026年09月29日 21:29 北京时间 / 2026年09月29日 06:29 美西时间 ④ TechCrunch, 2026年09月30日 04:15 北京时间 / 09月29日 13:15 美西时间 ⑤ OpenAI Blog, 2026年09月29日 18:00 北京时间 / 2026年09月29日 03:00 美西时间 ⑥ AWS ML Blog, 2026年09月30日 03:34 北京时间 / 09月29日 12:34 美西时间 ⑦ arXiv cs.AI, 2026年09月30日 12:00 北京时间 / 09月29日 21:00 美西时间 ⑧ Ars Technica, 2026年09月30日 05:14 北京时间 / 09月29日 14:14 美西时间【免责声明】 本日报为AI行业每日公开信息汇总整理仅供读者快速了解行业动态不构成任何投资建议。所有信息均来源于公开渠道本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速内容发布后可能发生更新请以官方最新信息为准。据此作出的任何决策全部风险自担。© 2026 林伽一 · AI科技日报#常驻智能体 #GPT-6.1Sol #自我改进 #智能体安全 #空间智能

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询