![[论文学习]CaMeLs Can Use Computers Too:计算机使用智能体的系统级安全](http://pic.xiahunao.cn/yaotu/[论文学习]CaMeLs Can Use Computers Too:计算机使用智能体的系统级安全)
CaMeLs Can Use Computers Too计算机使用智能体的系统级安全论文重点针对计算机使用智能体Computer Use Agents, CUAs面临的提示词注入攻击提出了一种基于架构隔离的系统级安全方案。核心贡献在于证明了UI工作流虽具动态性但在结构上是可预测的因此可以通过“单次规划”Single-Shot Planning在接触潜在恶意内容之前生成完整的执行图谱从而在不严重牺牲性能的前提下提供可验证的控制流完整性保障。实验结果表明该方法在保留前沿模型高达57%性能的同时还能将较小开源模型的性能提升多达19%。核心研究内容问题定义随着视觉语言模型VLMs的快速发展计算机使用智能体CUAs能够像人类一样通过观察屏幕并执行鼠标点击、键盘输入等操作来自动化完成各类计算机任务。然而这类智能体面临一个致命的安全威胁——提示词注入攻击Prompt Injection Attacks。攻击者可以在智能体读取的网页、邮件、文档等内容中植入恶意指令劫持智能体的行为从而窃取凭证或造成经济损失。目前唯一已知的稳健防禦手段是架构隔离Architectural Isolation即将可信的任务规划与不可信的环境观察严格分离。然而将这一设计应用于CUAs面临一个根本性矛盾现有智能体需要持续观察UI状态来决定每一步动作而这恰恰与安全所需的隔离要求相冲突。如何在保证安全的同时不破坏智能体的基本运作逻辑是这篇论文要解决的核心问题。创新方法论文的关键洞察在于UI工作流虽然看似动态但其结构是可预测的。基于这一观察作者提出了单次规划Single-Shot Planning框架。该框架的核心设计包含两个关键组件可信规划器Privileged Planner在接触任何潜在恶意UI内容之前提前生成一个完整的、带有条件分支的执行图谱Execution Graph with Conditional Branches。这个规划器从不接触不受信任的环境观察。隔离感知模块Quarantined Perception负责执行规划器生成的计划在运行时解析UI坐标等具体数值但其行为路径已被规划器预先锁定。这种设计的核心价值在于提供了可证明的控制流完整性保证Provable Control Flow Integrity Guarantees——无论攻击者在UI中注入什么恶意指令都无法改变智能体已经预先确定的执行路径。此外论文还引入了一个名为NOVANavigating via Observation, Verification, and Action的机制用以在组合爆炸般庞大的UI状态空间中使单次规划变得可行。值得一提的是论文中“CaMeLs”这个名称是一个双关——既是“Camels”骆驼的变体也暗示了“Computer-use Agent Model with Enhanced/safe LLM”的含义呼应了“骆驼也能用电脑”这一富有幽默感的标题。研究成果论文的实验在OSWorld基准上进行评估取得了以下关键结果模型类型性能表现前沿模型Frontier Models保留高达57%的性能较小开源模型Smaller Open-source Models性能提升多达19%这些结果表明严格的系统级安全性与实用性可以在CUAs中并存。更令人惊讶的是研究发现OSWorld中一半的任务可以在智能体完全不看屏幕的情况下完成——这一发现从根本上挑战了“智能体必须持续感知环境才能有效运作”的传统假设。然而论文也揭示了一个重要的安全警示虽然架构隔离成功防范了指令注入攻击但分支引导攻击Branch Steering Attacks仍然是一个威胁。在这种攻击中攻击者通过操纵UI元素来欺骗感知模型使执行路径被引导到计划中原本合法但非预期的分支——例如将智能体重定向到恶意网站。实际落地应用的可能性这项研究的应用价值非常直接。随着Anthropic等公司陆续推出计算机控制能力CUAs正在从实验室走向真实的企业和个人应用场景。本文提出的架构隔离方案可以作为企业级AI助手的底层安全基座防止恶意邮件、文档或网页内容劫持自动化流程开源智能体框架的安全参考实现帮助开发者在设计阶段就纳入安全考量合规与审计的技术支撑可证明的控制流完整性为安全认证提供了理论依据正如论文提交者在Hugging Face上的评论所说“当AI智能体控制你的鼠标时一封恶意的邮件就能掏空你的账户。我们构建了首个系统级防禦方案来对这些智能体进行沙箱隔离”。技术细节双LLM架构设计论文的技术核心可以概括为一个双LLM架构Dual-LLM Architecture其工作流程如下┌─────────────────────────────────────────────────────────────────┐ │ 用户任务输入 │ │ 如“整理我的邮箱” │ └─────────────────────────────────────────────────────────────────┘ │ ▼ ┌─────────────────────────────────────────────────────────────────┐ │ 可信规划器Privileged Planner │ │ • 从不接触不可信的UI内容 │ │ • 生成完整的条件分支执行图谱 │ │ • 示例 │ │ IF 收件箱有未读邮件 → 打开第一封 → 判断是否为垃圾邮件 │ │ IF 是垃圾邮件 → 移至垃圾箱 │ │ IF 不是垃圾邮件 → 标记为已读 │ └─────────────────────────────────────────────────────────────────┘ │ ▼ ┌─────────────────────────────────────────────────────────────────┐ │ 隔离感知模块Quarantined Perception │ │ • 执行规划器下发的计划 │ │ • 在运行时解析UI坐标等具体数值 │ │ • 无法偏离预先定义的执行路径 │ └─────────────────────────────────────────────────────────────────┘单次规划的形式化描述从理论层面来看单次规划可以形式化为给定一个任务目标G规划器在没有观察任何UI内容的情况下生成一个执行图谱P (V, E, C)其中V是状态节点集合E是动作边集合C是条件分支集合执行图谱必须满足对于任意可能的UI状态s∈S存在且仅存在一条从起始节点到终止节点的有效路径p∈P使得p能够完成任务目标G。这种设计确保了控制流完整性——攻击者无论注入什么指令都只能影响分支条件的评估结果即选择哪条预先定义的路径而无法引入新的执行路径。NOVA机制NOVANavigating via Observation, Verification, and Action是使单次规划在实际应用中可行的关键工程机制。在组合爆炸般的UI状态空间中规划器不可能预先枚举所有可能的状态。NOVA通过以下方式解决这一问题观察Observation感知模块在运行时观察当前UI状态验证Verification将观察结果与计划中预期的状态进行匹配执行Action根据匹配结果执行对应的预定义动作这种设计使得规划器只需要定义高层的状态类别和转换逻辑而具体的UI坐标等细节由感知模块在运行时解析从而大幅降低了规划的複杂度。研究设定实验环境基准测试OSWorld——一个专门用于评估计算机使用智能体的基准平台任务类型涵盖各类真实的计算机操作任务如文件管理、邮件处理、网页浏览等模型配置前沿模型评估了多个闭源前沿模型的性能保留率开源模型评估了多个较小开源模型的性能提升幅度攻击场景指令注入攻击在UI内容中植入恶意指令试图劫持智能体行为分支引导攻击通过操纵UI元素使感知模型选择计划中非预期的合法分支硬件要求论文未明确列出具体的硬件配置要求但考虑到涉及LLM推理和视觉语言模型处理典型的部署环境需要足够的GPU内存以运行VLM模型如GPT-4V、Claude等规模的模型用于规划器与感知模块之间通信的稳定系统架构综合分析理论贡献这篇论文的理论价值在于它重新定义了计算机使用智能体的安全边界。传统的智能体安全研究往往聚焦于如何检测和过滤恶意输入而本文採取了更根本的思路与其试图识别所有可能的攻击不如从架构上限制智能体“能做什么”。这种思路的哲学基础在于对“可预测性”的重新发现。论文的核心论点——UI工作流虽然动态但结构可预测——看似简单实则具有深远的意义。它意味着许多看似需要实时感知的任务实际上可以在事前进行完整的规划。实验中“一半的OSWorld任务可以在完全不看屏幕的情况下完成”这一发现从实证角度支撑了这一理论主张。安全性与实用性的权衡论文最令人印象深刻的是它在安全性和实用性之间找到了令人惊讶的平衡点。57%的性能保留率对于前沿模型来说意味着大多数任务仍然可以正常完成而对于较小的开源模型19%的性能提升则揭示了一个反直觉的事实架构隔离不仅没有削弱性能反而通过结构化的规划帮助了小模型更有效地完成任务。这种“安全即生产力”的发现对于那些担心安全措施会拖累AI性能的从业者来说是一个有力的反驳。局限与开放挑战论文坦诚地指出了当前方案的局限——分支引导攻击。这是一个值得关注的剩余威胁攻击者虽然无法改变执行路径但可以通过欺骗感知模型来选择“错误”的合法分支。例如一个恶意网站可以将自己伪装成用户想要访问的合法网站从而在计划的“访问网站”分支中将智能体引向陷阱。这一发现揭示了控制流安全与数据流安全之间的本质区别单次规划保证了前者但后者仍然依赖于感知模型的准确性。这也指出了未来研究的一个重要方向——如何在不牺牲实用性的前提下增强感知模块对对抗性操纵的鲁棒性。此外正如后续研究所指出的CUAs的系统级安全还涉及长週期约束保持、安全权限绑定、隐私保护记忆等多个开放挑战本文的工作为这些后续研究奠定了坚实的基础。实践应用对开发者的建议从架构设计阶段就纳入安全考量不要将安全视为事后补丁。在设计CUA系统时应优先考虑规划与感知的分离。採用“事前规划”而非“实时决策”的思维对于可以结构化描述的任务尽可能提前规划完整流程减少智能体在运行时面对不可信内容时的决策自由度。关注分支引导攻击的防禦即使採用了架构隔离仍需对感知模块进行对抗性鲁棒性测试防止UI元素的恶意操纵。对企业的建议在高风险场景中优先採用架构隔离方案对于涉及财务操作、敏感数据访问的CUA应用应优先考虑本文提出的双LLM架构。建立分级安全策略根据任务风险等级採用不同的安全配置——高风险任务採用完整的单次规划低风险任务可以适度放宽限制以换取更高性能。关注开源生态的进展随着更多开源模型在架构隔离下获得性能提升企业可以考虑在安全敏感的场景中使用开源方案替代闭源模型。参考资料来源原始论文: CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents (arXiv:2601.09923)arXiv版本: v1 (2026-01-14) / v3 (2026-06-04)作者: Hanna Foerster, Tom Blanchard, Kristina Nikolić, Ilia Shumailov, Cheng Zhang, Robert Mullins, Nicolas Papernot, Florian Tramèr, Yiren Zhao