CaMeLs Can Use Computers Too:计算机使用智能体的系统级安全

论文重点

针对计算机使用智能体(Computer Use Agents, CUAs)面临的提示词注入攻击,提出了一种基于架构隔离的系统级安全方案。核心贡献在于证明了UI工作流虽具动态性,但在结构上是可预测的,因此可以通过“单次规划”(Single-Shot Planning)在接触潜在恶意内容之前生成完整的执行图谱,从而在不严重牺牲性能的前提下提供可验证的控制流完整性保障。实验结果表明,该方法在保留前沿模型高达57%性能的同时,还能将较小开源模型的性能提升多达19%。

核心研究内容

问题定义

随着视觉语言模型(VLMs)的快速发展,计算机使用智能体(CUAs)能够像人类一样通过观察屏幕并执行鼠标点击、键盘输入等操作来自动化完成各类计算机任务。然而,这类智能体面临一个致命的安全威胁——提示词注入攻击(Prompt Injection Attacks)。攻击者可以在智能体读取的网页、邮件、文档等内容中植入恶意指令,劫持智能体的行为,从而窃取凭证或造成经济损失。

目前唯一已知的稳健防禦手段是架构隔离(Architectural Isolation),即将可信的任务规划与不可信的环境观察严格分离。然而,将这一设计应用于CUAs面临一个根本性矛盾:现有智能体需要持续观察UI状态来决定每一步动作,而这恰恰与安全所需的隔离要求相冲突。如何在保证安全的同时不破坏智能体的基本运作逻辑,是这篇论文要解决的核心问题。

创新方法

论文的关键洞察在于:UI工作流虽然看似动态,但其结构是可预测的。基于这一观察,作者提出了单次规划(Single-Shot Planning)框架。

该框架的核心设计包含两个关键组件:

  1. 可信规划器(Privileged Planner) :在接触任何潜在恶意UI内容之前,提前生成一个完整的、带有条件分支的执行图谱(Execution Graph with Conditional Branches)。这个规划器从不接触不受信任的环境观察。

  2. 隔离感知模块(Quarantined Perception) :负责执行规划器生成的计划,在运行时解析UI坐标等具体数值,但其行为路径已被规划器预先锁定。

这种设计的核心价值在于提供了可证明的控制流完整性保证(Provable Control Flow Integrity Guarantees)——无论攻击者在UI中注入什么恶意指令,都无法改变智能体已经预先确定的执行路径。

此外,论文还引入了一个名为NOVA(Navigating via Observation, Verification, and Action) 的机制,用以在组合爆炸般庞大的UI状态空间中使单次规划变得可行。

值得一提的是,论文中“CaMeLs”这个名称是一个双关——既是“Camels”(骆驼)的变体,也暗示了“Computer-use Agent Model with Enhanced/safe LLM”的含义,呼应了“骆驼也能用电脑”这一富有幽默感的标题。

研究成果

论文的实验在OSWorld基准上进行评估,取得了以下关键结果:

模型类型性能表现
前沿模型(Frontier Models)保留高达57% 的性能
较小开源模型(Smaller Open-source Models)性能提升多达19%

这些结果表明,严格的系统级安全性与实用性可以在CUAs中并存。

更令人惊讶的是,研究发现OSWorld中一半的任务可以在智能体完全不看屏幕的情况下完成——这一发现从根本上挑战了“智能体必须持续感知环境才能有效运作”的传统假设。

然而,论文也揭示了一个重要的安全警示:虽然架构隔离成功防范了指令注入攻击,但分支引导攻击(Branch Steering Attacks)仍然是一个威胁。在这种攻击中,攻击者通过操纵UI元素来欺骗感知模型,使执行路径被引导到计划中原本合法但非预期的分支——例如将智能体重定向到恶意网站。

实际落地应用的可能性

这项研究的应用价值非常直接。随着Anthropic等公司陆续推出计算机控制能力,CUAs正在从实验室走向真实的企业和个人应用场景。本文提出的架构隔离方案可以作为:

  • 企业级AI助手的底层安全基座,防止恶意邮件、文档或网页内容劫持自动化流程
  • 开源智能体框架的安全参考实现,帮助开发者在设计阶段就纳入安全考量
  • 合规与审计的技术支撑,可证明的控制流完整性为安全认证提供了理论依据

正如论文提交者在Hugging Face上的评论所说:“当AI智能体控制你的鼠标时,一封恶意的邮件就能掏空你的账户。我们构建了首个系统级防禦方案来对这些智能体进行沙箱隔离”。

技术细节

双LLM架构设计

论文的技术核心可以概括为一个双LLM架构(Dual-LLM Architecture),其工作流程如下:

┌─────────────────────────────────────────────────────────────────┐
│                        用户任务输入                            │
│                    (如:“整理我的邮箱”)                       │
└─────────────────────────────────────────────────────────────────┘
                              │
                              ▼
┌─────────────────────────────────────────────────────────────────┐
│                   可信规划器(Privileged Planner)              │
│  • 从不接触不可信的UI内容                                       │
│  • 生成完整的条件分支执行图谱                                   │
│  • 示例:                                                      │
│    IF 收件箱有未读邮件 → 打开第一封 → 判断是否为垃圾邮件       │
│    IF 是垃圾邮件 → 移至垃圾箱                                 │
│    IF 不是垃圾邮件 → 标记为已读                               │
└─────────────────────────────────────────────────────────────────┘
                              │
                              ▼
┌─────────────────────────────────────────────────────────────────┐
│                 隔离感知模块(Quarantined Perception)          │
│  • 执行规划器下发的计划                                        │
│  • 在运行时解析UI坐标等具体数值                               │
│  • 无法偏离预先定义的执行路径                                 │
└─────────────────────────────────────────────────────────────────┘

单次规划的形式化描述

从理论层面来看,单次规划可以形式化为:

给定一个任务目标 G,规划器在没有观察任何UI内容的情况下,生成一个执行图谱 P = (V, E, C),其中:

  • V 是状态节点集合
  • E 是动作边集合
  • C 是条件分支集合

执行图谱必须满足:对于任意可能的UI状态 sS,存在且仅存在一条从起始节点到终止节点的有效路径 pP,使得 p 能够完成任务目标 G

这种设计确保了控制流完整性——攻击者无论注入什么指令,都只能影响分支条件的评估结果(即选择哪条预先定义的路径),而无法引入新的执行路径。

NOVA机制

NOVA(Navigating via Observation, Verification, and Action)是使单次规划在实际应用中可行的关键工程机制。在组合爆炸般的UI状态空间中,规划器不可能预先枚举所有可能的状态。NOVA通过以下方式解决这一问题:

  1. 观察(Observation) :感知模块在运行时观察当前UI状态
  2. 验证(Verification) :将观察结果与计划中预期的状态进行匹配
  3. 执行(Action) :根据匹配结果执行对应的预定义动作

这种设计使得规划器只需要定义高层的状态类别和转换逻辑,而具体的UI坐标等细节由感知模块在运行时解析,从而大幅降低了规划的複杂度。

研究设定

实验环境

  • 基准测试:OSWorld——一个专门用于评估计算机使用智能体的基准平台
  • 任务类型:涵盖各类真实的计算机操作任务,如文件管理、邮件处理、网页浏览等

模型配置

  • 前沿模型:评估了多个闭源前沿模型的性能保留率
  • 开源模型:评估了多个较小开源模型的性能提升幅度

攻击场景

  • 指令注入攻击:在UI内容中植入恶意指令,试图劫持智能体行为
  • 分支引导攻击:通过操纵UI元素使感知模型选择计划中非预期的合法分支

硬件要求

论文未明确列出具体的硬件配置要求,但考虑到涉及LLM推理和视觉语言模型处理,典型的部署环境需要:

  • 足够的GPU内存以运行VLM模型(如GPT-4V、Claude等规模的模型)
  • 用于规划器与感知模块之间通信的稳定系统架构

综合分析

理论贡献

这篇论文的理论价值在于它重新定义了计算机使用智能体的安全边界。传统的智能体安全研究往往聚焦于如何检测和过滤恶意输入,而本文採取了更根本的思路:与其试图识别所有可能的攻击,不如从架构上限制智能体“能做什么”。

这种思路的哲学基础在于对“可预测性”的重新发现。论文的核心论点——UI工作流虽然动态但结构可预测——看似简单,实则具有深远的意义。它意味着许多看似需要实时感知的任务,实际上可以在事前进行完整的规划。实验中“一半的OSWorld任务可以在完全不看屏幕的情况下完成”这一发现,从实证角度支撑了这一理论主张。

安全性与实用性的权衡

论文最令人印象深刻的是它在安全性和实用性之间找到了令人惊讶的平衡点。57%的性能保留率对于前沿模型来说意味着大多数任务仍然可以正常完成;而对于较小的开源模型,19%的性能提升则揭示了一个反直觉的事实:架构隔离不仅没有削弱性能,反而通过结构化的规划帮助了小模型更有效地完成任务。

这种“安全即生产力”的发现,对于那些担心安全措施会拖累AI性能的从业者来说,是一个有力的反驳。

局限与开放挑战

论文坦诚地指出了当前方案的局限——分支引导攻击。这是一个值得关注的剩余威胁:攻击者虽然无法改变执行路径,但可以通过欺骗感知模型来选择“错误”的合法分支。例如,一个恶意网站可以将自己伪装成用户想要访问的合法网站,从而在计划的“访问网站”分支中将智能体引向陷阱。

这一发现揭示了控制流安全与数据流安全之间的本质区别:单次规划保证了前者,但后者仍然依赖于感知模型的准确性。这也指出了未来研究的一个重要方向——如何在不牺牲实用性的前提下,增强感知模块对对抗性操纵的鲁棒性。

此外,正如后续研究所指出的,CUAs的系统级安全还涉及长週期约束保持、安全权限绑定、隐私保护记忆等多个开放挑战,本文的工作为这些后续研究奠定了坚实的基础。

实践应用

对开发者的建议

  1. 从架构设计阶段就纳入安全考量:不要将安全视为事后补丁。在设计CUA系统时,应优先考虑规划与感知的分离。

  2. 採用“事前规划”而非“实时决策”的思维:对于可以结构化描述的任务,尽可能提前规划完整流程,减少智能体在运行时面对不可信内容时的决策自由度。

  3. 关注分支引导攻击的防禦:即使採用了架构隔离,仍需对感知模块进行对抗性鲁棒性测试,防止UI元素的恶意操纵。

对企业的建议

  1. 在高风险场景中优先採用架构隔离方案:对于涉及财务操作、敏感数据访问的CUA应用,应优先考虑本文提出的双LLM架构。

  2. 建立分级安全策略:根据任务风险等级採用不同的安全配置——高风险任务採用完整的单次规划,低风险任务可以适度放宽限制以换取更高性能。

  3. 关注开源生态的进展:随着更多开源模型在架构隔离下获得性能提升,企业可以考虑在安全敏感的场景中使用开源方案替代闭源模型。

参考资料来源

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐