突破边界:369个真实世界任务重新定义多模态智能体的真实计算环境基准
论文地址: https://proceedings.neurips.cc/paper_files/paper/2024/file/5d413e48f84dc61244b6be550f1cd8f5-Paper-Datasets_and_Benchmarks_Track.pdf
在当今人工智能飞速发展的时代,能够自主完成复杂计算机任务的智能体正成为提升人机交互效率的关键。然而,现有基准要么缺乏交互式环境,要么局限于特定应用领域,无法反映真实计算机使用的多样性和复杂性,严重限制了智能体的可扩展性。在此背景下,OSWORLD的出现无疑为多模态智能体的研究开辟了新的天地。
1. OSWORLD的诞生:填补真实计算环境基准的空白
OSWORLD是首个可扩展的真实计算机环境,专为多模态智能体设计,支持在Ubuntu、Windows和macOS等主流操作系统上对开放式计算机任务进行任务设置、交互式学习和基于执行的评估。这一创新环境的诞生源于现有基准的明显不足:许多先前的基准提供的是演示数据集,缺乏可执行环境,假定每个任务只有单一解决方案,限制了交互式学习和真实世界探索的研究潜力。即使是那些具备可执行环境的工作,也简化了智能体的观察和动作空间,将任务范围局限于特定应用或领域,如特定网站的导航、编码等,无法全面反映真实计算机使用中需要在开放式领域的应用和界面之间导航的场景。
OSWORLD的核心优势在于其真实性和可扩展性。它允许对真实计算机应用进行自由形式的原始键盘和鼠标控制,支持初始任务状态配置、基于执行的评估和跨系统的交互式学习。这一统一的环境使研究人员能够定义智能体任务,而无需构建特定于应用程序或领域的模拟环境,为开发能够执行广泛真实计算机任务的多模态智能体提供了理想的测试平台。

精心构建的基准:369个真实世界任务的挑战
基于OSWORLD环境,研究团队创建了一个包含369个真实世界任务的基准,这些任务涉及开放式领域中广泛使用的Web和桌面应用程序、操作系统文件I/O以及通过GUI和CLI的多应用工作流。每个任务示例都基于真实用例,通常需要与多个应用程序和界面交互。为确保可靠且可重复的评估,9位具有计算机科学背景的作者精心为每个示例注释了初始状态设置配置,以模拟进行中的人类工作,并设计了自定义的基于执行的评估脚本来验证任务完成情况。

这个基准的复杂性和多样性从其134个独特的评估函数中可见一斑,这一数量远超先前的工作,凸显了基准任务的复杂性、多样性和评估挑战。任务涵盖了从图像处理到软件功能集成和编程的广泛领域,包括日常办公、专业软件使用和跨应用工作流等多个方面。值得注意的是,基准中还包含30个不可行的任务示例,这些任务由于功能弃用或真实用户提出的虚构功能而固有不可行性,为评估智能体的鲁棒性和错误处理能力提供了独特的机会。
2. 智能体的表现:现状与挑战

为了评估当前最先进的LLM和VLM智能体的性能,研究团队对包括GPT-4V、Gemini、Claude-3 Opus和Qwen-Max等在内的模型进行了全面测试。实验结果显示,这些模型的成功率在0.99%到12.24%之间,对于涉及多个应用协作的工作流任务,基线智能体的最高性能仅为6.57%,远低于人类72.36%的完成率。这一巨大差距清晰地表明,当前的LLM和VLM距离成为可靠的计算机助手还有很长的路要走。
深入分析发现,智能体在不同类型的计算机任务上的表现差异显著。它们在面向CLI的界面(如操作系统类型任务)上的表现优于面向GUI的界面(如涉及电子表格界面点击和文档处理的办公任务)。此外,多应用工作流任务的性能明显低于单应用任务,这表明智能体在跨应用协作方面存在显著不足。
进一步研究不同输入设置的影响发现,辅助信息如可访问性树和Set-of-Mark(SoM)虽然有时有帮助,但也可能导致误导,且不同模型的效果差异很大。仅使用截图的VLM智能体表现最低,但这是唯一不需要额外信息的配置,符合人类的直观感知,具有更大的长期潜力。然而,当前模型在将截图与精确动作坐标关联、处理意外应用窗口的干扰以及掌握基本GUI交互和特定领域应用功能方面存在明显困难。
3. 环境设计与技术创新
OSWORLD的技术架构体现了多项创新设计。其任务定义采用目标增强的部分可观察马尔可夫决策过程(GA-POMDP)形式化,为智能体的交互提供了清晰的数学框架。环境基础设施利用虚拟机(VM)提供安全、隔离且可重置/可逆的环境,防止对真实主机造成不可逆损害。
观察空间包含人类用户感知的相同桌面截图,包括鼠标位置和形状、应用窗口、文件和文件夹,同时提供可访问性(a11y)树,为建模提供额外信息。动作空间则涵盖了所有鼠标和键盘动作,包括移动、点击、拖动、击键、热键等,甚至包括WAIT、FAIL和DONE等特殊动作,以增强对任务流程的控制。
评估机制是OSWORLD的另一大亮点。它包括任务初始化后的后处理,如激活特定窗口、保存文件以便信息检索,以及应用适当的评估函数和参数。评估函数从云、虚拟机和软件中获取各种类型、类别和粒度的文件和数据信息,确保对任务完成情况进行全面准确的评估。
未来展望:迈向通用多模态智能体
OSWORLD的出现不仅为当前智能体的评估提供了基准,更为未来研究指明了方向。当前智能体在GUI理解和操作知识方面的显著挑战凸显了几个关键研究领域:
首先,需要增强VLM的能力,以实现高效且鲁棒的GUI交互。这包括提高模型处理更长上下文的效率,增强GUI接地能力以适应应用窗口的变化,并提升对图像上下文的理解,以构建基于图像的历史编码和反思。
其次,需要改进智能体的探索、记忆和反思方法。设计更有效的智能体架构,增强自主探索和综合发现的能力,开发新的历史编码方法,整合高效的记忆和反思解决方案,对于提升智能体的性能至关重要。
此外,还需要解决智能体在现实环境中的安全挑战。随着智能体能力的提升,确保其行为安全、避免潜在的有害操作变得越来越重要。开发可靠的安全评估指标和控制机制是未来研究的重要方向。
最后,在数据集和环境方面,需要扩展和完善用于智能体开发的数据和环境。覆盖更多专业领域,确保环境在各种硬件和软件设置上的无缝部署,开发更智能的方法来过滤冗余的a11y树元素和处理潜在的缺失元素,都是推动领域发展的关键步骤。
4. 结语:开启多模态智能体研究的新篇章
OSWORLD的提出标志着多模态智能体研究的一个重要里程碑。它不仅提供了一个评估智能体在真实计算环境中表现的基准,更通过揭示当前模型的不足,为未来研究提供了清晰的路线图。随着OSWORLD的不断发展和完善,我们有理由相信,它将在推动通用多模态智能体的发展中发挥关键作用,最终实现智能体在真实计算机环境中与人类高效协作的愿景。
对于研究人员而言,OSWORLD提供了一个绝佳的平台来测试和改进智能体算法;对于行业而言,它为开发更智能、更实用的计算机助手指明了方向。随着更多研究者加入这一领域,我们期待看到多模态智能体在真实计算环境中的能力不断提升,为人机交互带来革命性的变革。
更多推荐
所有评论(0)