在这里插入图片描述

  • 作者:Kaijun Wang1^{1}1, Liqin Lu2^{2}2, Mingyu Liu1^{1}1, Jianuo Jiang3^{3}3, Zeju Li1^{1}1, Bolin Zhang1^{1}1, Wancai Zheng2^{2}2, Xinyi Yu2^{2}2, Hao Chen1^{1}1, Chunhua Shen1^{1}1
  • 单位:1^{1}1浙江大学,2^{2}2浙江工业大学,3^{3}3香港中文大学(深圳)
  • 论文标题:ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tasks
  • 论文链接:https://arxiv.org/pdf/2508.08240
  • 项目主页:https://kaijwang.github.io/odyssey.github.io/

主要贡献

  • 提出了分层的视觉 - 语言规划器:该规划器能够将基于自我中心感知的长期指令分解为可执行的动作,有效弥合了自我中心感知与基于语言的任务之间的差距。
  • 设计了首个适用于复杂地形的四足机器人全身控制策略:该策略能够协调运动和操作,实现了从模拟到现实的有效迁移,展现出强大的泛化能力。
  • 构建了首个长期移动操作的基准测试:涵盖了广泛的现实世界室内和室外场景,为评估机器人的语义推理、任务规划、导航和操作能力提供了全面的测试平台。
  • 成功实现了从模拟到现实的迁移:在现实世界部署中,系统表现出强大的泛化能力和鲁棒性,验证了四足移动操作器在非结构化环境中部署的可行性和实用性,为开发能够执行复杂动态任务的通用机器人助手铺平了道路。

研究背景

  • 移动操作的重要性:在动态、非结构化环境中,机器人需要自主导航和交互,将移动性、操作和实时感知紧密结合,才能实现诸如在复杂环境中微妙调整位置以更好地抓取物体等复杂任务。
  • 现有研究的局限性
    • 尽管大型语言模型在增强空间推理和任务规划方面显示出潜力,但现有实现大多局限于桌面场景,未能解决移动平台特有的感知受限和执行器范围有限的问题。
    • 当前的操作策略在面对开放世界环境中的多样化物体配置时,泛化能力不足。
    • 在非结构化环境中,同时保持高平台机动性和精确末端执行器控制的双重需求在文献中研究不足。
  • 研究动机:为解决上述局限性,提出了一个统一的移动操作框架,以实现四足机器人在开放世界中的长期任务执行。

ODYSSEY框架

长期任务规划器

全局任务级规划
  • 通过融合机载RGB和LiDAR流构建全局规划器,形成场景的空 - 语义表示,并利用预训练的基础模型将实例图映射到场景中。
  • GPT-4.1被用于将自然语言指令分解为一系列原子动作(如导航、抓取、放置等),并为涉及空间位移的动作输出粗略的目标航路点。
  • 这些航路点被投影到2D占用图上,并通过局部搜索确定无碰撞的目标姿态,从而生成与场景上下文一致且符合物理约束的全局任务计划。
局部操作
  • 对于需要近距离操作的原子动作,使用腕部安装的深度观测数据指导视觉 - 语言模型生成精确的末端执行器姿态。
  • Qwen2.5-VL-72B-Instruct模型根据RGB观测数据和当前原子动作的文本描述,推断图像空间中的任务相关接触点,并将其投影到深度图像上以恢复机器人坐标系中的3D位置。
  • 同时,根据目标物体或接触区域的主轴和表面法线施加几何约束,以确定末端执行器的朝向,实现可靠的地方向导。

全身控制策略

将全身控制策略π定义为一个单一网络,将全面的观测向量映射到目标动作。观测内容包括运动指令、末端执行器目标、局部地面高度图、重力向量、前一时间步的动作以及本体感知状态等。策略输出的动作被设计为默认关节配置的偏移量,最终目标关节位置通过PD控制器转换为扭矩。

  • 两阶段训练方法
    • 第一阶段:固定机械臂关节,专注于在静态负载下训练运动,引入步态奖励和频率奖励以改善探索效率并调节步态的节奏。
    • 第二阶段:控制所有18个关节,扩展奖励函数以包括末端执行器跟踪项,采用地形不变的末端执行器采样策略,以提高在不同地形上的交互精度,并在整个训练过程中运用领域随机化,以增强对不同负载的适应性。

模拟基准测试

  • 资产和场景库
    • 收集了包括物体实例和全尺寸3D场景在内的多样化资产,涵盖50个刚体物体、15个容器、30个关节结构和10个可拖动物体等。
    • 基准测试包括10个真实场景,如室内家居、超市、餐厅和室外庭院等。
  • 丰富的领域风格变化
    • 在模拟过程中,从物体布局、物理属性、环境条件和地形复杂性四个维度引入变化,以确保泛化能力。
  • 多阶段任务套件
    • 包括从ARNOLD基准测试中整合的短期操作技能和为反映实际日常场景而设计的长期移动操作任务。
    • 长期任务由2 - 3个子目标组成,共246个室内和58个室外变化,涉及多种技能,如抓取、重新定向、容器放置、关节操作和复杂地形上的长期导航等。
  • 模块化评估协议
    • 既评估整体任务成功率,也评估每个动作的成功率,通过监测机器人和目标物体的世界姿态以及它们之间的相对姿态来确定子任务的完成情况。

实验

高层规划器性能

短期任务评估

在相对受限的空间中,展示框架在精细操作精度和泛化能力方面的表现。

  • 实验方法
    • 将ARNOLD基准测试中的四个短期任务(PICKUPOBJECT、REORIENTOBJECT、OPENCABINET、CLOSECABINET)迁移到自定义模拟环境中,并复制其连续监控系统以评估目标状态。
    • 评估协议将五个数据集划分为两类:“已见”(包括已见数据的随机排列)和“未见”(包含未见组件,如物体、场景或目标状态)。
    • 与ARNOLD基准测试中最强的基线模型PerAct进行比较,该模型是一种基于大规模人类轨迹训练的端到端模仿学习范式,利用五个外部摄像头的观测数据实现精确的空间感知。

  • 实验结果
    • 如表所示,该方法在所有数据集上均实现了显著的整体改进,展现出在仅依赖单个自我中心摄像头的情况下,优于PerAct的精细操作能力。
    • 在未见数据集上,该方法的性能保持稳定,而PerAct的性能则急剧下降,这表明该方法具有处理未见物体配置的泛化能力。
长期任务评估

评估系统在长期移动操作任务中的表现,包括整体任务成功率和分解后的原子动作成功率。

  • 实验方法:在八个长期移动操作任务上进行评估,这些任务涵盖了多样化的室内和室外场景,每个任务包含2 - 3个子目标,总共有246个室内和58个室外变化,涉及多种技能,如抓取、重新定向、容器放置、关节操作和复杂地形上的长期导航等。

  • 实验结果
    • 如表所示,ODYSSEY在所有任务中均实现了40%或更高的整体成功率,并且在每个原子技能类别中保持了60%以上的成功率,展现出在多样化环境中可靠的协调能力。
    • 低层能力:在存在不规则地形的室内和室外环境中,该方法均展现出可靠的运动能力和有效的姿态跟踪能力,大多数控制相关失败是由于与超出机器人可及范围的物体交互造成的。
    • 精细操作:VLM引导的定位使抓取和放置在所有任务中均取得了高成功率,展现出强大的语义目标识别和定位能力。然而,由于模型在物体几何形状的空间推理方面存在局限性,导致部分失败,例如夹爪对齐不佳,以及涉及更复杂交互(如拖动和拉动)的任务偶尔会因定位不准确而失败,尤其是对于细长手柄或部分遮挡的物品。
    • 任务级规划:全局任务规划器展现出强大的实例图符号推理能力,能够可靠地分解多阶段任务。同时,基于SLAM的路径规划器确保了安全一致的导航,这两者共同导致了所有任务中较高的导航成功率。

低层策略性能

在模拟环境中评估提出的全身控制策略的性能,并与基线方法进行比较。

  • 实验方法
    • 与RoboDuet基线方法进行比较,该方法也采用两阶段训练过程,但采用双策略(运动和操作)方法,并且采用以基座为中心的采样方式。
    • 在模拟环境中进行评估,使用4096个并行代理,并从每个代理中收集五个数据样本。
    • 定义了以下量化评估指标:(1)基座跟踪误差,(2)末端执行器位置误差,(3)当前末端执行器朝向(qcurr)与目标末端执行器朝向(qtar)之间的四元数测地线距离(Dori)。
    • 在静态(站立)和动态(移动)条件下进行评估。
    • 为了公平比较和测试泛化能力,两种方法都在相同且更大的工作空间中进行评估。

  • 实验结果
    • 如表所示,该方法在基座速度跟踪方面优于基线方法,这归因于策略观测中包含地形数据,从而增强了机器人的状态估计。
    • 在末端执行器姿态跟踪性能方面,该方法与基线方法相当。尽管该方法在训练时使用的末端执行器工作空间比基线方法更小,但其对不同地形的适应性更强,展现出该方法从更受限的训练域中具有强大的泛化能力。

从模拟到现实的性能

验证框架在现实世界中的性能,特别是从模拟到现实的迁移能力。

  • 实验方法
    • 使用Unitree Go2四足机器人和Arx5机械臂构建机器人平台,该平台配备有用于定位的MID-360 LiDAR和用于RGB成像的头戴式D435i RealSense相机,以及安装在夹爪上的D405 RealSense相机用于RGB-D数据。
    • 在现实世界中对两个长期任务(“导航到抓取”和“抓取和放置”)进行评估,使用五种不同的物体进行测试。

  • 实验结果
    • 如图所示,ODYSSEY框架在任务规划和执行方面成功实现了从模拟到现实的迁移。
    • 尽管如此,仍存在一些从模拟到现实的差距。例如,机器人有时会在抓取小物体时失败,这是由于末端执行器跟踪和视觉感知不准确造成的。
    • 通过这些实验,该方法展现出了解决长期移动探索和操作任务的显著潜力,同时也识别出了必须解决的主要挑战,即鲁棒的感知和高精度控制,以便实现无缝的现实世界部署。

结论与未来工作

  • 结论
    • ODYSSEY框架通过将分层任务规划与地形自适应全身控制相结合,成功实现了从模拟到现实的迁移,并在多样化环境和长期任务中展现出强大的泛化能力,为开放世界移动操作提供了一种有效的解决方案。
  • 未来工作
    • 将基准测试扩展为一个全面的评估范式,用于评估视觉 - 语言模型(VLMs)和移动操作器,实现跨体现的语义推理和运动 - 操作协调能力的评估。
    • 探索主动感知的新兴能力,使动态场景理解和自适应运动协同作用,以实现更有效的现实世界交互,这可能在杂乱、非结构化环境中解锁新的行为,进一步弥合高层规划和低层控制之间的差距。

Logo

更多推荐