想象一个场景:在客厅里,一个双足人形机器人能够流畅地深蹲拾取地上的玩具;在厨房中,它能轻松跨越不同高度的台面,整理餐具。更重要的是,实现这一切不再需要投入海量的人工演示数据。这一愿景,正由 TrajBooster 框架加速变为现实。
在这里插入图片描述

论文题目:TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning
论文链接:https://arxiv.org/abs/2509.11839
项目链接:https://jiachengliu3.github.io/TrajBooster/
作者单位:浙江大学、西湖大学、上海交通大学、上海创新中心

研究背景与挑战

近年来,视觉-语言-动作(VLA)模型赋予了机器人自主执行家庭任务的能力。轮式人形机器人已能胜任深蹲、跨高度抓取等需要全身协调的复杂动作。例如,AgibotWorld Beta 数据集揭示,其末端执行器的轨迹覆盖了 0.2 至 1.2 米的垂直范围,这足以应对绝大多数家庭环境的需求。

然而,当主角换成双足人形机器人时,研发便遭遇了瓶颈。挑战主要源于两个方面:

  1. 全身协调的固有难度:双足机器人必须在利用下半身维持动态平衡的同时,精确操控上半身执行任务。这种全身大范围的协调控制,其难度远超桌面级操作或单纯的移动,构成了当前 VLA 研究中的一个关键技术缺口。
  2. 高质量数据的极度稀缺:训练一个能胜任全身操控的 VLA 模型,离不开大规模、高质量的演示数据。但传统的遥操作数据采集流程不仅依赖昂贵的设备和专业的操控人员,产出的数据集还往往规模小、场景单一。这导致 VLA 模型难以有效适配和理解新机器人的独特动作空间。尽管利用异构机器人数据进行预训练有所帮助,但终究无法替代与目标机器人形态相关的、覆盖全身动作的数据。

核心贡献

为攻克上述难题,来自浙江大学、西湖大学等机构的研究团队提出了 TrajBooster 框架。这项工作的主要贡献包括:

  • ** pioneering Real-World Application**:据我们所知,这是首个利用大规模重定向动作数据来微调 VLA 模型,并在真实双足人形机器人上实现复杂全身操控的研究。
  • 跨形态知识迁移框架:TrajBooster 创新性地以末端执行器轨迹作为一种“通用语言”,打破了不同机器人形态间的壁垒。它能够将轮式人形机器人的海量演示数据,高效转化为可用于训练双足机器人的宝贵资源,有效缓解了后者的“数据饥渴”问题。
  • 高效实现复杂任务:实验证明,在 Unitree G1 机器人上,仅需采集约 10 分钟的遥操作数据用于微调,即可完成深蹲、跨高度整理等超越桌面范围的家庭任务。该框架显著提升了模型的鲁棒性与泛化能力,并解锁了零样本技能迁移的潜力,大幅降低了对同形态、高成本数据的依赖。

TrajBooster 技术解析

TrajBooster 是一个遵循“真实-仿真-真实”(Real-to-Sim-to-Real)流程的跨形态学习框架,其核心环节可分解为三步:

1. 真实轨迹提取 (Real Trajectory Extraction)

此阶段的目标是从现有的、大规模的机器人数据集中提取出形态无关的“技能知识”。

  • 数据源:研究团队选用 Agibot-World Beta 数据集,该数据集包含了超过 100 万条来自轮式人形机器人的真实轨迹,涵盖了多视角图像、自然语言指令和末端执行器的 6D 位姿。
  • 轨迹适配:由于源机器人(Agibot)与目标机器人(Unitree G1)的物理尺寸不同(如臂展分别为 1.8 米和 1.2 米),直接复用轨迹是不可行的。因此,框架首先对轨迹进行映射和缩放处理,使其适应 Unitree G1 的工作空间,例如按臂长比例缩放、对齐坐标系,并设定安全高度范围(0.15-1.25米),确保轨迹在目标机器人上是可达且安全的。

2. 仿真重定向 (Retargeting in Simulation)

提取出的末端执行器轨迹只是一个“目标”,如何让双足机器人协调全身来实现这个目标,是此阶段的核心任务。团队在 Isaac Gym 仿真环境中,通过一个分层控制模型将低维轨迹目标“翻译”成高维的全身关节指令。

  • 分层控制架构:为了解耦复杂的全身控制问题,模型被分为上、下半身两个系统:
    • 手臂策略 (Arm Policy):利用逆运动学(IK)算法,根据给定的腕部目标位姿,直接计算出手臂关节的角度。
    • 下半身控制:这是一个由“管理者-工人”组成的层级策略。
      • 管理者策略 (Manager Policy):负责“决策”,它根据腕部的目标轨迹,生成对下半身的宏观指令,包括基座的移动速度和躯干的目标高度。
      • 工人策略 (Worker Policy):负责“执行”,这是一个基于强化学习的底层控制器,它接收管理者发来的速度和高度指令,并输出驱动下半身 12 个关节运动的具体指令,以维持平衡并完成动作。
  • 高效的训练方法:为了训练“管理者策略”,团队提出了一种启发式增强的协调在线 DAgger (Harmonized Online DAgger) 算法。该方法巧妙地利用了仿真环境的“特权信息”(如理想的躯干高度和基座移动速度),为管理者策略生成高质量的监督信号,从而加速训练。同时,通过周期性地聚合新数据进行学习,有效避免了灾难性遗忘,在训练效率和模型性能之间取得了良好平衡。

3. 真实人形机器人微调 (Finetuning for Real Humanoid)


最后一步是将仿真中获得的知识迁移到真实机器人上。此过程分为两个阶段:

  • 第一阶段:基于重定向数据的后预训练 (Post-Pre-Training)
    • 数据构建:将上一步生成的、与 Unitree G1 形态兼容的动作数据,与 Agibot-World 数据集中的原始视觉和语言指令配对,构成大量的 <源视觉, 源语言, 目标动作> 数据三元组。
    • 模型训练:以预训练的 GR00T N1.5 模型为基础,使用这些合成数据进行“后预训练”。这一步骤的目标是让 VLA 模型提前熟悉 Unitree G1 的动作空间,理解如何将通用的指令转化为其可执行的全身动作。
  • 第二阶段:基于遥操作数据的后训练 (Post-Training)
    • 数据采集:研究人员使用 Apple Vision Pro 等设备,对 Unitree G1 进行遥操作,仅采集约 10 分钟覆盖不同高度的真实演示数据。
    • 最终微调:利用这少量但高度相关的真实数据(<目标视觉, 目标语言, 目标动作>),对第一阶段的模型进行最终微调。这一步旨在弥合仿真与现实之间的差距(Sim-to-Real Gap),使模型最终适应真实的物理环境。

实验结果分析

实验围绕四个核心问题展开,充分验证了 TrajBooster 框架的有效性。

  1. 重定向模型性能优越 (Q1):与 PPO、标准 DAgger 等基线方法相比,TrajBooster 采用的协调在线 DAgger 算法在轨迹跟踪任务中表现最佳,无论是在静态还是移动场景,其位置和旋转误差均为最低,证明了其高效性和准确性。

  2. 加速动作空间适配 (Q2):实验结果显示,经过后预训练的模型仅需 3K 步的真实数据微调,其任务成功率便已超过未然后预训练、但用 10K 步真实数据训练的模型。这有力地证明,后预训练能够显著加速 VLA 模型对新机器人动作空间的学习过程。

  3. 提升轨迹泛化能力 (Q3):当目标物体被放置在遥操作数据未曾覆盖的新位置时,经过后预训练的模型依然能达到 80% 的成功率,而未然后预训练的模型成功率为 0%。轨迹分析发现,后者倾向于死记硬背演示动作,导致过拟合;而前者则能灵活调整抓取策略(如从不同角度接近物体),表现出更强的泛化性。

  4. 解锁零样本技能迁移 (Q4):对于一个仅在后预训练数据中出现、而从未在真实遥操作数据中演示过的任务(如“传递水瓶”),经过后预训练的模型能够在 Unitree G1 上零样本地完成该任务。这表明该框架赋予了模型将所学知识泛化到全新任务上的能力。

结论与未来展望

总结
TrajBooster 框架直面双足人形机器人 VLA 模型训练中的数据稀缺痛点,提出了一种以末端执行器轨迹为核心的跨形态知识迁移方案。通过“真实轨迹提取→仿真重定向→双阶段微调”的创新流程,它成功地将来自轮式机器人的海量数据转化为双足机器人的高效训练资源。该方法不仅大幅降低了对昂贵同形态数据的依赖,更显著提升了模型的动作空间理解力、泛化能力和零样本迁移能力,为双足人形机器人的实用化按下了“加速键”。

局限性与未来方向
尽管 TrajBooster 取得了显著进展,但仍存在一些局限性,为未来的研究指明了方向:

  • 末端执行器的局限:当前使用的 Unitree Dex-3 手爪精度有限,仅能完成简单的抓取。未来计划集成带有触觉感知的灵巧手,以实现更复杂的精细操作。
  • 视觉-动作一致性:当前方法主要解决了动作空间的迁移,但保留了源数据的视觉输入。未来将探索视觉观测层面的形态对齐,以增强感知与动作的一致性。
  • 移动操控数据不足:由于缺乏大规模的移动操控(Loco-manipulation)数据,当前研究主要局限于静态任务。未来计划将框架扩展到需要移动与操控相结合的更丰富的场景中。
  • 数据源与扩展性:当前实验主要依赖 Agibot-World 数据集。未来,整合更多来源、更多形态的异构机器人数据,将是提升框架泛化性和扩展性的关键。
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐