在机器人视觉 - 语言 - 动作(VLA)模型领域,“数据稀缺” 与 “泛化薄弱” 始终是两大核心痛点——真实机器人数据采集成本高、场景覆盖有限,而模拟数据存在 “模拟 - 现实鸿沟”、人类数据面临形态差异难题,现有方案难以兼顾 “数据规模” 与 “迁移性能”。

由同济大学、电子科技大学等团队联合提出的MiVLA模型,以 “人机相互模仿预训练” 为核心创新,首次实现无需真实机器人数据,仅通过模拟机器人数据与人类视频数据的融合训练,就能达成超越现有顶尖模型的泛化能力,为通用型机器人政策学习提供了低成本、高可扩展的全新路径。

原文链接:超越π0.5,MiVLA通过人机相互模仿预训练,破解 VLA 模型泛化与数据瓶颈

为什么需要重构 VLA 预训练范式?

当前 VLA 模型训练陷入双重困境:一方面,依赖真实机器人数据的训练方案受限于 “数据瓶颈”;另一方面,依赖单一模拟数据或人类数据的方案受限于 “模态鸿沟”,核心矛盾可归结为 “无法同时解决‘数据稀缺’与‘跨模态迁移’”:

训练数据类型代表方案核心缺陷
真实机器人数据 π 0 \pi_0 π0 π 0.5 \pi_{0.5} π0.5、H-RDT1. 采集成本极高,需专业设备与长时间操作;2. 场景 / 机器人形态覆盖有限,难以适配开放世界;3. 规模难以扩大,无法支撑通用化预训练
单一模拟机器人数据RoboTwin 系列存在 “模拟 - 现实鸿沟”,物理特性与真实环境差异大,迁移性能弱
单一人类视频数据EgoDex、EgoVLA人机形态差异显著(手 / 机械臂结构、动作空间不同),动作知识难以直接迁移

这些方案忽略了关键逻辑:优质 VLA 预训练需要 “数据规模、行为保真、跨模态适配” 三者统一——既要有足够多的样本覆盖多样化操作,又要兼具真实世界行为逻辑与机器人控制特性,同时突破人机形态差异的壁垒。MiVLA 正是基于这一逻辑,通过 “人机双向动作映射消除形态鸿沟,相互模仿预训练融合双源数据优势”,构建了兼顾通用性与实用性的 VLA 模型。

MiVLA:如何通过人机相互模仿实现泛化突破?

MiVLA 的核心设计可概括为 “以人机双向动作空间对齐为基础,通过相互模仿预训练,将模拟机器人数据的操控多样性与人类视频的行为保真度融合为统一模型”。其通过三大核心特性与模块化架构,实现了 “数据高效利用、跨模态迁移、泛化能力强化” 的三重突破:

核心特性 1:双向人机动作空间映射——打破形态差异壁垒

针对人机形态(手 / 机械臂)、动作空间(关节自由度、坐标系统)的本质差异,MiVLA 设计了通用动作映射机制,实现跨模态动作的精准转换:

  • 映射参考点:选取人类拇指指节姿态与机器人末端执行器(EEF)姿态作为核心参考点,其余关节通过逆运动学(IK)或解剖学先验推导;
  • 双向转换逻辑
    • 人类到机器人:通过旋转矩阵转换人类动作坐标系,再用 IK 求解器生成机器人关节角度;
    • 机器人到人类:将机器人 EEF 姿态映射为人类拇指姿态,结合解剖学先验估算手指间距与关节状态;
  • 统一动作空间:整合人机专属关节空间(人类 48 维关节、机器人 14 维关节)与通用末端执行器空间(14 维位姿信息),实现双模态数据的直接对齐。

核心特性 2:人机相互模仿预训练——双源数据优势融合

创新 “预测 - 模仿” 双任务预训练范式,让模型从单一模态数据中学习双模态动作知识:

  • 预训练目标:给定模拟机器人演示,模型需同时预测机器人动作轨迹,并模仿生成对应的人类动作;给定人类视频演示,需同时预测人类动作轨迹,并模仿生成对应的机器人动作;
  • 损失函数设计:采用 L2 损失函数,同时优化 “模态内动作预测” 与 “跨模态动作模仿”,确保双源数据的知识深度融合;
  • 数据优势互补:模拟机器人数据提供丰富的操控场景与动作多样性,人类视频数据提供真实世界的行为逻辑与场景覆盖,无需真实机器人数据即可构建通用行为先验。

核心特性 3:扩散 transformer 架构——支撑连续机器人控制

为适配机器人连续动作控制需求,MiVLA 采用 “多模态编码器 + 扩散解码器” 的统一架构:

  • 观测编码器:视觉输入采用 DINOv2 与 Siglip 双视觉编码器,语言输入采用 T5 编码器,本体感受状态通过 MLP 编码,所有模态映射至统一嵌入空间;
  • 动作解码器:基于扩散 transformer 设计,通过流匹配(flow-matching)迭代去噪生成连续动作序列,支持长 horizon 任务的精准控制;
  • 架构优势:兼顾多模态信息融合能力与连续动作生成精度,避免离散动作令牌化带来的控制局限性。

核心特性 4:轻量化高效训练——低成本规模化部署

MiVLA 在训练效率上实现优化,降低落地门槛:

  • 预训练配置:4 块 A100 GPU,批量大小 128,bf16 混合精度训练,初始学习率 1e-4;

  • 微调配置:2 块 A100 GPU,批量大小 32,复用预训练优化器参数,无需大幅调整;

  • 数据效率:仅用约 900 小时混合数据(模拟机器人 + 人类视频),即可比肩 π 系列模型 10000 + 小时真实机器人数据的训练效果。

关键实验:MiVLA 如何超越现有顶尖方案?

团队在模拟环境与真实机器人平台开展全面验证,聚焦 “性能对比、组件有效性、泛化能力” 三大核心问题,实验结果充分证明 MiVLA 的优越性:

实验设置

实验平台具体配置
模拟环境RoboTwin-2.0 基准,50 项双臂协同任务,Easy/Hard 双模式(Hard 模式含域随机化)
真实机器人平台3 类异构机器人:单臂 AgileX PiPER、单臂 ARX-5、双足 + 双臂复合机器人 LocoMan
真实任务设计3 项代表性任务:瓶子放置、雨伞整理、分散物体收集(覆盖单臂 / 双臂、短 / 长 horizon)
基线模型ACT、 π 0 \pi_0 π0 π 0.5 \pi_{0.5} π0.5、H-RDT(均采用开源权重,同配置微调确保公平性)

主要结果:模拟与真实场景双重领先

模拟任务:泛化能力显著提升

在 RoboTwin-2.0 的 20 项代表性任务中,MiVLA 在 Easy/Hard 模式下均大幅超越基线:

Hard 模式下的优异表现,证明 MiVLA 对环境变化、视觉干扰的强鲁棒性。

真实机器人任务:跨形态泛化能力突出

在 3 类异构机器人的任务中,MiVLA 以 “中等规模混合数据” 实现比肩 “大规模真实数据预训练模型” 的性能:

关键亮点:LocoMan 作为 “双足 + 双臂” 的复合形态机器人,是所有基线模型未见过的全新架构,而 MiVLA 凭借跨模态泛化能力,成功完成长序列双臂协同任务,证明其对未知机器人形态的适配性。

消融实验:核心组件的关键作用

通过逐步添加核心组件,验证人机相互模仿预训练的必要性:

结果表明:双向相互模仿预训练是性能提升的核心,能最大化融合双源数据的互补优势,解锁模型的泛化潜力。

泛化能力验证:跨场景 / 跨物体 / 跨位置适配

设计三类泛化场景测试,MiVLA 展现出强大的环境适配性:

仅需 20 条演示数据,MiVLA 即可实现对未知位置、物体的有效适配,全量训练后平均泛化成功率达 54%,远超传统方案。

核心结论与未来方向

核心结论

  • 人机相互模仿是突破数据瓶颈的关键:MiVLA 证明,无需真实机器人数据,通过 “模拟机器人数据 + 人类视频” 的双向模仿预训练,即可构建泛化能力更强的 VLA 模型,大幅降低数据采集成本;
  • 动作空间对齐是跨模态迁移的基础:双向人机动作映射机制有效解决了形态差异问题,为双源数据融合提供了核心技术支撑;
  • 混合数据优势互补:模拟数据的操控多样性与人类数据的行为保真度结合,能覆盖更广泛的任务场景,显著提升模型鲁棒性。

局限性与未来方向

当前 MiVLA 在极端分布外场景(如全新物体形态、复杂干扰背景)仍存在性能短板,未来将聚焦三大方向优化:

  • 融合 VLM 的语义推理能力:结合视觉语言模型的常识推理与目标理解能力,提升对抽象指令、未知物体的适配性;
  • 扩展多模态信息:融入触觉、声音等模态数据,强化复杂物理交互场景的控制精度;
  • 扩大数据覆盖范围:新增高精度灵巧任务(如精细装配)与更多机器人形态(如人形机器人),进一步提升通用化水平。

总结

MiVLA 的创新之处在于,首次通过 “人机相互模仿预训练” 范式,将两类易获取的数据源(模拟机器人数据、人类视频)转化为通用 VLA 模型的核心训练资源,打破了 “真实机器人数据依赖” 的行业困境。其在模拟与真实平台的双重优异表现,不仅证明了人机协同学习的巨大潜力,更为机器人通用化控制提供了 “低成本、高泛化、可规模化” 的全新路径,有望推动 VLA 模型从 “特定任务适配” 向 “开放世界通用” 跨越。

具身求职内推来啦

近50家主流具身公司,校招&社招&实习均可

国内最大的具身智能全栈学习社区来啦!

具身智能之心知识星球:国内最大的具身智能全栈技术社区来啦!

推荐阅读

从零部署π0,π0.5!好用,高性价比!面向具身科研领域打造的轻量级机械臂

工业级真机教程+VLA算法实战(pi0/pi0.5/GR00T/世界模型等)

具身智能算法与落地平台来啦!国内首个面向科研及工业的全栈具身智能机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

MuJoCo具身智能实战:从零基础到强化学习与Sim2Real

从零训练你的足式机器人!让你的足式机器人真正动起来~

具身领域的目标导航到底是什么?有哪些主流方法?

Diffusion Policy在具身智能领域是怎么应用的?为什么如此重要?

具身智能视觉语言动作模型,VLA怎么入门?

视觉语言导航的主流方法有哪些?是怎么用的?

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐