1. 【本文速递】

为让机器人发挥作用,需在实验室外执行实际任务。视觉-语言-动作(VLA)模型虽在端到端机器人控制中表现亮眼,但在自然环境中的泛化能力仍存疑。本文介绍π₀.₅,一种基于π₀的新模型,通过异构任务协同训练实现广泛泛化。其利用多机器人数据、高级语义预测、网络数据等,实现具有广泛泛化能力的现实世界机器人操作。系统结合协同训练与混合多模态示例,融合图像观察、语言指令等。实验表明,知识迁移对有效泛化至关重要,且首次证明端到端学习驱动的机器人系统能在全新家庭环境中执行长期且灵巧的操作技能,如清洁厨房或卧室等复杂任务。
 The π0.5 model transfers knowledge from a heterogeneous range of data sources
点击阅读原文,获取更多前沿咨询

2. 【论文基本信息】

论文基本信息

论文标题:π0.5: a Vision-Language-Action Model with Open-World Generalization
论文来源:arXiv preprint arXiv:2504.16054v1 [cs.LG]
论文链接:https://arxiv.org/abs/2504.16054v1
项目链接:https://pi.website/blog/pi05

3.【视觉-语言-动作模型(VLAs)基础】

3.1 训练方式与目标

视觉-语言-动作模型(VLAs)通常通过模仿学习在多样化的机器人演示数据集上进行训练,核心目标是最大化在给定观察 o t o_t ot和自然语言任务指令 e l l ell ell的情况下,动作 a t a_t at(或更一般地,动作块 a t : t + H a_{t:t+H} at:t+H)的对数似然,其公式表示为:
m a x θ E ( a t : t + H , o t , ℓ ) ∼ D l o g ( π θ ( a t : t + H ∣ o t , ℓ ) ) max _{\theta} \mathbb{E}_{(a_{t: t+H}, o_{t}, \ell) \sim D} log (\pi_{\theta}(a_{t: t+H} | o_{t}, \ell)) maxθE(at:t+H,ot,)Dlog(πθ(at:t+Hot,))

3.2 输入与观察内容

模型的观察 o t o_t ot通常包含一个或多个图像 I t 1 , . . . , I t n I_{t}^{1},...,I_{t}^{n} It1,...,Itn以及机器人的proprioceptive状态 q t q_t qt,其中proprioceptive状态用于捕捉机器人关节的位置等信息。

3.3 架构设计

VLAs的架构遵循现代语言和视觉-语言模型的设计思路,包含以下关键部分:

  • 模态特定token化器:用于将输入和输出映射为离散(“硬”)或连续(“软”)的token表示。
  • 大型自回归transformer主干:负责从输入token映射到输出token,实现对多模态信息的处理和转换。

3.4 权重初始化

VLAs的权重通常从预训练的视觉-语言模型初始化,这些预训练模型已经接触了大量的互联网视觉和语言数据,能够为机器人控制任务提供语义知识基础。

3.5 动作表示与处理

  • 离散动作表示:在预训练阶段,常采用基于压缩的token化方案(如FAST)将动作表示为离散token,这种方式有利于实现简单、可扩展且高效的训练。
  • 连续动作表示:在训练的后期阶段(如post-training),会引入流匹配(flow matching)等方法来表示连续动作分布,以实现更精细的动作控制和高效的实时推理。此时会设置“动作专家”(action expert),这是一组专门用于基于流匹配的动作生成的模型权重,规模小于LLM主干。
  • 动作处理机制:动作token会被线性投影到transformer嵌入空间,并且transformer中会使用单独的专家权重来处理动作token。

4.【π0.5 模型与训练方案】

4.1 模型概述

π0.5 基于 π0 构建,训练分预训练和后训练两阶段。预训练用离散标记实现高效训练,后训练引入“动作专家”支持连续动作生成与实时推理。推理时先推断高级子任务,再基于子任务预测低级动作。
Model overview

4.2 模型架构

架构可灵活表示动作块分布和标记化文本输出,捕捉的分布为 π θ ( a t : t + H , l ^ ∣ o t , l ) π_θ(a_{t:t+H}, \hat{l} | o_t, l) πθ(at:t+H,l^ot,l),其中 o t = [ I t 1 , . . . , I t n , q t ] o_t=[I_t^1,...,I_t^n,q_t] ot=[It1,...,Itn,qt](图像和机器人配置)、 l l l(任务提示)、 l ^ \hat{l} l^(文本输出)、 a t : t + H a_{t:t+H} at:t+H(动作块)。分布分解为:
π θ ( a t : t + H , l ^ ∣ o t , l ) = π θ ( a t : t + H ∣ o t , l ^ ) π θ ( l ^ ∣ o t , l ) π_θ(a_{t:t+H},\hat{l} | o_t,l)=π_θ(a_{t:t+H} | o_t,\hat{l})π_θ(\hat{l} | o_t,l) πθ(at:t+H,l^ot,l)=πθ(at:t+Hot,l^)πθ(l^ot,l)

模型核心为 transformer,输入多模态标记序列,输出分文本标记对数(采样 l ^ \hat{l} l^)和动作输出标记(动作专家生成)。

4.3 离散与连续动作表示结合

结合流匹配预测连续动作,给定 a t : t + H τ , ω = τ a t : t + H + ( 1 − τ ) ω a_{t:t+H}^{τ,ω}=τa_{t:t+H}+(1-τ)ω at:t+Hτ,ω=τat:t+H+(1τ)ω ω   N ( 0 , I ) ω~N(0,I) ω N(0,I) τ ∈ [ 0 , 1 ] τ∈[0,1] τ[0,1]),模型预测流向量场 ω − a t ω-a_t ωat。优化组合损失:
E D , τ , ω [ H ( x 1 : M , f θ l ( o t , l ) ) + α ∥ ω − a t : t + H − f θ a ( a t : t + H τ , ω , o t , l ) ∥ 2 ] \mathbb{E}_{\mathcal{D},τ,ω}[H(x_{1:M},f_θ^l(o_t,l))+α\|ω-a_{t:t+H}-f_θ^a(a_{t:t+H}^{τ,ω},o_t,l)\|^2] ED,τ,ω[H(x1:M,fθl(ot,l))+αωat:t+Hfθa(at:t+Hτ,ω,ot,l)2]

预训练 α = 0 α=0 α=0(仅离散动作),后训练引入动作专家。推理时先解码文本标记,再经 10 步去噪生成动作。

4.4 预训练

用多样化数据训练自回归 transformer,包括:

  • 多样化移动操作器数据(MM):约 400 小时,100 个家庭环境。
  • 多样化多环境非移动机器人数据(ME):单臂/双臂非移动机器人在多种家庭环境中的数据。
  • 跨体躯实验室数据(CE):实验室中多种机器人任务数据,含开源 OXE 数据集。
  • 高级子任务预测(HL):标注子任务语义,训练联合预测子任务和动作,及相关边界框。
  • 多模态网络数据(WD):图像 captioning、问答、对象定位等数据。

动作数据归一化至 [ − 1 , 1 ] [-1,1] [1,1],低维度动作向量零填充。
Examples from pre-training and post-training tasks

4.5 后训练

预训练 280k 步后进行,训练 80k 步, α = 10.0 α=10.0 α=10.0。数据包括过滤后的 MM 和 ME 成功片段、WD、对应 HL 数据、口头指令演示(VI)。

4.6 机器人系统细节

使用两种移动操作器,配备 2 个 6 自由度手臂、轮式基座、躯干升降机构及 4 个相机。状态和动作空间维度 18 或 19,控制端到端,模型直接命令目标位姿和速度,由 PD 控制器跟踪。
Robot system overview

5.【实验评估】

Evaluation environments

5.1 π₀.₅能否在真实家庭环境中泛化

在三个未参与训练的真实家庭中,使用两种移动操作机器人执行厨房和卧室清洁任务,结果显示π₀.₅能稳定完成将物品放入抽屉、把盘子放进水槽等多种任务,任务多含多个阶段,持续2至5分钟,模型仅需简单高级指令即可自主确定步骤,且其在模拟环境中的表现可代表在真实家庭中的表现。
Evaluation in real homes

5.2 泛化能力如何随场景数量变化

改变移动操作数据中的环境数量(3、12、22、53、82、104个地点),控制每个模型的独特数据样本量,在模拟环境评估发现,随着训练地点增多,多阶段任务平均表现提升,104个地点训练的模型与用测试家庭数据训练的模型表现相近且优于仅用移动操作数据的模型;语言指令遵循率和成功率也随训练地点增多而提升,对见过类别的物体表现提升更快,新环境让模型更稳健,能泛化到未见过的任务类别。
Evaluating performance with different numbers of locations
Evaluating language following with different numbers of training locations.

5.3 协同训练各成分的重要性

对比全π₀.₅模型与排除不同数据的模型,模拟家庭任务评估显示,排除多环境非移动数据或实验室跨体躯数据会显著降低性能,同时排除两者下降更明显,排除web数据影响不显著;语言指令遵循评估显示,排除多环境非移动数据和/或实验室跨体躯数据会显著降性能,排除web数据会导致对未见过类别的物体表现明显变差。
Training recipe ablations, mock homes
Training recipe ablations, language following

5.4 π₀.₅与其他VLA模型的对比

将π₀.₅与原始π₀及改进版π₀-FAST+Flow对比,发现π₀.₅显著优于后两者,即便π₀训练至300k步仍如此,表明结合协同训练任务及混合训练流程更有效。
Comparing π0.5 with other models.

5.5 高级推理组件的重要性

评估不同高级推理方法,全π₀.₅模型表现最佳,优于人类“oracle”基线;仅用低级推理但训练含高级数据的模型次之;排除口头指令或web数据会显著降性能;零样本提示GPT-4表现最差,说明用机器人数据适配视觉-语言模型很重要。
Evaluation of the high-level inference process

写在最后

π₀.₅基于π₀模型,通过异构数据协同训练(融合多机器人数据、web数据等),实现了移动操作器在全新家庭环境中的端到端控制,可完成清洁厨房、整理卧室等长时复杂任务。其采用两阶段训练(预训练用离散标记,后训练引入动作专家),结合流匹配生成连续动作,性能优于π₀及改进版π₀-FAST+Flow。未来可通过优化协同训练策略、扩大数据集提升泛化能力,同时拓展模型对复杂指令的处理能力及上下文记忆,探索更多人类监督方式,为新一代具备广泛环境适应能力的视觉-语言-动作模型奠定基础。

关注下方《AI前沿速递》🚀🚀🚀
各种重磅干货,第一时间送达
码字不易,欢迎大家点赞评论收藏

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐