【3DV 2026】清华智源GaussianArt突破:3D高斯模型破解机器人仿真关键难题
一、导读
在为机器人仿真或虚拟交互创建数字世界时,精确重建带有关节的物体(例如可以开关的柜子、可折叠的椅子)至关重要。目前的主流方法通常是“两步走”:先分别重建物体在打开和关闭两种状态下的三维模型,然后再去比对这两个模型,猜测部件是如何运动的。这种分离式的方法不仅流程复杂,而且当物体包含很多运动部件时,非常容易出错,导致重建失败。
为了解决这个问题,本论文提出了一个名为 GaussianArt 的模型框架:一个统一建模几何与运动的关节化高斯模型。它不再分两步走,而是在一个统一的框架内同时学习物体の三维形状和部件的运动规律。实验证明,这种方法不仅显著提升了重建的精度,还能成功处理多达20个部件的复杂物体,远超以往方法的处理能力。
二、论文基本信息

- 论文标题: GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects (GaussianArt:统一建模关节物体的几何与运动)
- 论文链接: https://arxiv.org/abs/2508.14891v2
三、主要贡献与创新
- 提出GaussianArt,用关节化3D高斯统一建模几何与运动,保证跨状态一致性。
- 设计软到硬训练范式,逐步优化部件分割和运动参数,提升多部件物体上的鲁棒性。
- 构建MPArt-90基准,含90个多类别物体,系统评估算法的可扩展性与泛化能力。
- 所提方法在几何和運動精度上顯著優於現有方法,並成功應用於機器人仿真等下游任務。
四、研究方法与原理
该模型的核心思路是:将物体表示为一组关节化3D高斯基元,每个基元同时编码其所属的部件和运动方式,通过一个统一的优化过程,实现物体几何形状和部件运动的联合重建。

论文提出的 GaussianArt 框架主要包含关节化物体表示、软到硬训练范式和初始化三个关键部分。
1. 关节化物体表示
传统3D高斯溅射(3DGS)只能表示静态场景。为了对关节物体进行建模,作者对其进行了扩展。既然3DGS是显式表示,那么刚性运动就可以通过直接变换高斯基元来实现。
首先,文章将物体重建定义为一个在**标准状态(canonical state)**的高斯场上的运动场。对于单个高斯基元,其刚性运动被施加在均值 μ(i)μ^{(i)}μ(i) 和协方差 Σ(i)Σ^{(i)}Σ(i) 上:
μ~(i)=R(i)μ(i)+T(i)
\tilde{μ}^{(i)} = R^{(i)}μ^{(i)} + T^{(i)}
μ~(i)=R(i)μ(i)+T(i)
Σ~(i)=R(i)Σ(i)R(i)T
\tilde{Σ}^{(i)} = R^{(i)}Σ^{(i)}{R^{(i)}}^T
Σ~(i)=R(i)Σ(i)R(i)T
其中 (μ~(i),Σ~(i))(\tilde{μ}^{(i)}, \tilde{Σ}^{(i)})(μ~(i),Σ~(i)) 是变换后的高斯参数,R(i)R^{(i)}R(i) 和 T(i)T^{(i)}T(i) 是每个高斯基元独有的旋转和平移。
然而,一个关节物体通常只有少数几个运动部件(比如一个柜子只有几个抽屜),远少于高斯基元的数量。因此,作者定义了 NNN 个全局的运动基 {Rj,Tj}j=1N\{R_j, T_j\}_{j=1}^{N}{Rj,Tj}j=1N,其中 NNN 是部件的数量。每个高斯基元的运动 (R(i),T(i))(R^{(i)}, T^{(i)})(R(i),T(i)) 则表示为这些运动基的加权组合:
R(i)=∑j=1Nwj(i)Rj,T(i)=∑j=1Nwj(i)Tj
R^{(i)} = \sum_{j=1}^{N} w_{j}^{(i)} R_j, \quad T^{(i)} = \sum_{j=1}^{N} w_{j}^{(i)} T_j
R(i)=j=1∑Nwj(i)Rj,T(i)=j=1∑Nwj(i)Tj
这里的权重 w(i)={w1(i),w2(i),...,wN(i)}w^{(i)} = \{w_{1}^{(i)}, w_{2}^{(i)}, ..., w_{N}^{(i)}\}w(i)={w1(i),w2(i),...,wN(i)} 表示第 iii 个高斯基元属于第 jjj 个运动基(即某个部件)的概率。
2. 软到硬训练范式 (Soft-to-hard Training Paradigm)
直接优化上述的“软”组合权重 wj(i)w_{j}^{(i)}wj(i) 和运动基参数是非常困难的。为了稳定地学习到清晰的部件划分和精确的运动,论文设计了一个从软到硬的训练策略。
软训练阶段:在训练初期,模型采用上述的软混合模式(公式4)进行学习。这个阶段的目标是让网络初步学会部件的几何形状和大致的运动范围。为了引导权重的学习,模型使用了部件分割掩码(通过Art-SAM生成,后文详述)作为监督信号,并通过渲染出的权重图与掩码计算交叉熵损失 LSEML_{SEM}LSEM。同时,为了让同一个部件内部的高斯基元具有相似的权重分配,引入了 L0 梯度稀疏性正则项 LsparsityL_{sparsity}Lsparsity,它鼓励相邻高斯基元的权重向量尽量保持一致,从而形成空间上平滑且稀疏的部件边界。
Lsparsity=∑i=1N∑j∈KNN(i)∥w(i)−w(j)∥
L_{sparsity} = \sum_{i=1}^{N} \sum_{j \in \text{KNN}(i)} \|w^{(i)} - w^{(j)}\|
Lsparsity=i=1∑Nj∈KNN(i)∑∥w(i)−w(j)∥
硬训练阶段:当训练进行到一定程度,部件划分和几何形状趋于稳定后,模型切换到硬训练模式。此时,每个高斯基元不再使用软混合运动,而是被硬性地分配给拥有最高权重的那个部件。其运动参数直接继承该部件的运动参数:
R(i)=Rj∗,T(i)=Tj∗,其中j∗=argmaxjwj(i)
R^{(i)} = R_{j^*}, \quad T^{(i)} = T_{j^*}, \quad \text{其中} \quad j^* = \arg\max_{j} w_{j}^{(i)}
R(i)=Rj∗,T(i)=Tj∗,其中j∗=argjmaxwj(i)
这种方式将高斯基元视为刚性部件的一部分,使得运动参数的优化更加直接高效。在此阶段,为了进一步精调运动参数,模型引入了轨迹正则化项 LtrajL_{traj}Ltraj。它通过匹配两帧图像的特征点,Lift到三维空间,然后约束一个部件上的点经过学习到的变换 (Rj,Tj)(R_j, T_j)(Rj,Tj) 后,应该与它在另一帧中匹配到的三维点位置尽量接近。
Ltraj=∑j∈F(M)∥(Rjpj+Tj)−qj∥
L_{traj} = \sum_{j \in F(M)} \| (R_j p_j + T_j) - q_j \|
Ltraj=j∈F(M)∑∥(Rjpj+Tj)−qj∥

整个训练过程由一个多项损失函数指导,软训练和硬训练阶段的损失函数分别为:
LSoft=LRGB−D+λSEMLSEM+λsparsityLsparsity
L_{Soft} = L_{RGB-D} + \lambda_{SEM}L_{SEM} + \lambda_{sparsity}L_{sparsity}
LSoft=LRGB−D+λSEMLSEM+λsparsityLsparsity
LHard=LRGB−D+λSEMLSEM+λtrajLtraj
L_{Hard} = L_{RGB-D} + \lambda_{SEM}L_{SEM} + \lambda_{traj}L_{traj}
LHard=LRGB−D+λSEMLSEM+λtrajLtraj
其中,LRGB−DL_{RGB-D}LRGB−D 是标准的渲染损失,包括L1损失和D-SSIM損失。
3. 初始化 (Initialization)
良好的初始化是成功重建的关键。
- 部件分割:为了获得初始的部件信息,作者首先微调了一个强大的图像分割模型 SAM2,使其专门用于分割关节物体的部件,得到一个名为 Art-SAM 的模型。然后,通过多视角传播和一致性校验,为物体的每个视角生成高质量且一致的部件分割掩码。
- 标准高斯初始化:模型选择一个关节状态(通常是可见性更高的状态)作为标准状态。利用带有部件标签的RGB-D图像,将像素点反投影到三维空间中,形成带部件标签的初始点云。这些点云被用来初始化标准高斯基元的位置、颜色等属性。每个高斯的部件标签被转换为one-hot形式,作为其运动混合权重 w(i)w^{(i)}w(i) 的初始值。
五、实验设计与结果分析
MPArt-90上的实验 (Experiments on MPArt-90)
- 数据集:为了全面评估模型的可扩展性,论文构建了一个大规模的基准数据集 MPArt-90。它包含来自20个类别的90个关节物体,每个物体都有多视角RGB-D图像、相机参数以及真实的运动参数。物体的部件数量从2个到20个不等,覆盖了多样的运动类型。
- 评测指标:运动估计方面,使用轴角度误差(Axis Ang)、轴位置误差(Axis Pos)和部件运动误差(Part Motion)。几何重建方面,使用倒角距离(CD),并区分为静态部件(CD-s)和动态部件(CD-m)。
- 对比实验:在MPArt-90上,论文主要将 GaussianArt 与目前最强的基于高斯溅射的关节物体重建方法 ArtGS 进行了对比。

从上表可以看出,当物体部件较少(2-3个)时,ArtGS与GaussianArt在某些运动指标上表现相当。然而,随着部件数量增加,ArtGS的性能急剧下降,尤其是在动态部件的几何重建(CD-m)上,误差值 skyrocketing,说明其基于聚类的初始化方法在复杂场景下完全失效。相比之下,GaussianArt 凭借其鲁棒的初始化和统一优化框架,在所有部件数量的设置下都保持了非常低的几何重建误差和较高的运动估计精度,展现了强大的可扩展性和稳定性。
- 可视化对比:

上图直观展示了在处理多部件物体时,ArtGS često出现部件分割错误(例如将多个抽屉错误地分到一组)甚至训练失败。而GaussianArt能够正确地分割出每一个獨立的運動部件,並準確估計其運動參數,生成高保真的数字孪生。
消融实验 (Ablation Studies)
- 实验设置:为了验证模型中各个组件的有效性,作者在5个多部件物体上进行了消融研究。
- 实验结果:

从消融实验结果可以得出以下结论:
- 部件分割掩码(Part-seg)和部件初始化(Part-init)至关重要。移除它们会导致模型几乎无法学习正确的运动,动态部件的几何误差急剧增加。
- 使用简单的MLP进行部件分配(w MLP Seg)对于复杂多部件物体是无效的,证明了专门设计的Art-SAM结合多视角一致性方法的必要性。
- L0正则化(L0)和轨迹正则化(Traj)都对最终的运动参数精度和几何质量有明显的提升作用,证明了软硬训练范式中各项设计的有效性。
六、论文结论与评价
本文的核心结论是,通过一个统一的关节化高斯表示来同时建模物体的三维几何和部件运动,可以显著提高关节物体重建的精度和鲁棒性,特别是在处理拥有大量运动部件的复杂物体时。实验结果表明,该方法在作者构建的大规模基准MPArt-90上,性能全面超越了以往的方法。
这项研究为创建可交互的数字孪生提供了强大的技术支持。在实际应用中,例如在机器人仿真环境中,我们可以利用GaussianArt重建出的高精度模型,让机器人学习如何与真实世界的抽屉、柜门、冰箱等进行交互。此外,它还能用于构建更真实的4D动态场景,以支持人-景交互(HSI)的建模和内容生成。
该方法的优点在于其统一建模的思想,避免了传统分离式方法中因步骤间误差累积导致的问题,并且其软到硬的训练策略兼顾了学习初期的灵活性和后期的精确性。然而,该方法也存在一些不足。首先,它对于两个观测状态之间的运动幅度非常大(例如门从完全打开到完全关闭)的情况处理得不够好,因为缺乏对中间运动状态的约束。其次,模型的性能高度依赖于初始化的质量。如果Art-SAM生成的部件分割不准确,或者多视角重建存在偏差,最终的运动学习效果会受到很大影响。
批判性讨论:未来的改进方向可以考虑引入物理约束或运动学先验,来规范化从一个状态到另一个状态的运动轨迹,解决极端运动下的参数学习问题。此外,可以探索一种端到端的、无需预先生成分割掩码的部件发现机制,以进一步提升模型的自动化程度和对全新类别物体的泛化能力。尽管如此,GaussianArt提出的统一框架和为解决可扩展性问题而构建的大规模基셔准,无疑为关节物体三维重建领域树立了新的标杆。
更多推荐
所有评论(0)