摘要:本文针对以稀疏视角视频为输入实现高保真人类视图合成的挑战展开研究。先前的方法借助4D扩散模型生成新视角下的视频,以此解决观测数据不足的问题。然而,这些模型生成的视频往往缺乏时空一致性,从而降低了视图合成的质量。在本文中,我们提出了一种新颖的滑动迭代去噪流程,以增强4D扩散模型的时空一致性。具体而言,我们定义了一个潜在网格,其中每个潜在编码均针对特定视角和时刻编码了图像、相机位姿及人体姿态信息;随后,利用滑动窗口在空间和时间维度上交替对该潜在网格进行去噪处理;最终,从对应的去噪潜在编码中解码出目标视角下的视频。通过迭代滑动处理,信息在潜在网格中充分流动,使扩散模型能够获得较大的感受野,进而增强输出的4D一致性,同时确保GPU内存消耗在可接受范围内。在DNA-Rendering和ActorsHQ数据集上进行的实验表明,我们的方法能够合成高质量且一致的新视角视频,性能显著优于现有方法。请访问我们的项目页面查看交互式演示和视频结果:Diffuman4D 。Huggingface链接:Paper page,论文链接:2507.13344

研究背景和目的

研究背景

随着计算机视觉和图形学技术的快速发展,从多视角视频中重建动态人类表演并实现自由视角渲染已成为一个备受关注的研究领域。传统的多视角立体视觉(MVS)和从运动中恢复结构(SfM)方法通常需要密集的摄像头阵列或深度传感器来捕捉足够数量的视角,以实现高质量的重建。然而,这些方法在面对稀疏视角输入时,由于观测数据不足,往往会导致重建结果的不稳定和失真。近年来,基于深度学习的生成模型,特别是4D扩散模型,为解决这一问题提供了新的思路。这些模型能够通过学习大量数据中的时空模式,生成新视角下的高质量视频。然而,现有的4D扩散模型在生成视频时,往往缺乏时空一致性,导致视图合成质量下降。

研究目的

本文旨在提出一种名为Diffuman4D的新方法,通过引入时空扩散模型和滑动迭代去噪机制,解决从稀疏视角视频中合成高质量且时空一致的4D人类视图的问题。具体目标包括:

  1. 提高视图合成的保真度:通过利用时空扩散模型,生成在时间和空间维度上都保持一致的高质量人类视图。
  2. 解决稀疏视角输入的挑战:通过生成额外的视角视频,弥补原始稀疏视角输入的不足,从而提高重建的稳定性和准确性。
  3. 提出滑动迭代去噪机制:通过该机制增强扩散模型的时空一致性,确保生成的视频在不同视角和时刻下都保持连贯性。
  4. 实现实时渲染:通过优化4D高斯溅射(4DGS)模型,实现动态人类表演的实时自由视角渲染。

研究方法

时空扩散模型

Diffuman4D采用了一种时空扩散模型,该模型能够同时处理空间和时间维度上的信息。模型架构基于多视角潜在扩散模型,使用3D自注意力层实现图像间的信息交换。输入视频首先通过预训练的变分自编码器(VAE)编码为潜在表示,从而在潜在空间中学习联合分布。为了生成新视角下的视频,模型在潜在空间中进行滑动迭代去噪,逐步去除噪声并生成清晰的潜在表示。

滑动迭代去噪机制

滑动迭代去噪是Diffuman4D的核心创新点。该机制通过定义一个潜在网格,其中每个潜在编码都包含了特定视角和时刻下的图像、相机位姿及人体姿态信息。去噪过程通过滑动窗口在空间和时间维度上交替进行,确保信息在潜在网格中充分流动。具体步骤如下:

  1. 初始化潜在网格:将输入视频编码为潜在表示,并定义噪声潜在表示在目标视角和时刻下,形成4D潜在网格。
  2. 滑动窗口去噪:使用滑动窗口在空间和时间维度上交替对潜在网格进行去噪处理。在每个维度上,窗口滑动并执行多次去噪步骤,确保每个潜在编码都能接收到周围信息的影响。
  3. 解码生成视频:从去噪后的潜在表示中解码出目标视角下的视频,实现高质量且时空一致的视图合成。
骨架条件引导

为了进一步提高生成视频的质量和运动准确性,Diffuman4D引入了骨架条件引导机制。具体步骤如下:

  1. 骨架序列提取:使用现成的3D姿态估计器从输入视频中提取骨架序列。
  2. 骨架投影:将骨架序列投影到每个视角和时刻的图像空间中,形成骨架条件信号。
  3. 条件信号融合:将骨架条件信号与相机参数和图像观测一起编码到潜在空间中,引导时空扩散模型的生成过程。
4D高斯溅射重建

为了实现实时自由视角渲染,Diffuman4D使用LongVolcap方法从生成的多视角视频中重建4D高斯溅射(4DGS)模型。具体步骤如下:

  1. 初始化高斯基元:使用预测的前景掩码和空间雕刻算法获得粗略的几何形状,初始化4D高斯基元。
  2. 优化重建:遵循LongVolcap的训练和评估设置,优化4D高斯溅射模型,实现长体积视频的有效重建。

研究结果

定量比较

在DNA-Rendering和ActorsHQ数据集上进行的实验表明,Diffuman4D在各项评估指标上均显著优于现有方法。具体结果如下:

  • 在DNA-Rendering数据集上:Diffuman4D在PSNR(峰值信噪比)、SSIM(结构相似性指数)和LPIPS(学习感知图像块相似度)等指标上均优于LongVolcap、GauHuman、GPS-Gaussian和CAT4D等基线方法。特别是在4视角和8视角设置下,Diffuman4D的PSNR分别提高了4.0和3.8,SSIM分别提高了0.10和0.06,LPIPS分别降低了0.07和0.07。
  • 在ActorsHQ数据集上:Diffuman4D同样表现出色,实现了零样本泛化,生成的视频质量显著优于基线方法。
定性比较

从定性角度来看,Diffuman4D生成的视频在视觉质量和时空一致性方面均优于现有方法。具体表现如下:

  • 视觉质量:Diffuman4D生成的视频具有更高的清晰度和更少的伪影,能够捕捉到人类表演的细微动作和表情变化。
  • 时空一致性:Diffuman4D生成的视频在不同视角和时刻下保持高度一致性和连贯性,避免了基线方法中常见的闪烁和扭曲现象。
消融研究

为了验证滑动迭代去噪机制和骨架条件引导机制的有效性,本文进行了消融研究。具体结果如下:

  • 滑动迭代去噪:与多组去噪和 median filtering 去噪策略相比,滑动迭代去噪机制显著提高了生成视频的时空一致性,降低了计算成本。
  • 骨架条件引导:与仅使用相机参数和图像观测作为条件信号相比,引入骨架条件信号后,生成视频的质量和运动准确性得到了显著提升。

研究局限

尽管Diffuman4D在从稀疏视角视频中合成高质量且时空一致的4D人类视图方面取得了显著进展,但仍存在一些局限性:

  1. 分辨率限制:由于基础模型的限制,Diffuman4D目前尚不支持4K分辨率的视频生成。
  2. 复杂交互场景:在处理涉及复杂人类-物体交互的场景时,Diffuman4D的性能可能会受到影响。
  3. 新姿态渲染:Diffuman4D无法实现新姿态的渲染,因为该方法需要输入视频来约束生成视频的空间一致性。

未来研究方向

针对Diffuman4D的局限性,未来的研究可以从以下几个方面展开:

  1. 提高分辨率:探索支持更高分辨率(如4K)视频生成的方法,以满足实际应用的需求。
  2. 处理复杂交互:研究能够处理复杂人类-物体交互场景的方法,提高模型在复杂环境下的鲁棒性和准确性。
  3. 新姿态渲染:开发能够实现新姿态渲染的方法,使模型能够生成更多样化的人类动作和表情。
  4. 优化计算效率:进一步优化滑动迭代去噪机制和骨架条件引导机制,降低计算成本,提高生成效率。
  5. 多模态输入:探索利用多模态输入(如文本、音频等)来引导视频生成的方法,为模型提供更丰富的上下文信息。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐