UniScene 补充材料(一)

A. 问题定义与独特性

A.1. 可控入住率生成

先前关于不可控占用生成的研究 [29, 30, 39] 主要集中在静态场景的创建上,由于缺乏可控性,这限制了其在动态场景中的应用。相比之下,我们的方法引入了可控生成 POcc|BEV),有效地将时间信息纳入生成过程。这里,BEV 指的是输入的鸟瞰图(BEV)场景布局,Occ 则表示相应的生成语义占用情况。

A.2. 条件视频和激光雷达生成

现有的视频[15, 63, 66, 71, 85]和激光雷达[50, 90, 91]生成方法通常直接从粗略的场景布局(例如,鸟瞰图、三维边界框)生成数据。然而,这些方法往往无法准确捕捉驾驶场景中固有的复杂分布,导致性能不佳。相比之下,我们提出的 UniScene 框架通过围绕占用情况将复杂的生成任务分解为一个层次结构来解决这些局限性。这可正式表述为:

其中,Vid Lid 分别表示生成的视频和激光雷达数据。通过利用占用先验知识,我们的方法减轻了学习负担,并更准确地捕捉了潜在分布,从而提高了性能,如主论文图 1(a) 所示。

B. 更多相关工作及讨论

B.1. 语义占用生成

SemCity [30] 提出了一种基于三平面扩散框架的三维语义场景生成方法。PyramidOcc [39] 利用从粗到细的金字塔离散扩散范式生成大规模三维语义场景 [1]。这些方法主要关注无条件的静态三维场景生成。近期的研究 [83] 能够通过 BEV 地图控制三维场景的生成,但仍然局限于静态场景。OccSora [59] 利用扩散变压器(DiT[48] 生成时序三维场景序列。由于其设计的 VQVAE 占用率压缩

比高,重建性能欠佳,在一定程度上导致生成质量不理想。此外,它还缺乏对生成结果进行精确控制的能力。为了解决这些方法存在的问题,我们提出了占用率生成模型,能够生成高保真度的时序三维场景序列,并有效保持时间一致性。

B.2. 驾驶视频生成

Vista [16] 基于稳定视频扩散(SVD[6] 的架构,实现了具有多种动作控制的单视角驾驶视频生成。然而,该方法受限于无法生成多视角视频以及生成输出与真实标签之间缺乏对齐,这限制了其在下游任务训练中的实用性。WoVoGen [41] 提出了一种世界模型,该模型基于过去的观测来预测未来的视频和占用情况。在该模型中,占用网格被压缩为低维特征 [49],这可能导致生成结果不理想(见主论文表 4 的第七行)。最近的工作 SyntheOcc [33] 利用基于占用的多平面语义图像在驾驶场景中合成多视角图像。然而,该方法忽略了语义占用网格中的显式几何信息,并且需要大量的手动干预来编辑占用网格。我们提出的 UniScene 旨在从语义占用中联合渲染语义图和深度图,从而提供详细的先验信息。此外,UniScene 通过使用鸟瞰图(BEV)地图作为场景布局来简化几何编辑。

B.3. 激光雷达点云生成

在激光雷达生成方面的开创性工作[18, 50, 76, 77, 90, 91]利用生成对抗网络(GAN)或扩散模型来生成激光雷达点云。LiDARGen [90] 采用等距柱面视图图像作为激光雷达点云的结构化表示,并使用基于分数的扩散模型进行点云生成。然而,这种 2.5D 表示可能会限制其准确生成真实世界物体 3D 几何形状的能力。此外,LiDARGen [90] 直接在激光雷达点上应用扩散过程,而非在潜在空间中进行,这极大地减缓了推理过程。UltraLiDAR [77] 将激光雷达点进行体素化,并将其转换为鸟瞰图(BEV)表示,使用 VQVAE 学习激光雷达点的紧凑 3D 表示,并使用生成式变压器生成激光雷达点。然而,使用 BEV 作为表示方式会忽略激光雷达数据中的精细几何细节。

10 展示了占用生成模型的架构,该模型由两个主要组件构成:占用 VAE 和占用 DiT。占用 VAE 包含一个 2D 编码器,利用了 ResBlock2D CNN 和轴向注意力机制,以及一个 3D 解码器来重建输入数据。占用 DiT 则采用去噪扩散过程,通过时间和空间自注意力块生成去噪后的潜在表示。将带有噪声的潜在表示与 BEV 布局序列相结合,处理后生成统一的分块化输出,从而实现稳健的占用生成。

这可能会对生成质量产生影响。LiDM [18] 采用距离图作为激光雷达数据的表示形式,在 VQVAE 中整合了曲线级压缩、块级编码和点级坐标监督,以增强其几何表示能力。然而,使用距离图表示可能会导致结构化的激光雷达点信息丢失。在本研究中,我们提出通过利用语义占用网格中的细粒度先验知识来促进高保真激光雷达点的生成。

C. 更多实施细节

C.1. 纯电动汽车编辑方案

BEV 布局进行修改以可控生成语义占用、视频和激光雷达点云,这在生成分布外(OOD)数据方面具有重要意义。为实现这一目标,我们的编辑方案结构如下:

修改初始的纯电动汽车布局 Bori,以生成修订后的布局 Bnew,并纳入特定的改动(例如,移除一辆车)。

使用 DDIM 倒推 [45] 将原始占用情况 Oori 转换为噪声潜在值 ϵori,同时以原始的 BEV 布局 Bori 为引导

通过去噪扩散构建更新后的占用情况 Onew,利用修改后的 BEV 布局 Bnew 作为条件因素,并以 ϵori 作为起始噪声。

利用新生成的占用情况 Onew 作为附加条件,生成相应的视频 Vnew 和激光雷达数据 Lnew ,并提供详细的先验指导。

11. 在占用率重建方面对 VQVAE VAE 性能的比较,压缩比是根据 OccWorld [86] 中的方法计算得出的。结果表明,在相同的架构设计下,我们的占用率 VAE 明显优于 VQVAE,在各种压缩比下均实现了显著更高的 mIoU IoU 分数。

C.2. 入住率生成模型

如图 10 所示,占用生成模型由一个变分自编码器(VAE)和一个扩散迭代器(DiT)组成,其在压缩的潜在空间中生成语义占用信息。

占用率变分自编码器。我们利用占用率变分自编码器编码器将占用序列中的 3D 语义占用率 ORH×W×D 转换为鸟瞰图(BEV)表示 O

ˆRH×W×DC 通过为每个类别分配一个可学习的类别嵌入C利用带有二维轴向注意力层的二维卷积神经网络编码器提取具有下采样分辨率 ZoccRC×h×w 的连续潜在特征,其中 h = H/dw = W/dd 为下采样因子。

VAE 解码器重构了潜在特征序列 zseq occRT ×C×h×w 。采用一个带有 3D 轴向注意力层的 3D CNN 网络将潜在特征序列上采样为 BEV 表示的占用率序列 O

ˆseqRT ×H×W ×DC '然后将此序列重塑为 RT HW ×D×C 并通过点积运算进行处理。

通过类别嵌入来获取对数几率得分。在训练期间,利用对数几率得分和独热编码标签来计算交叉熵损失和 Lovasz-softmax 损失[4]。在推理阶段,通过取对数几率得分的最大值来确定最终重建的占用序列 OseqRT ×H×W ×D 。我们在表 11 中提供了更多的占用重建结果,以说明我们具有连续压缩功能的占用 VAE 设计的优越性。结果表明,在相同的架构设计下,我们的占用 VAE 明显优于 VQVAE,在各种压缩比下均实现了显著更高的 mIoU IoU 得分。

Occupancy DiT。如图 10 所示,我们采用 Occupancy DiT 从有噪声的占用潜在特征和 BEV 布局序列中去除占用潜在序列特征的噪声。为了使 BEV 布局序列与占用潜在特征对齐,我们引入了一个统一的分块模块。具体来说,时间步长 i 处的 BEV 布局被下采样为 BidownR(Cb)×h×w,以匹配

11 展示了 Occupancy DiT 的可扩展性分析,说明了其性能如何随着计算成本(浮点运算次数)的增加而变化。左图显示,随着浮点运算次数的增加,F3D 性能持续提升;右图则突出了 mIoU 的可扩展性,其性能也随着计算资源的增加而稳步提高,这表明该模型能够利用更多的计算资源来获得更好的结果。

12. 占有率预测性能比较,其中 Ours-Fore. 1 ref) 和 Ours-Fore. 2 ref) 分别代表基于 1 个和 2 个参考占有率帧的我们的预测模型。结果表明,在不同的时间范围(1 秒、2 秒、3 秒)内,与基线方法(OccWorld OccLLama)相比,我们的方法在 mIoU IoU 指标上均有显著提升,这证明了我们的方法在生成准确且一致的占有率预测方面是有效的。

首先确定潜在特征的形状,然后将其与潜在特征 ZioccR(Co)×h×w 拼接起来。一个统一的补丁嵌入器将拼接后的潜在特征 ZcatR(Co+Cb)×h×w 转换为统一的潜在标记 ZRL×E d ,其中 L 是补丁的数量, Ed 是嵌入维度。

Occupancy DiT 的核心是空间-时间潜在扩散变换器,由堆叠的空间块和时间块组成。空间块在相同的潜在层内聚合不同位置的特征,而时间块则捕获相同位置不同潜在帧的特征。此外,还使用了二维位置嵌入和一维时间嵌入来考虑相对关系。该骨干网络的输出维度为 RT×L×E d ,通过 unpatchify 层处理后,得到大小为 RT×H×W×D 的去噪占用潜在序列。在训练阶段,我们以 0.1 的概率随机丢弃 BEV 布局条件,使扩散模型能够学习无条件生成,这对于占用编辑至关重要。在采样阶段,默认将无分类器引导比例设置为 1.0

占用率预测变体。为了便于与其他占用率预测工作[68, 86]进行比较,

将占用率生成模型改编为生成式预测模型,该模型基于条件帧预测 Tf 未来的帧。具体来说,在训练阶段,条件占用率潜在帧直接与 BEV 布局相连接,不添加噪声。然后将 Tc Tf 帧的统一潜在标记输入到 DiT 主干网络中,遵循与生成模型相同的流程。模型输出 Tc Tf 帧的去噪占用率潜在帧,但仅在 Tf 帧上计算损失。在推理阶段, Tf 帧用纯噪声初始化,而 Tc 帧则用从占用率 VAE 中采样的条件占用率潜在值初始化。未来占用率帧数 Tf 设为 6,以与先前的工作[68, 86]保持一致。为了提高计算效率并减少对条件帧的依赖,我们将 Tc 设为 1 Tc 设为 2,而不是像先前的工作[68, 86]那样设为 Tc = 5。预测模型的结果在表 12 中给出。从表中我们可以看出,我们的方法在不同的时间范围(1 秒、2 秒、3 秒)内均有效超越了其他工作,这表明我们的方法在生成准确且一致的占用率方面是有效的。此外,我们在图 11 中展示了 Occupancy DiT 的可扩展性,以证明我们所提出方法的潜力。随着计算资源的增加,性能稳步提升,这表明该模型能够利用更多的计算资源来获得更好的结果,正如 [47] 中所讨论的那样。

C.3. 视频生成模型

如图 12 所示,视频生成模型将视频潜在表示与占用网格和文本提示相结合来引导视频生成。VAE 编码器提取视频潜在特征,这些特征与噪声结合后通过扩散 UNet

稳定视频扩散的预备知识。稳定视频扩散(SVD[6] 是一种专门用于图像到视频(I2V)生成的潜在扩散模型。为了提高采样灵活性,SVD 采用了连续时间步长的公式。该模型通过扩散过程将数据样本 x 转换为噪声 n,其中 pn|x) 遵循高斯分布 Nx, σ²I)。然后通过逐步从高斯噪声中去除噪声来生成新的样本,直到 σ0 = 0SVD 通过处理一系列带有噪声的潜在表示来生成视频,生成过程由条件图像引导。该图像的潜在表示按通道方式与输入相连接,作为内容创建的参考。

高斯点阵的预备知识。高斯点阵 [25] 方法定义了一组三维高斯基元,记为 G = {Gi}N

i = 1,其中每个基本元素 Gi 包含

位置属性 µi颜色 ci不透明度 αi旋转矩阵 Ri 以及缩放矩阵 Si相关的 3D 协方差

12. 视频生成模型的架构,该模型将视频潜在表示与文本提示相结合以引导视频生成。VAE 编码器提取视频潜在特征,这些特征与噪声结合后通过扩散 UNet。扩散 UNet 采用交叉注意力机制来整合文本引导并优化潜在表示。占用网格作为生成深度图和语义图的基础,它们为视频生成过程提供指导。VAE 解码器从去噪后的潜在特征中重建视频,生成由输入提示引导的真实输出。

每个基本元素的矩阵 Σi 推导如下:

当通过观察变换 W 进行变换时,坐标

在相机坐标系中的方差矩阵 Σi 计算方式如下:

其中 J 是射影变换仿射近似值的雅可比矩阵。此过程会得出一个 2×2 的协方差矩阵,这与之前的工作[25]一致。对于给定的投影 3D 高斯中心 µR2×1 和相机坐标系中的点 xR2×1 ,投影的 2D 高斯不透明度 αof 表示为:

累积颜色图 C 是通过基于瓦片的光栅化获得的:

基于高斯的联合渲染。在这项工作中,为了生成深度和语义图,我们首先将输入的语义占用网格(维度为 RH×W×D)转换为一组 3D 高斯基元 G。每个基元 Gi 都被分配了一个额外的属性:语义标签 si每个 3D 高斯的位置通过中心进行初始化。

13 展示了 LiDAR 生成模型的架构,该模型集成了 LiDAR 稀疏 UNet 和先验引导采样机制。LiDAR 稀疏 UNet 处理输入的占用数据以提取空间特征,而先验引导采样则基于空间结构沿光线进行采样以生成 LiDAR 点。LiDAR 头部采用加权求和和多层感知器(MLP)模块来计算 LiDAR 点的强度、光线丢弃概率以及最终位置。该过程包括为生成的 LiDAR 点特征分配权重,通过 MLP 进行细化,并聚合结果以生成具有真实点分布的高质量 LiDAR 输出。

对于对应的占用栅格单元,其比例根据栅格单元的大小进行设置,其语义属性则用该栅格单元的语义标签进行初始化。为了提高二维条件的有效性,我们渲染与相机视角对齐的深度图和语义图。具体来说,给定语义标签 si 和深度值 di,深度图 D 和语义图 S 的渲染方式类似于颜色渲染:

正如主论文第 3.2 节所讨论的,我们引入了一个受 ControlNet [84] 启发的编码器分支来对渲染图进行条件设置。这种条件设置的具体细节如图 12 所示。编码器分支由两个模块组成,分别用于深度图条件设置和语义图条件设置,其架构相似。每个条件设置模块都包含两个 ResNet 块,后面跟着一个零卷积,这是 ControlNet [84] 所推荐的,以保持扩散模型的原始功能。

C.4. 激光雷达生成模型

如图 13 所示,激光雷达生成模型由激光雷达稀疏 UNet 和先验引导采样组成。

机制。LiDAR 稀疏 UNet 处理输入的占用数据以提取空间特征,而先验引导采样机制则根据空间结构沿射线采样生成 LiDAR 点。LiDAR 头部利用加权求和和多层感知器(MLP)模块来计算 LiDAR 点的强度、射线丢失概率和最终位置。此过程包括为生成的 LiDAR 点特征分配权重,通过 MLP 对这些特征进行细化,并聚合结果以生成具有真实点分布的高质量 LiDAR 输出。

具体来说,对于激光雷达射线上的 n 个点,第 i 个点的特征 ui 从具有基于占用率的先验引导的激光雷达稀疏 UNet 输出中采样。然后将该特征输入到多层感知机(MLP)中以预测对应的有符号距离函数(SDF)值。接着计算该点的权重 wi,并根据主论文中的公式 8 和公式 9 确定生成的激光雷达点的射线深度 di。此外,通过使用所有点各自的权重对射线上的所有点的特征进行加权求和来获取射线特征 vr,即

最后, vr 通过另一个多层感知器(MLP)来同时预测激光雷达射线的强度和衰减概率。

D. 数据集

NuScenes 基准数据集 [9] 在自动驾驶研究中被广泛使用。为了丰富该数据集的详细标注信息,NuScenes-Occupancy 数据集 [62] 引入了密集的语义占用标签。该数据集涵盖了 850 个场景的全面激光雷达扫描数据,包含 34,000 个关键帧,帧率为 2Hz,每个关键帧都标注了 17 个语义类别之一。依照 [62] 中描述的方法,我们的研究将 28,130 帧分配给训练集,6,019 帧分配给验证集。

然而,仅 2Hz 的数据无法满足我们的需求。为了提升结果并确保与先前的研究[15, 55, 66, 71, 85]进行公平的比较,我们进一步将其扩展为 12Hz 的数据。具体来说,我们利用 ASAP[61] 中插值的 12Hz 标注以及 NuScenes 数据集中的 LiDAR 数据来生成 12Hz 的语义占用标签。我们首先通过将整个场景中的 LiDAR 点进行拼接来开始生成 12Hz 的占用标签,遵循[69]中概述的方法。接下来,我们使用 NKSR 算法[22]重建驾驶场景的网格。然后,我们提取网格的顶点,并根据 NuScenes[9] 中的 LiDARseg 标签以及 ASAP[61] 中的 12Hz 标注信息为这

些顶点分配语义标签。最后,我们将网格顶点及其语义标签转换为语义占用数据。

E. 评估指标

为了评估占用率生成的保真度,我们采用 F3D 指标和最大均值差异(MMD)作为评估标准,正如文献[39]所述。F3D 是二维 Frechet Inception 距离(FID)在三维空间中的扩展,利用了预训练的占用率自动编码器。MMD 则是在该自动编码器的特征空间中计算得出。鉴于生成过程使用了鸟瞰图布局,我们采用平均交并比(mIoU)来评估生成输出的准确性。对于占用率预测,我们同时报告 IoU mIoU,这与先前的研究[86]保持一致。对于视频生成的评估,我们采用 FID Frechet 视频距离(FVD)来衡量生成内容的质量,这与先前的研究[20, 58]保持一致。对于 LiDAR 数据生成的评估,我们采用 Jensen-Shannon 散度(JSD)和 MMD,遵循 LiDARDM [91] 的做法。

对于语义占用预测(SOP)的下游感知任务,我们采用 mIoU IoU 作为评估指标,沿用先前的研究 [11, 31]。对于鸟瞰图(BEV)分割,我们以 CVT [87] 作为基准模型,并参照 [15] 中的方法评估道路和车辆类别的 mIoU。对于 3D 物体检测,我们采用 BEVFusion [40] 作为基准模型,并使用平均精度均值(mAP)和 NuScenes 检测得分(NDS)来衡量性能,这与 [15] 中的做法一致。

F. 模型设置

UniScene 框架在 NVIDIA A100 GPU 上使用 PyTorch 实现了两阶段的训练过程。首先,使用真实标签训练占用率生成模型。随后,固定占用率生成模型,从鸟瞰图生成占用率网格,同时联合训练视频和激光雷达生成模型,训练条件基于占用率。

占用率生成模型首先使用批量大小为 16 AdamW 优化器进行训练。训练期间占用率帧的数量固定为 8。对于占用率 VAE,可学习的类别嵌入 Cis 设置为 8,参考 [86]。学习率设置为 1 ×103,训练 200 个周期。对于占用率 DiT,扩散变换器模型基于 [48],学习率为 1 ×104,训练 600 个周期。

在第二阶段,视频生成模型和激光雷达生成模型联合训练 90 个周期,总批处理大小为 96,初始学习率为 1 ×105 。视频生成模型使用来自 SVD [6] 的预训练权重进行初始化,固定视频 VAE。训练时图像分辨率为 256×512(遵循 [70]),帧数固定为 8。注意14 展示了分布外(OOD)占用率生成的可视化效果,突显了模型在未知场景中进行泛化并生成逼真占用率输出的能力。上排显示生成的 3D 占用率网格,下排则展示了对应的鸟瞰图布局,强调了在 OOD 情况下结构和语义一致性的保持。

15. 几何感知噪声先验效果的可视化。我们的方法在采样过程中注入了密集的外观先验,并结合了明确的几何感知,从而在不同帧中生成了高保真且一致的移动汽车。

我们在采样过程中采用 [16] 中的展开采样策略,以实现长期生成。激光雷达生成模型从头开始训练。训练过程中使用 AdamW 优化器。

G. 比较基准

该占用生成方法与 OccLlama [68]OccWorld [86] OccSora [59] 进行了比较。OccWorld 依靠历史占用数据和自身车辆的轨迹来预测未来的占用情况。在此基础上,OccLlama 引入

 

了大型语言模型(LLM)来解读语义场景,从而提高了预测的准确性。

我们将视频生成结果与其他图像和视频生成方法进行了比较,包括 BEVGen [55]BEVControl [80]DriveGAN [27]DriveDreamer [85]WoVoGen [41]Panacea [70]MagicDrive [15]Drive-WM [66]Vista [16]。正如主论文第 4.1 节所述,Vista [16] 的初始模型仅支持单视角视频生成。因此,我们按照 [15, 72] 的方法实现了带有时空注意力机制的 Vista 的多视角变体 Vista*,以进行公平比较。

将激光雷达生成的结果与 Open3D [89] LiDARDM [91] 进行了比较。Open3D 采用硬射线投射函数从占用网格生成激光雷达点云。此过程涉及将占用网格转换为网格,其中每个被占用的体素都表示为一个立方体。射线深度通过计算射线与网格最近三角形面的交点来确定。请注意,此方法不提供强度值或射线丢失概率。LiDARDM 通过聚合多帧点云并使用 3D 物体检测标签移除动态物体来开始生成过程。剩余的数据用于通过 NKSR 算法 [22] 重建网格。使用此网格作为 3D 表示,并以 BEV 布局作为条件训练网格扩散模型。在推理过程中,根据 BEV 布局图从扩散模型中采样网格。然后根据相应帧的检测标签将从预定义资产中选择的动态物体的网格模型插入生成的网格中。最后应用硬射线投射以获取点云。与 Open3D 类似,LiDARDM 不会生成强度值,并且需要一个额外的网络来预测光线丢失的概率。

H. 更多可视化结果

分布外占用率生成。为了进一步说明我们占用率生成模型强大的泛化能力和可控性,我们展示了分布外(OOD)占用率生成的结果,如图 14 所示。这些可视化结果表明,该模型能够在之前未见过的场景中生成逼真的占用率输出,同时在分布外的情况下保持结构和语义的一致性。

在其他自动驾驶数据集上的泛化能力。如图 19 所示,我们在 Waymo nuPlan 数据集上评估了我们模型的泛化能力。给定场景布局,我们的模型可以借助条件参考图像直接迁移到不同的数据集。请注意,由于 Waymo 数据集不可用,其后视图被设为空。

对几何感知噪声先验的影响。正如主论文第 3.2 节所述,几何感知噪声先验

16. 不同配置下激光雷达束扫描模式的可视化。真实情况采用 32 束激光雷达设置,而所提出的方法(我们的 16 我们的 32 我们的 64 )展示了不同程度的束密度。该对比突出了模型在不同束分辨率下模拟真实激光雷达模式和保持场景几何形状的能力。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐