0. 简介

本文介绍了BEVPlace++,一种新颖、快速且稳健的激光雷达全局定位方法,专为无人地面车辆设计。该方法利用轻量级卷积神经网络(CNN)在激光雷达数据的鸟瞰图(BEV)图像表示上进行处理,通过地点识别实现准确的全球定位,随后进行三自由度(3-DoF)姿态估计。我们的详细分析揭示了一个有趣的事实:CNN在从激光雷达BEV图像中提取独特特征方面具有内在的有效性。值得注意的是,两个具有大平移的BEV图像的关键点可以有效地使用CNN提取的特征进行匹配。基于这一洞察,我们设计了一个旋转等变模块(REM),以获取独特特征,同时增强对旋转变化的鲁棒性。随后,通过级联REM和描述符生成器NetVLAD,开发了一个旋转等变和不变网络(REIN),以顺序生成旋转等变的局部特征和旋转不变的全局描述符。全局描述符首先用于实现稳健的地点识别,而局部特征则用于准确的姿态估计。源代码已经在Github上公开。

1. 主要贡献

总结而言,本工作的贡献主要体现在五个方面:

• 我们提出了BEVPlace++,这是一个完整的全球定位框架,利用简单而有效的BEV点云表示进行地点识别和姿态估计。

• 我们详细分析了卷积神经网络(CNN)的平移等变性如何促进BEV图像匹配。我们的BEVPlace++能够准确对齐具有较大平移差异的BEV图像,利用CNN特征,并有效适应新的、未见过的环境。

• 我们提出了一种新颖的旋转等变和不变网络(REIN),该网络由轻量级CNN模块和NetVLAD构成。它帮助BEVPlace++在显著的旋转视角变化下实现稳健的地点识别和姿态估计。

• 我们在五个不同的公共数据集上进行了全面的实验,这些数据集涵盖了不同的日期、年份、环境和激光雷达扫描仪类型。我们的结果表明,BEVPlace++在多个任务中实现了最先进的性能,包括地点识别、回环闭合、全球定位和SLAM。

• 我们开源了BEVPlace++的简洁Python API,为机器人社区做出了贡献。BEVPlace++是我们之前会议论文BEVPlace [30] 的扩展。BEVPlace利用组卷积从BEV图像中提取旋转等变的局部特征,并通过全局描述符匹配实现地点识别。与BEVPlace相比,BEVPlace++在四个关键方面进行了扩展:1)一种新颖的REIN网络,具有更快且更轻量的旋转等变和不变特征编码器;2)对CNN特征的旋转和平移等变性进行了更深入的分析;3)一个完整的姿态估计器,用于实现3自由度姿态的全球定位;4)在各种数据集上进行了更广泛和全面的实验评估,展示了在地点识别、回环闭合检测和完整全球定位方面的卓越性能。

2. 基于鸟瞰图的全局定位流程

我们的方法使用鸟瞰图(BEV)图像作为激光雷达数据的中间表示,以执行全局定位。如图2所示,我们将点云投影到BEV视图中,并利用旋转等变和不变网络(REIN)提取独特的局部和全局描述符。然后,我们采用两阶段的定位范式,即先进行地点识别,再进行姿态估计。在地点识别中,我们利用全局描述符进行地点检索,并从预构建的数据库中找到最匹配的BEV图像。在姿态估计中,我们利用局部描述符,通过RANSAC估计查询与匹配的BEV图像对之间的相对姿态。查询的全局姿态最终计算为匹配帧的存储姿态与相对姿态的组合。接下来,我们首先解释BEV图像生成过程,然后简要描述所提出的REIN网络。最后,我们详细阐述我们提出的两阶段定位推理流程。


在这里插入图片描述

图2. 基于BEV图像的全局定位流程。给定一个查询点云,我们生成其BEV图像,并依次提取局部和全局描述符。全局描述符用于从预构建的数据库中检索最相似的BEV图像。局部描述符则被重复利用以进行RANSAC姿态估计。查询的全局姿态是通过匹配的BEV姿态与相对姿态的组合来计算的。

3. 鸟瞰图表示

遵循现有的3自由度定位工作[35]、[16]、[56],我们假设当地面车辆在局部区域内移动时,它是在一个粗糙的平面上行驶。基于这一假设,我们通过正交投影生成BEV图像,并专注于估计3自由度的姿态,包括(x,y,yaw)。虽然(z,pitch,roll)也可以从匹配帧的存储姿态中推导出来,但它们并不是本文的主要关注点。BEV图像表示在我们分层定位系统的许多方面显示出优势。在地点识别中,BEV图像提供了道路元素分布的全面视图。因此,从这样的图像中提取全局描述符以描绘场景的结构信息更加直观和稳定。在姿态估计的背景下,通过解决BEV图像匹配问题来估计BEV图像对的变换,这一过程快速且高效,因为轻量级的BEV表示使得计算更加简便。轻量级的BEV表示也有利于存储资源的利用,这对于实际应用和多机器人通信至关重要。

我们使用归一化点密度来构建BEV图像[52]。设 P = { P i ∣ i = 1 , . . . , N p } P = \{P_i|i = 1,...,N_p\} P={Pi​∣i=1,...,Np​}表示由激光雷达点 P i = ( x i , y i , z i ) P_i = (x_i,y_i,z_i) Pi​=(xi​,yi​,zi​)形成的点云,总共有 N p N_p Np​个点。我们使用右手笛卡尔坐标系,其中 x x x轴指向右侧, y y y轴指向前方, z z z轴指向上方, x − y x-y x−y平面为地面平面。对于点云 P P P,我们首先使用体素网格滤波器,leaf大小为 g g g米,以均匀分布点。然后,我们将地面平面离散化为分辨率为 g g g米的网格。考虑一个以坐标原点为中心的 [ − D m , D m ] [−D m ,D m] [−Dm,Dm]立方窗口,BEV图像 I ( u , v ) I(u,v) I(u,v)可以视为大小为 ⌈ 2 D g ⌉ × ⌈ 2 D g ⌉ \lceil \frac{2D}{g} \rceil \times \lceil \frac{2D}{g} \rceil ⌈g2D​⌉×⌈g2D​⌉的矩阵。BEV像素值 I ( u , v ) I(u,v) I(u,v)被计算为归一化点密度。

I ( u , v ) = min ⁡ ( N g , N m ) N m , ( 1 ) I(u, v) = \frac{\min(N_g, N_m)}{N_m}, \quad (1) I(u,v)=Nm​min(Ng​,Nm​)​,(1)

其中, N g N_g Ng​表示位置 ( u , v ) (u, v) (u,v)处网格中的点数, N m N_m Nm​为归一化因子。 N m N_m Nm​被设定为点云密度的最大值。与传统的BEV图像(也称为高程图[34]、[35])不同,后者在每个箱体中存储点的最大高度,我们使用的是点密度。这是因为高程图对传感器的方向非常敏感,记录的最大高度会随着扫描仪与物体之间的距离而变化。另一方面,扫描在表面上的点的密度对视点变化的敏感性较低[52]、[57]。


4. 旋转等变与不变网络

我们提出了一种新颖的旋转等变不变网络(REIN),通过设计的旋转等变模块(REM)提取鸟瞰图(BEV)图像的局部特征,并利用NetVLAD [27] 生成不变的全局描述符。给定一个查询的BEV图像 I q ∈ R H × W I_q \in \mathbb{R}^{H \times W} Iq​∈RH×W,REM 生成一个特征图 F ∈ R H ′ × W ′ × C F \in \mathbb{R}^{H' \times W' \times C} F∈RH′×W′×C,其中 $H’ 、 、 、W’$ 和 C C C 分别表示高度、宽度和特征通道。由于REM的输出特征图相较于原始图像尺寸进行了下采样,我们使用双线性插值对特征图进行上采样,以便为在BEV图像中检测到的关键点分配描述符。这些局部描述符首先通过NetVLAD聚合,生成一个全局描述符 $V \in \mathbb{R}^{K \times C} $用于地点识别,其中 K K K是NetVLAD中的聚类数量。这些局部描述符也将在姿态估计中重复使用。我们将在下面介绍REIN的设计。

4.1 旋转等变与不变网络

本节详细介绍我们的旋转等变与不变网络(REIN)的设计,该网络包括一个特征编码器,用于生成局部特征,以及一个池化层,用于将这些局部特征聚合为全局描述符。我们首先强调我们的发现,即现代卷积网络在平移位移下能够有效地作为鸟瞰图(BEV)图像的独特特征编码器。接着,我们引入了一种新颖的旋转等变模块(REM),以提取局部特征,从而实现对旋转视角变化的鲁棒性。基于旋转等变的局部特征,我们展示了通过NetVLAD池化的全局描述符是旋转不变的。最后,我们详细阐述了网络的训练策略。

4.2 通过CNN生成BEV特征

在这里,我们提供了详细的统计分析,证明现代卷积神经网络(CNN)可以作为具有平移运动的BEV图像的独特特征提取器。为清晰起见,我们将特征提取过程表示为

F = ϕ ( I ) , (7) F = \phi(I), \tag{7} F=ϕ(I),(7)

其中特征 F ∈ R H × W × C F \in \mathbb{R}^{H \times W \times C} F∈RH×W×C 是通过特征提取器 ϕ \phi ϕ 从BEV图像 I ∈ R H × W I \in \mathbb{R}^{H \times W} I∈RH×W 中提取的。我们将位于坐标 ( u , v ) (u,v) (u,v) 的关键点特征表示为 f u , v ∈ R C f_{u,v} \in \mathbb{R}^C fu,v​∈RC,它也表示在 F F F 中位于第 u u u 行和第 v v v 列的元素,具有 C C C 个通道。

4.2.1 来自CNN的独特BEV特征

我们研究特征的变化,以验证来自CNN提取器的BEV特征的独特性。对于在我们设计的LiDAR BEV图像上提取的每个关键点特征 f u , v f_{u,v} fu,v​,我们计算其与邻近特征的欧几里得距离:

d ( f u , v , f u + δ u , v + δ v ) = ∣ ∣ f u , v − f u + δ u , v + δ v ∣ ∣ 2 , (8) d(f_{u,v}, f_{u+\delta u, v+\delta v}) = ||f_{u,v} - f_{u+\delta u, v+\delta v}||_2, \tag{8} d(fu,v​,fu+δu,v+δv​)=∣∣fu,v​−fu+δu,v+δv​∣∣2​,(8)

其中 δ u , δ v \delta u, \delta v δu,δv 是平移位移。图3(a)、(b)和(c)展示了从流行的CNN ResNet [26] 提取的特定特征的特征距离分布示例,预训练模型由PyTorch提供。我们计算了图(a)中显示的关键点特征相对于所有其他像素的特征距离,并在(b)中呈现了特征距离热图。此外,(c)展示了沿着(b)中红色扫描线的数值特征距离变化。如图所示,即使没有微调,随着平移位移的增加,BEV特征距离也在增加,表明其固有的独特性。我们进一步绘制了不同CNN骨干网络(包括ResNet34 [26]、VGG16 [59] 和 EfficientNet [60])在不同数据集(如KITTI [61]、NCLT [62] 和 MCD [63])上相对于平移位移的平均特征距离,如图3(e)、(f)和(g)所示。这些数据集包括由各种类型的LiDAR扫描仪收集的点云,具有不同的视场和稀疏性水平,覆盖多种环境。
在这里插入图片描述

图3. 统计分析:不同CNN架构和数据集下,关于平移位移的BEV特征距离分布。(a) 在BEV图像上用红色三角形突出显示的关键点。(b) 相对于所有其他像素的特征距离热图。© (b)中红色扫描线沿线的特征距离变化。(d) 使用ResNet34作为特征提取器,关于平移位移( δ u = δ v δu=δv δu=δv)的平均特征距离分布。(e) 使用VGG16的平均特征距离分布。(f) 使用EfficientNet的平均特征距离分布。

可以看出,空间上接近的特征表现出较小的特征距离,而远离的特征则显示出较大的特征距离,无论数据集设置或使用的CNN骨干网络如何,这可以表述为:

d ( f u , v , f u + δ u 1 , v + δ v 1 ) < d ( f u , v , f u + δ u 2 , v + δ v 2 ) , d(f_{u,v}, f_{u+\delta u_1, v+\delta v_1}) < d(f_{u,v}, f_{u+\delta u_2, v+\delta v_2}), \quad d(fu,v​,fu+δu1​,v+δv1​​)<d(fu,v​,fu+δu2​,v+δv2​​),

for ∣ ∣ ( δ u 1 , δ v 1 ) ∣ ∣ < ∣ ∣ ( δ u 2 , δ v 2 ) ∣ ∣ . (9) \text{for} \quad ||(\delta u_1, \delta v_1)|| < ||(\delta u_2, \delta v_2)||. \tag{9} for∣∣(δu1​,δv1​)∣∣<∣∣(δu2​,δv2​)∣∣.(9)

这种固有的独特性表明,深度BEV特征能够捕捉和表示BEV图像中的独特模式。这种特性对于准确估计姿态至关重要,因为它们有助于区分不同的关键点,并确保它们的空间关系得以保持。

4.2.2 与独特特征的匹配

由于卷积操作中固有的局部连接性和权重共享,CNN展示了平移等变性[64](在边缘效应的影响下)。给定一个通过平移运动从 I I I获得的BEV图像 I ′ I' I′,在 I ′ I' I′中的关键点特征 f u ′ , v ′ ′ f'_{u',v'} fu′,v′′​理想情况下应与 I I I中其位置对应的特征 f u , v f_{u,v} fu,v​相同。根据公式(9),这种对应关系应是唯一的,即:

d ( f u ′ , v ′ ′ , f u , v ) < d ( f u ′ , v ′ ′ , f u + δ u , v + δ v ) , d(f'_{u',v'}, f_{u,v}) < d(f'_{u',v'}, f_{u+\delta u, v+\delta v}), d(fu′,v′′​,fu,v​)<d(fu′,v′′​,fu+δu,v+δv​),

f o r ∣ ∣ ( δ u , δ v ) ∣ ∣ > 0 (10) for ||(δu, δv)|| > 0 \tag{10} for∣∣(δu,δv)∣∣>0(10)

…详情请参照古月居

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐