多传感器融合基础之六鸟瞰图空间(BEV Space)全面解析
多传感器融合基础之六鸟瞰图空间(BEV Space)全面解析
鸟瞰图空间(Bird’s Eye View Space,简称 BEV 空间)是多传感器融合体系中最具“工程智慧”的测量空间之一。它并非由某种传感器直接原生输出,而是从图像、点云、深度图或雷达检测等原始测量空间中经过精心设计的数学变换派生而来的表示层。用最直观的话说,BEV 空间就是“从正上方俯视场景的一张特征地图”——它将三维世界中分布在自车周围各个高度上的物体和道路元素,压缩或投影到一个覆盖一定范围的水平网格上,使得感知系统可以在一张规整的二维图上同时看到前方的车辆、侧方的行人、后方的障碍物、地面的车道线和远处的交通标志,而不需要像在透视图中那样被近大远小的投影变形所困扰,也不需要像在三维点云中那样被稀疏性和无序性所困扰。在自动驾驶的感知架构中,BEV 空间的兴起代表着一次从“传感器视角”到“场景统一视角”的认识论跃迁,它将来自不同传感器、不同安装位置、不同投影模型的信息统一到了同一个以自车为中心的地面参考系中,为下游的检测、跟踪、预测和规划提供了极为便利的几何基础。

相关内容可以看我的其他文章:
1.多传感器融合基础之一图像空间(Image Space)全面解析_像素矩阵 hwc-CSDN博客
2.多传感器融合基础之二深度图空间(Depth Map Space)全面解析-CSDN博客
3.多传感器融合基础之三点云空间(Point Cloud Space)全面解析-CSDN博客
4.多传感器融合基础之四雷达检测空间(Radar Detection Space)全面解析-CSDN博客
5.多传感器融合基础之五体素空间(Voxel Space)全面解析-CSDN博客
一、基本定义与数学表示
鸟瞰图空间在数学上可以定义为一个定义在俯视平面上的二维向量场或特征图
。这里 x 和 y 是地面平面上的连续坐标(通常以米为单位),而定义域 是一个以自车为中心(或以自车后轴中心为原点)的矩形区域,例如纵向覆盖前方 100 米、后方 30 米,横向覆盖左右各 30 米。在实际实现中,这个连续平面被离散化为一个二维网格,网格的分辨率通常在 0.1 米到 0.5 米之间,形成
个单元格。每个单元格 (i,j) 携带一个 C 维的特征向量,这 C 个通道可以编码该地面位置上的丰富信息:可能包括该处是否存在物体、物体的类别分布、三维边界框的回归参数、速度向量、占据概率、高度统计量(如该列空间中的最高点和最低点)、甚至是融合自图像卷积网络的深度视觉特征。
与图像空间最根本的区别在于,BEV 空间的坐标轴是物理世界中的真实尺度坐标,而不是像素索引。图像中的 (u,v) 坐标代表了相机传感器平面上的行列位置,其几何意义依赖于相机内参和该像素对应的场景深度,同一物体在图像中的大小和位置会随距离的变化而剧烈变化。BEV 空间中的 (x,y) 坐标则直接对应于地面上的物理位置——5 米外的一辆车,在 BEV 网格中永远落在以自车为原点、前方 5 米的位置,无论这辆车是大是小,是近是远,它在 BEV 空间中的占据区域都与其真实的物理尺寸成正比。这种尺度一致性是 BEV 空间最核心的几何优势:它消除了透视投影带来的尺寸模糊和位置压缩,使得物体之间的相对位置关系和绝对大小都变得可以直接从坐标中读出。
与体素空间相比,BEV 空间可以看作是体素空间沿高度方向(Z 轴)进行了压缩或“拍平”操作后的结果。三维体素网格在高度维度上保留了全部信息——体素的高度分布、各层的占据状态等——而 BEV 空间将高度维度从空间坐标轴转化为特征通道。举例来说,一个 BEV 单元格可能不存储“在高度 1.2 米处有一个体素”,而是存储“该列点云的最高点高度为 2.1 米、最低点高度为 0 米、高度分布直方图的前五个分量为……”。通过这种方式,BEV 在保留一定高度信息的同时将空间表示从三维降为二维,大幅降低了存储和计算开销,同时依然保持了场景在水平面上的完整几何关系。这种“降维不丢失关键信息”的特质,使 BEV 成为自动驾驶感知中性价比最高的统一表示之一。
二、维度:二维空间与多维特征的结合
BEV 空间的维度属性带有一种巧妙的混合性:它仅有两个显式的空间自由度——纵向 x 和横向 y——但通过特征通道维度 C 来隐式地承载高度方向的信息以及多模态的语义信息。从空间自由度的角度看,BEV 空间是一个二维平面,这意味着它不能像三维体素那样表达物体在垂直方向上的精细结构——它无法区分一座天桥和一辆停在路面的卡车,因为两者可能在地面投影上占据相同的位置。这是 BEV 空间的固有限制,也是它必须依赖体素空间或点云空间来辅助垂直方向感知的原因。
但从信息承载的角度看,BEV 的通道维度 C 可以非常深。在典型的 BEV 感知网络中,每个 BEV 网格单元的特征向量可能是从图像骨干网络提取的 256 维或 512 维特征,加上从点云支柱特征中得到的几十维几何统计量,再加上从雷达检测点聚合的速度信息,全部拼接在一起。这些高维特征向量并不直接对应某个物理量,而是被训练为神经网络隐式编码该地面位置上的“潜在几何与语义信息”。网络在训练过程中自动学会了将高度、形状、类别、运动状态等信息编码到这些通道中,使得 BEV 空间在信息丰富度上并不逊色于体素空间,而空间维度却降低了一维。
这种“2D 空间 + 高维通道”的结构与图像空间“2D 空间 + 多通道”在形式上完全相同,这也是为什么许多为图像设计的 2D 卷积网络架构(如 ResNet、FPN、Transformer)可以被直接移植到 BEV 空间中使用的原因。然而,两者通道的语义截然不同:图像通道携带的是局部窗口内的颜色和纹理信息,而 BEV 通道携带的是经过空间变换和融合后的场景级几何与语义特征。这使得 BEV 空间的特征天然更接近“物体在哪里、它有多大、它在往哪走”的物理描述,而图像空间的特征更接近“这个区域看起来像什么”的外观描述。
三、数据结构:规则的二维特征地图
BEV 空间在计算机中的存储形式极为规整——一个 的四维张量(遵循深度学习框架的通道优先惯例),或者等价地理解为一个
的网格,每个格子存储一个 C 维特征向量。这种数据结构与图像的特征图完全同构,因此可以直接被标准的 2D 卷积层、池化层、上采样层和 Transformer 编码器处理,无需任何特殊算子。这一特性带来的工程红利是不可估量的:所有为 2D 特征图开发的硬件加速库(如 cuDNN 的 2D 卷积优化、TensorRT 的算子融合)都可以零成本地应用于 BEV 特征处理,使得 BEV 感知模型的推理速度可以远超同等输入规模的三维体素模型。
在 BEV 网格的分辨率选择上,存在精度与效率的经典权衡。0.1 米分辨率的 BEV 网格在 100 米 × 100 米的覆盖范围下将产生 1000 × 1000 的网格,达到一百万个单元格,每个单元格存储 256 维特征时,单帧 BEV 特征图将占用约 1 GB 的显存。0.5 米分辨率则将网格缩小到 200 × 200,仅 4 万个单元格,特征图内存降至约 40 MB。实际的自动驾驶系统通常采用 0.2 米到 0.4 米的分辨率,并在检测头中对不同尺寸的物体采用不同分辨率的特征层级(FPN 的多尺度策略)。这种分辨率选择反映了 BEV 空间作为一种工程化感知表示的本质:它并不追求毫米级的几何精度(那是点云和深度图的任务),而是追求在合理的计算预算内,为检测和规划提供足够可靠的空间位置和类别信息。
四、信息的密度与稀疏性:从稀疏观测到稠密特征
BEV 空间在信息密度上经历了一次令人瞩目的转化:它的输入可能是极度稀疏的——激光雷达点云在 BEV 网格中的投影可能只有不到 10% 的单元格包含有效点,视觉深度估计或特征提升得到的 BEV 特征可能在某些区域由于遮挡或距离过远而缺乏可靠观测——但经过神经网络的编码和传播后,输出的 BEV 特征图往往是近乎完全稠密的。每一个 BEV 单元格,无论它是否被任何传感器直接观测到,都会经过卷积或自注意力操作从其相邻单元格和自身的历史状态中聚合信息,从而被赋予一个推断出的特征向量。这种“稀疏输入、稠密输出”的特性是 BEV 空间作为神经表示层的关键能力之一。
以一个具体的例子来说明。在自车正后方,单帧激光雷达可能完全没有点(因为车尾传感器的盲区),相机由于朝向限制也看不到后方,因此该方向的 BEV 输入可能是全零。但通过时序融合——将前一帧(当时自车后方还在传感器视野内)的 BEV 特征通过自车运动补偿变换到当前帧的坐标系中——当前帧的 BEV 特征图就可以在后方区域“回忆”起之前观测到的车辆或障碍物。这种基于运动补偿的时序特征传播使得 BEV 空间具有了一种“记忆”能力,能够在传感器直接观测缺失时依然维持对场景的空间理解。这与人类司机在变道时短暂看后视镜后记住后方车辆位置的行为有着异曲同工之妙。
相较于图像空间的全稠密和雷达检测空间的极度稀疏,BEV 空间处于一个独特的中间状态:它在特征层面追求稠密(全空间覆盖的场景表征),但在观测源头接受稀疏。这种信息密度上的弹性使得 BEV 能够以优雅的方式处理传感器的遮挡、盲区和失效,在多传感器融合中扮演“信息补全与统一”的角色。
五、采集方式:从多源传感器到统一平面的变换之旅
BEV 空间作为一个派生表示层,其“采集”实际上是通过一系列几何和数据驱动的变换将其他测量空间的信息映射到俯视平面上。这个变换过程是 BEV 感知的核心技术所在,也是区分不同 BEV 方案的关键标志。当前主流的变换范式可以分为两大类:基于显式几何的投影和基于学习的隐式映射。
从点云生成 BEV 特征是最直接的路径。激光雷达点云已经带有精确的三维坐标,将其变换到以自车为中心的坐标系后,只需忽略高度坐标 z(或将其作为附加特征),将每个点按照其 (x,y) 坐标分配到对应的 BEV 单元格中。每个单元格可以对其接收到的所有点进行统计聚合——计算点数、平均高度、高度方差、最大强度等。
PointPillars 方法是这一思路的经典实践:它将点云在高度方向上划分为若干柱子(pillar),每个柱子内的点通过 PointNet 风格的小型 MLP 提取特征,然后在俯视平面上形成规则的 BEV 特征图。由于点云的坐标是精确的,这种基于几何投影的方法可以保证 BEV 特征与真实世界位置的严格对齐,精度上限受限于点云本身的密度和角分辨率。
从图像生成 BEV 特征则要复杂得多,因为图像缺失了深度维度,而从二维像素到三维空间是一个病态的逆问题。基于显式深度估计的“Lift-Splat”范式是目前应用最广泛的解决方案之一。它的流程分为两步:“Lift”步骤为图像中的每个像素预测一个离散的深度概率分布(例如,在 1 米到 60 米之间划分为若干个深度 bin,网络为每个像素输出其在每个深度 bin 中存在物体的概率),然后将该像素的特征沿着预测的深度方向“提升”到三维空间,形成视锥状的点云特征;“Splat”步骤将这些散布在三维空间中的特征点通过内外参投影“拍落”到 BEV 平面上,对于落入同一个 BEV 单元格的多个特征点进行求和或平均池化。这种方法的几何正确性依赖于深度估计网络的精度——如果深度预测错误,特征就会被放置到错误的 BEV 位置上,导致位置偏移。但由于整个流程是可微的,网络可以通过下游检测损失反向传播来不断优化深度估计和特征提取,实现端到端的学习。
另一条日益重要的技术路径是基于 Transformer 的隐式映射。这类方法放弃了显式的深度估计,而是利用交叉注意力机制让 BEV 网格中的每个单元格“主动查询”图像中的相关区域。具体而言,BEV 网格中的每个单元格首先生成一个查询向量,该查询向量通过自车的外参和内参获得其在世界坐标系中的位置,然后利用相机的内外参计算出该位置在每个相机视野中的大致投影区域。查询向量与这些投影区域内的图像特征计算交叉注意力权重,选择性地从图像中提取与该 BEV 位置相关的视觉信息。这种方法的优雅之处在于它不要求网络显式地预测准确的深度,而是让注意力机制隐式地学习图像特征与 BEV 位置之间的对应关系。在 BEVFormer 等工作中,这种基于注意力的 BEV 特征生成方式在多个自动驾驶数据集上取得了领先的性能,且对深度估计误差具有比显式投影方法更好的鲁棒性。
从毫米波雷达生成 BEV 特征是最为轻量的一环。雷达检测点被变换到车辆坐标系后,直接根据其 (x,y) 坐标分配到 BEV 网格,每个单元格可以存储其内雷达点的平均径向速度、速度方差和 RCS 值。这些速度特征对于 BEV 空间中的动态物体检测和跟踪具有独特的补充价值——它们为“哪个区域有运动物体”提供了来自雷达的直接物理证据,而不需要依赖跨帧运动推断。
六、坐标系统与变换:以自车为中心的度量地图
BEV 空间的坐标系统选择是一个看似简单实则影响深远的架构决策。绝大多数自动驾驶 BEV 系统采用以自车为中心(ego-centric)的坐标系,原点通常设置在自车的后轴中心在地面上的投影点,x 轴指向前方(纵向),y 轴指向左侧(横向)。这个坐标系的根本特征在于它是随着车辆运动而不断移动和旋转的——每帧 BEV 特征图都相对于当前时刻的自车位姿来定义。这与世界坐标系(如 UTM 坐标)中的固定体素地图截然不同:体素地图中的物体位置是绝对的,不随自车运动变化;而 BEV 空间中的物体位置是相对的,当自车前进 10 米时,同一辆静止的路边车辆在 BEV 空间中的坐标就从 (20,5) 变成了 (10,5)。
这种以自车为中心的坐标系选择带来了一个核心工程挑战——时序一致性。当我们要将前一帧的 BEV 特征与当前帧的 BEV 特征进行融合时,由于两帧的坐标系不同(自车移动了),不能直接进行逐单元格的相加或拼接。必须先进行“运动补偿”——利用自车的里程计或 IMU 数据估计出从前一帧到当前帧的刚体变换(旋转+平移),然后对前一帧的 BEV 特征图应用这一变换(通过空间变换网络中的双线性采样实现),将其“对齐”到当前帧的坐标系中。这一步骤是 BEV 时序融合的数学核心,也是许多 BEV 方法工程实现中的关键细节。运动补偿的精度直接影响时序融合的效果——如果自车运动估计有误差,历史特征就会被放到错误的网格位置,不但不能增强检测,反而可能引入干扰。
BEV 网格坐标与物理坐标之间的映射是定义 BEV 空间的基础。设 BEV 网格的分辨率为 Δ 米/格,网格原点(例如左上角)在自车坐标系中的位置为 (x0,y0),则一个自车坐标系中的点 (x,y) 对应的 BEV 网格索引为:
而网格索引 (i,j) 对应的物理坐标为:
这个映射与体素空间的栅格化公式几乎完全相同,只是少了一个高度维度。由于 BEV 分辨率通常在 0.1 米到 0.5 米之间,而目标检测所需的定位精度通常在 0.3 米以内,BEV 网格的量化误差一般是可以接受的。对于需要更高定位精度的任务(如泊车),可以在 BEV 特征图的每个单元格内预测一个亚网格偏移量,将位置精度进一步提升。
七、邻域与拓扑:2D 卷积的完美适配
BEV 空间继承了图像空间最宝贵的遗产——规则的二维邻域拓扑。在 BEV 特征图上,每个单元格的 4-邻域或 8-邻域是固定的,卷积核可以在整张图上平滑滑动,池化层可以规则地降采样,特征金字塔可以自然地构建多尺度表示。这种规则的拓扑结构使得 BEV 空间的处理算法可以直接享用几十年来图像处理和卷积神经网络领域积累的全部技术成果,无需为不规则数据设计特殊算子。
这种规则邻域带来的不仅是计算效率,更是对局部几何关系建模的天然支持。在 BEV 特征图上应用一个 3×3 卷积,网络可以捕捉到目标物体周围的空间上下文——一辆车的周围是否有其他车辆、是否靠近车道线、前后方的间距是否充足。这些局部空间关系对于检测的置信度校准和边界框精修非常关键。更深的卷积网络可以将感受野逐步扩大,从几米到几十米,最终整合整个场景的全局布局信息。这种从局部到全局的层次化空间推理,在 BEV 的规则网格上可以像在图像上一样自然高效地进行。
与点云的图神经网络或 Transformer 相比,BEV 卷积的邻域定义是固定且均匀的。这在大多数情况下是一种优势——场景中的物体在水平面上的分布相对均匀,固定感受野足够捕捉相关上下文。但固定邻域也有局限:对于细长的物体(如一辆加长卡车)或密集排列的物体(如拥堵中的车流),固定窗口可能切割物体的结构,或者混合多个物体的特征。一些先进方法开始将可变形卷积或局部注意力引入 BEV 空间,使得邻域形状可以根据特征内容自适应地调整,兼顾规则网格的效率和非规则邻域的灵活性。
八、表征能力:场景布局的理解者
BEV 空间的表征能力强项集中在对场景水平布局的精确理解上。一旦多传感器信息被成功投影到 BEV 平面,物体的水平位置、朝向、尺寸、相对距离和运动方向就变得一目了然——它们在 BEV 特征图上直接对应于几何上的区域和向量。这种直观的几何对应关系意味着 BEV 空间非常适合作为 3D 目标检测的输出空间:检测头只需在 BEV 特征图的每个单元格预测一个是否存在物体中心的概率、物体三维边界框的尺寸和朝向、以及速度向量,就可以完成对所有方向和距离上物体的检测。与在透视图中做 3D 检测不同——透视图中物体的外观随距离和视角变化极大,检测器必须隐式地学习这些变化的规律——BEV 空间中所有物体无论远近都以同样的比例尺呈现,这大幅简化了检测器的学习负担,提升了远距离检测和跨车型泛化的能力。
BEV 空间对地图元素的表征同样具有得天独厚的优势。车道线、路沿、人行横道、停止线等静态地图要素在地面上沿水平面铺设,在 BEV 空间中表现为清晰可辨的线条和区域。一个在 BEV 特征图上进行的语义分割头可以直接预测每个 BEV 单元格是否属于车道线、道路边缘或可通行区域,不需要处理透视图中车道线在远方的严重收缩和弯曲。这使得 BEV 空间成为在线建图和定位的核心表示——系统可以在 BEV 空间中实时构建局部语义地图,并直接与高精地图进行匹配以校正定位误差。近年来,“无图”或“轻图”自动驾驶方案的兴起,正是依赖于 BEV 空间中实时车道线检测和道路拓扑推理能力的不断提升。
BEV 空间在表征运动信息方面也表现出色。时序融合后的 BEV 特征图本身隐式地携带了物体运动的历史轨迹——同一物体在相邻帧 BEV 特征图中留下的特征痕迹在空间上是连续的,网络可以通过时序卷积或注意力从这些痕迹中学习物体的速度和加速度。在此基础上,BEV 空间可以自然地输出每个检测目标的速度向量,甚至可以进行多模态的轨迹预测——直接以 BEV 特征图为条件,生成自车和周围车辆在未来若干秒内的可能轨迹。这种将检测、跟踪、预测统一在同一 BEV 空间中的能力,使它成为从感知到预测再到规划的端到端自动驾驶架构的理想中间表示。
九、遮挡与视角:统一的俯视视角如何消解透视遮挡
BEV 空间在应对遮挡和视角变化方面具有一种结构性的优势:它提供了一个与传感器安装位置和朝向无关的统一场景视角。在透视图中,自车车头遮挡了前方近地面的区域,A 柱遮挡了斜前方的视野,远方的车被近处的车遮挡,各种遮挡关系交错复杂。在 BEV 空间中,虽然遮挡的信息损失在从传感器数据向 BEV 投影的过程中已经发生(传感器看不到的被遮挡区域,其信息本来就不存在于输入数据中),但 BEV 表示本身不再有“视角”概念——它不区分“从前面看”和“从侧面看”,所有物体和空间都被放置在同一张俯视地图上。这种视角无关性极大地简化了多传感器融合的几何对齐问题:一个被前向相机看到的物体和一个被侧向激光雷达看到的物体,各自经过坐标变换后出现在 BEV 的同一位置,其特征自然地被融合在一起,不需要处理它们在各自原始视角中的外观差异。
然而,BEV 空间并不能从根本上解决遮挡带来的信息缺失。如果一个行人完全被一辆公交车挡住,没有任何传感器能看到他,那么 BEV 空间中该行人的位置将没有任何直接观测信息。BEV 空间能做的是利用时序记忆和上下文推理来“猜测”被遮挡区域的状态——如果前一帧该位置有一个行人,而该行人的运动方向指向遮挡区域后方,那么即使当前帧的观测为空,网络也可能通过时序传播在 BEV 中保留该行人的存在可能性,直到多帧未观测到后才将其淡出。这种基于先验和历史的遮挡推断是 BEV 空间作为神经表示层的高级能力,而不是其几何属性。
BEV 空间在垂直方向上的遮挡问题值得单独讨论。由于 BEV 将高度维度压缩了,它天然无法区分处于同一水平位置但不同高度的物体——天桥和路面在 BEV 中占据相同的单元格。这就是为什么纯 BEV 方案需要额外的垂直感知能力(通常由体素空间或深度图空间的辅助分支提供)来处理高架桥、地下通道和立体交通场景。当前一些先进的 BEV 方案通过引入多高度层的 BEV 特征(如在 0 米、2 米、4 米等多个高度切片上分别生成 BEV 特征)来部分缓解这一限制,实际上是将 BEV 从单一水平面扩展为一组离散的高度层,在保留二维网格优势的同时引入了一定的垂直分辨能力。
十、处理算法:从卷积网络到时序 Transformer 的繁荣生态
BEV 空间的处理算法是当前计算机视觉和自动驾驶领域最为活跃的研究方向之一。由于 BEV 特征图是规则的二维网格,几乎所有在图像处理中卓有成效的架构都可以被迁移过来,并针对 BEV 的物理特性进行改造。
基于卷积的 BEV 检测头是最成熟的经典方案。在 CenterPoint 等工作中,BEV 特征图经过一个二维特征金字塔网络(FPN)提取多尺度特征,然后检测头在每个尺度的每个位置上预测目标中心的存在概率和边界框属性。这种架构简洁高效,推理速度极快(在嵌入式设备上可达 10 ms 以内),在激光雷达点云输入下长期占据自动驾驶 3D 检测的领先地位。对于多传感器融合的 BEV 检测,卷积方案同样表现出色——图像和点云各自生成的 BEV 特征图在通道维度拼接后,由共享的卷积头进行联合检测。
基于 Transformer 的 BEV 检测器代表了近年来的新范式。DETR3D、BEVFormer、PETR 等工作将 BEV 特征图中的每个单元格视为一个查询 token,然后利用交叉注意力从多相机图像特征中自适应地提取信息。这种查询驱动的机制具有很高的灵活性——不同的查询可以关注图像特征图的不同空间位置和不同尺度,网络在训练中学会为每个 BEV 位置找到其在所有相机视野中最相关的图像区域。Transformer 的长程依赖建模能力在 BEV 空间中尤为珍贵:一个大的交叉路口场景中,不同方向的车辆之间存在复杂的交互关系,自注意力可以在整个 BEV 网格上建模这些长距离的空间交互,超越了卷积局部感受野的限制。
时序 BEV 网络是当前推动性能提升的核心方向。BEV 空间最独特的优势之一就是可以自然地支持时序特征融合——由于每帧 BEV 特征图都在统一的以自车为中心的度量空间中,前一帧的 BEV 特征可以通过运动补偿对齐到当前帧,然后使用时序卷积、3D 卷积或时序 Transformer 进行多帧信息的聚合。这种时序融合对于弥补单帧观测的不足极为有效:被遮挡的物体可能在历史帧中可见,其 BEV 特征通过时序传播在当前帧得以保留;远距离的稀疏观测通过多帧累积变得稠密;物体的运动状态通过跨帧的特征演变被隐式地编码。在时序 BEV 架构中,BEV 空间不再是一个单纯的“当前帧场景快照”,而是演变为一个“带有记忆的动态场景表征”,兼具感知和短期跟踪的功能。
十一、存储与计算:2D 效率的胜利
BEV 空间在存储与计算方面的表现,是其能在实时自动驾驶系统中大规模部署的关键原因。BEV 特征图是二维的,其存储开销与覆盖范围的面积成正比,而不是与体积成正比。一个覆盖 100 m × 80 m、分辨率为 0.25 m 的 BEV 网格,尺寸为 400 × 320 = 128,000 个单元格。每个单元格存储 256 维特征(单精度浮点),总共占用约 128 MB 显存。这与一个相同覆盖范围、0.25 m 分辨率的三维体素网格(还需考虑 8 m 高度,即 32 层)的 4 GB 相比,差距达 32 倍。如果使用半精度(FP16),BEV 特征图仅需约 64 MB,在嵌入式 GPU(如 NVIDIA Orin 的 32 GB 统一内存)上只占很小比例。
计算方面,在 BEV 特征图上运行的 2D 卷积与在图像上运行的 2D 卷积具有相同的算法复杂度——
。以 256 通道、3 × 3 卷积核处理 400 × 320 特征图为例,单层卷积的乘加运算量约为 256 × 256 × 9 × 400 × 320 ≈ 7.5 × 10^10 FLOPs(75 GFLOPs)。在 NVIDIA Orin(约 200 INT8 TOPS)上,这样一层卷积仅需亚毫秒即可完成。考虑到 BEV 感知网络通常只需要几层到十几层卷积,加上特征金字塔和检测头的开销,整个 BEV 推理流水线可以在 10-30 毫秒内完成,轻松满足自动驾驶的实时性需求(通常要求 100 ms 以内)。
BEV 空间的存储和计算效率在多传感器融合时体现得更为明显。来自不同传感器的数据一旦被转化为统一的 BEV 特征图,后续的所有处理(检测、跟踪、预测、在线建图)都可以在这张图上完成,不需要为每个传感器维护独立的处理分支。这种“前端多模态、后端统一处理”的架构大幅简化了融合系统的工程复杂度,减少了不必要的重复计算,使得多传感器 BEV 感知在嵌入式平台上也能流畅运行。
十二、融合:多源信息的统一平面
在多传感器融合体系中,BEV 空间承担着“统一表示层”的中枢角色——它是来自不同传感器、不同测量空间的所有信息最终汇聚和融合的场所。理解 BEV 空间中融合的本质,需要认识到它不仅仅是数据在空间上的对齐,更是不同传感器互补特性在统一几何框架下的有机整合。
激光雷达点云为 BEV 空间带来了高精度的几何定位和可靠的空间占据信息。点云经过体素化或支柱化后生成的 BEV 特征,在物体位置和边界上非常精确,特别擅长刻画物体的三维形状和轮廓。但点云 BEV 在远距离和小物体上往往稀疏甚至缺失,且缺少密集的语义纹理。
相机图像为 BEV 空间注入了丰富的语义信息和稠密的外观特征。通过 Lift-Splat 或交叉注意力,图像中的纹理、颜色和类别先验被提升到 BEV 平面,为每个网格位置附加了“这里看起来像什么”的深层视觉特征。这些特征在远距离处(点云已经非常稀疏)尤其宝贵,它们可以帮助 BEV 网络在数百米外检测车辆和交通标志,甚至在点云完全不可用的区域维持一定的感知能力。但图像 BEV 的位置精度受限于深度估计的误差,可能在横向上出现偏移。
毫米波雷达为 BEV 空间贡献了独特的运动维度。雷达检测点栅格化到 BEV 网格后,其瞬时径向速度可以作为 BEV 特征的一个独立通道,为“该处是否有运动物体”提供直接的物理证据。这在判别静止障碍物和运动目标时非常有用——一个拥有高径向速度的 BEV 单元格几乎必然包含一个动态目标。
这些来自不同传感器的 BEV 特征最终在通道维度上被拼接在一起,然后由共享的 BEV 编码器(通常是一个卷积网络或 Transformer)进行处理。编码器的任务不仅是提取更高层的特征,更是学习如何在不同模态之间进行信息互补和校验。例如,当激光雷达 BEV 特征在远处变得不可靠时,编码器会自动更多地依赖图像 BEV 特征;当图像深度估计在雨天产生偏差时,雷达的速度特征可以为运动物体的位置提供校正线索。这种在统一几何空间中的自适应多模态融合,是 BEV 架构能够显著超越单模态感知性能的根本原因。融合可以在 BEV 特征生成的早期进行(早融合),也可以在各自生成 BEV 特征后进行(中融合),或者在检测结果层面进行(晚融合)——当前的主流趋势是将早融合和中融合结合,在 BEV 特征图内部就让不同模态的特征充分交互。
十三、应用场景侧重:自动驾驶感知的核心舞台
BEV 空间的应用几乎完全围绕着自动驾驶和自主移动机器人展开,在这些场景中,它已经从一种新奇的表示方案逐渐演进为事实上的行业标准。
3D 目标检测是 BEV 空间最核心的应用。在 BEV 空间中检测车辆、行人、自行车等道路参与者,其优势是根本性的:检测器不需要处理物体在不同相机视角下的外观变化,也不需要担心近处物体遮挡远处物体带来的漏检(因为在 BEV 中近处和远处的物体占据不同的空间位置)。BEV 检测的输出——具有精确三维位置、朝向和速度的目标列表——可以直接被运动预测和规划模块消费,中间不需要进行任何坐标系转换或视角还原。这种端到端的几何一致性是 BEV 检测相较于图像检测+后投影方案的压倒性优势。
在线高精地图构建是 BEV 空间近年来的新兴杀手级应用。HDMapNet、VectorMapNet、MapTR 等工作的核心思路都是在 BEV 特征图上进行车道线和道路结构的推理。BEV 视角下,车道线的走向、曲率、分叉和交汇关系都直接对应于二维几何——向左弯曲的车道线在 BEV 上就是一条向左弯曲的曲线,不需要从透视图中的斜线和消失点进行复杂的几何推理。这极大地降低了车道线检测和拓扑建模的难度,使得依赖轻量级本地地图或无图的自驾方案成为可能。在这些方案中,车辆自身在行驶过程中实时构建的 BEV 局部地图取代了预先测绘的高精地图,实现了从“靠地图开车”到“边看边开车”的范式转变。
运动预测与轨迹规划是 BEV 空间的下游延伸。由于 BEV 特征图同时包含了道路结构、静态障碍物和动态目标的位置与运动信息,它成为多模态轨迹预测模型的天然输入。预测模块可以在 BEV 特征图的指导下,为每一个被检测到的动态目标生成若干条未来可能行驶的轨迹,同时这些轨迹可以自然地与自车的规划轨迹在同一 BEV 空间中进行碰撞检测和交互建模。在端到端自动驾驶的探索中,BEV 空间更是直接作为感知-预测-规划联合模型的内部状态表示——网络从传感器数据生成 BEV 特征,然后在 BEV 特征的基础上同时输出检测结果、占用预测和自车规划轨迹,所有环节共享同一个空间理解和同一个特征骨干。
十四、坐标系变换关系详解:从多传感器到 BEV 的汇聚
BEV 空间中的坐标系变换是多传感器融合中最具综合性的几何操作——它涉及将所有传感器的观测从各自的原生坐标系变换到一个统一的自车 BEV 坐标系中。这里以一组典型的传感器配置(前视相机、侧视相机、激光雷达、毫米波雷达)为例,系统性地梳理变换链。
设自车 BEV 坐标系 的原点位于自车后轴中心地面投影,
向前,
向左。激光雷达的外参
定义了激光雷达坐标系
到 BEV 坐标系的变换。对于激光雷达点云中的一点
,其在 BEV 坐标系中的位置为:
![]()
由于 BEV 只关心水平面,后续处理通常直接取 并将
作为附加的高度特征。
对于相机,变换链更为复杂。设前视相机的内参为 ,相机坐标系到 BEV 坐标系的外参为
。相机图像中的一个像素 (u,v) 在没有深度信息时无法唯一确定其在 BEV 中的位置——它对应的是 BEV 平面上的一条射线(从相机光心出发穿过该像素的射线与地面的交线)。在 Lift-Splat 方案中,为像素预测的深度分布
中每一个深度 bin
对应于 BEV 中的一个可能位置:

该像素的特征被分配到该位置附近的 BEV 单元格中。在基于交叉注意力的方案中,BEV 网格中的一个查询位置 首先被反向投影到相机图像中:
然后在图像特征图的 (u,v) 周围取一个局部窗口,计算注意力权重并聚合特征。这一正向或反向的投影变换是 BEV 与图像之间信息流动的数学管道。
毫米波雷达检测点通常已经以极坐标 (r,θ) 输出在雷达坐标系中,先转换为笛卡尔坐标 ,再通过雷达到 BEV 的外参
变换到 BEV 坐标系。雷达检测点在 BEV 中的位置不确定度(如上一章所述的横向误差椭球)需要在这一变换过程中传播,以便在关联和融合时使用马氏距离而非简单的欧氏距离。
时序 BEV 融合涉及 BEV 坐标系自身的变换。设 t−1 时刻的 BEV 特征图为 ,定义在当时的自车坐标系
中。从里程计获得自车从 t−1 到 t 的运动 ——这描述的是
系中的点在当前
系中的位置。则 中位于
的特征,在当前坐标系中的位置为:
然后通过双线性采样将 的特征重采样到当前 BEV 网格上,实现对齐。这一运动补偿操作是 BEV 时序融合中计算量最大的环节之一,也是保证时序特征空间一致性的数学基础。
十五、优缺点对比:统一与降维的得失权衡
将 BEV 空间与前述所有测量空间进行系统性对比,其独特的生态位清晰浮现。
相较于图像空间,BEV 的核心优势在于尺度一致性和视角无关性。物体在 BEV 中的大小与其真实物理尺寸成正比,不受距离影响;物体的外观(在 BEV 特征的意义上)不随相机视角变化而剧烈变化。这使得 BEV 检测器比图像检测器更容易学习、泛化更好、远距离性能更优。BEV 的劣势在于它丢失了图像中最丰富的外观纹理信息——在将图像特征提升到 BEV 的过程中,不可避免会有分辨率的损失和位置的不确定性,导致细粒度的外观判断(如识别车辆的具体型号、行人的手势)在 BEV 中不如在原始图像中精确。因此实际系统中常将 BEV 用于检测和定位,而将特定区域的图像裁剪用于精细分类。
相较于深度图空间,BEV 的优势在于它是一个完整的场景级表示,而不是单视角的 2.5D 快照。深度图只能从一个视角描述可见表面,而 BEV 可以融合来自多个深度图(或多个传感器)的信息,形成统一的场景俯视图。BEV 的劣势在于它丢失了高度方向的结构——深度图中的每一个像素都携带精确的径向距离和由此可推导的三维表面位置,而 BEV 将高度压缩为特征,无法精确表达陡坡、阶梯和高架结构。对于需要精细三维表面信息的任务(如抓取操作、精密避障),深度图或点云更为合适。
相较于三维点云空间,BEV 的最大优势是规则性——它是有序的、规整的二维网格,可以直接被 CNN 高效处理,而点云是无序的、不规则的,需要专门设计的网络架构。BEV 的第二个优势是其信息密度在特征层面可以达到稠密,能够表达自由空间(没有被占据的空闲区域),而点云只能在表面采样点上存在信息。BEV 的主要劣势是它丢失了点云的三维几何精度——点云中每一个点的坐标都是精确的亚厘米级测量,而 BEV 的量化分辨率通常在 0.2 米左右,且在高度方向完全损失。这使得点云仍然是高精度三维定位和三维形状分析的首选,而 BEV 更适合作为语义理解和目标检测的中间表示。
相较于体素空间,BEV 可以看作是体素在高度维度上压缩后的结果。两者的对比本质上是计算效率与垂直分辨能力之间的权衡。BEV 的二维计算量远小于体素的三维计算量,在实时嵌入式系统上更易部署。但 BEV 失去的垂直分辨能力在某些场景中至关重要——当需要区分天桥与路面、判断限高杆是否会被撞到时,体素空间的三维信息是不可或缺的。正因如此,当前最高级的感知架构往往同时维持 BEV 和体素两种表示:BEV 负责高效的水平布局理解和目标检测,体素负责处理垂直方向的结构和占用细节,两者通过共享特征骨干或注意力机制互相补充。
十六、进一步拓展:从 BEV 感知到端到端自动驾驶与世界模型
BEV 空间的前沿演进正在将它从“感知的中间表示”推向“自动驾驶系统的统一心智模型”。这一趋势在几个方向上同时展开,彼此交织,共同描绘出 BEV 空间未来可能扮演的更重要角色。
端到端自动驾驶将 BEV 空间作为感知、预测和规划的共享特征层。在 UniAD 等工作中,BEV 特征图不仅用于目标检测和跟踪,还作为运动预测和轨迹规划的输入条件。整个系统以 BEV 特征为枢纽,各个模块在统一的 BEV 空间中协同工作——检测告诉规划“哪里有什么”,预测告诉规划“它们可能往哪走”,规划在综合这些信息后输出自车的最优轨迹。由于所有操作都在同一个 BEV 坐标空间中进行,梯度可以从规划损失一直反向传播回感知网络,实现真正意义上的端到端优化。这种架构不仅提升了性能上限,还大幅简化了模块间的接口定义和工程复杂度。
BEV 空间与占用网络的结合正在孕育一种更通用、更安全的环境感知范式。传统的 3D 目标检测只能输出有限类别物体的边界框,对于训练数据中未出现过的长尾障碍物(如侧翻的货车、散落的轮胎、施工路障)可能完全漏检。占用网络则在 BEV 空间中直接预测每一个单元格是否被占据,无论占据物属于什么类别。这种语义无关的几何占用预测为自动驾驶提供了最底层的安全保障——“不管那是什么东西,只要它占据了空间,我就不能撞上去”。目前最前沿的 BEV 占用网络已经可以在 200 米以上的范围内,以 0.2 米的分辨率,实时输出稠密的占据概率图,其信息量远超稀疏的目标检测框列表。
世界模型是 BEV 空间拓展的另一个激动人心的方向。如果将 BEV 特征图视为自动驾驶系统对当前环境的“心智状态”,那么世界模型就是能够预测这一状态在未来如何演变的神经网络。给定当前的 BEV 特征图和自车的规划动作,世界模型试图预测未来若干秒内每一帧的 BEV 特征图——包括动态物体的移动、静态背景的保持、以及自车运动带来的视角变化。这种预测能力如果足够准确,将使自动驾驶系统具备“提前看到”未来的仿真能力,在不实际执行危险动作的情况下预演各种规划方案的后果。基于 BEV 的世界模型已经在一些研究原型中展现了初步的成果,能够在几分钟的预测时长内保持场景的几何一致性和语义合理性。
无图自动驾驶的终极愿景进一步提升了 BEV 空间的重要性。当自动驾驶不再依赖昂贵且易过时的高精地图时,车辆自身的 BEV 在线建图能力就成为唯一的环境结构信息来源。BEV 空间中的实时车道线推理、道路拓扑构建和路沿检测,需要达到足够的精度和召回率来支撑安全行驶。这要求 BEV 特征不仅要关注当前的瞬时观测,还要融合长时间跨度的历史信息,从大量不完整、有噪声的单帧观测中逐步构建出稳定且完整的局部道路模型。这一“BEV 长期建图”的能力将是 L4 级无图自动驾驶的核心技术门槛。
从更宏大的视角回望,BEV 空间的崛起反映了感知系统从“传感器为中心”到“任务为中心”的架构哲学转变。早期自动驾驶感知往往为每个传感器独立设计检测网络,然后将各自的结果在后处理中融合。BEV 空间则从根本上倒转了这个逻辑——先构建一个以任务(检测、建图、规划)视角为出发点的统一表示空间,再考虑如何将多传感器数据汇聚到这个空间中。这种架构哲学的优势在于,它将异构传感器的物理差异封装在了前端的数据提升模块中,使得后端的所有算法都可以在一个一致、清晰、物理可解释的空间中运行。随着传感器种类的增加和任务的复杂化,这种以统一表示为中心的架构设计将变得愈发不可或缺。
BEV 空间的旅程远未结束。当前它面临着远距离分辨率不足、高度维度损失、时序融合延迟、以及从感知特征到规划动作的学习效率等一系列挑战。但已经清晰的是,作为一种将原始传感器数据转化为结构化场景理解的中枢层,BEV 空间将长期处于自动驾驶和多传感器融合研究的核心位置。它那简洁的二维网格之下,承载的是机器理解这个三维动态世界的最精妙的一次降维与升华。
更多推荐
所有评论(0)