25年8月来自复旦大学和上海创新研究院的论文“Perception in Plan: Coupled Perception and Planning for End-to-End Autonomous Driving”。

近年来,端到端自动驾驶取得了显著进展。现有方法主要遵循感知-规划范式,其中感知和规划在完全可微分的框架内按顺序执行,以实现面向规划的优化。本文通过“感知-规划”框架设计进一步推进了这一范式,将感知融入规划过程。该设计有助于在规划目标不断演变的指导下进行有针对性的感知,最终提升规划性能。基于此,推出VeteranAD,一个用于端到端自动驾驶耦合感知和规划框架。通过将多模态锚定轨迹作为规划先验,感知模块专门设计用于收集这些轨迹上的交通元素,从而实现全面的和有针对性的感知。然后,基于感知结果和规划先验生成规划轨迹。为了使感知完全服务于规划,采用一种自回归策略,逐步预测未来轨迹,同时在每一步中关注与有针对性感知相关的区域。凭借这种简单而有效的设计,VeteranAD 充分释放了以规划为导向的端到端方法的潜力,从而带来更精准、更可靠的驾驶行为。在 NAVSI 和 Bench2Drive 数据集上进行的大量实验表明,VeteranAD 达到了最佳性能。

如图所示端到端自动驾驶方法比较。(a)先前的方法主要遵循感知-规划范式,按顺序执行这些模块。(b)相比之下,VeteranAD 将感知集成到规划过程中,使用规划先验知识来指导感知,并利用有针对性的感知结果来指导规划。这种“规划中的感知”范式增强了以规划为导向的框架。

请添加图片描述


端到端自动驾驶以传感器数据(例如摄像头和激光雷达)作为输入,并生成未来规划轨迹作为输出。规划任务通常涉及生成多模态轨迹,以表示多种可能的未来规划。辅助任务(例如检测、地图分割和周围智体的运动预测)也被集成到端到端模型中,以帮助模型更好地学习场景特征,从而获得安全的规划结果。

VeteranAD 框架概述如图所示。它包含三个主要组件:图像编码器、规划-觉察的整体感知模块和局部自回归轨迹规划模块。首先,图像编码器从多视图图像中提取特征,生成图像特征、BEV 特征和周围智体特征。接下来,从锚定轨迹初始化多模态轨迹查询。规划-觉察的整体感知模块在轨迹查询和提取的图像、BEV 和智体特征之间执行位置引导的交叉注意。然后,局部自回归轨迹规划模块以自回归方式运行,在每个时间步执行感知并相应地调整锚定轨迹点,最终生成完整的规划输出。

请添加图片描述

图像编码

给定多视角图像 I,N 表示摄像机视角数量,图像编码器 (He et al. 2016) 首先提取多视角图像特征,记为 F_img。然后,使用 LSS (Philion and Fidler 2020) 方法从图像特征生成鸟瞰图 (BEV) 特征 FBEV。然后,使用一个简单的多层感知器 (MLP) 解码器将 BEV 特征解码为 BEV 分割图,该分割图由地面实况分割图进行监督。周围智能体特征 F_agent 被初始化,并通过 Transformer (Vaswani 2017) 模块与 BEV 特征进行交互。然后,一个简单的 MLP 解码器将智能体特征解码为边框,该边框由周围智体的真值边框进行监督。获取这些特征后,根据锚定轨迹初始化多模态轨迹查询 Q_traj,其中 M 表示规划模式数量,C 表示特征通道数。锚定轨迹根据先前的研究(Sun,2025b;Liao,2025)从真实规划轨迹中聚类而成。

规划-觉察的整体感知

感知模块使轨迹查询能够全面捕捉场景和交通要素,例如车道、车辆、行人和障碍物,从而确保规划的准确性和安全性。给定轨迹查询 Q_traj,采用三种交叉注意机制与图像特征、BEV 特征和智体特征进行交互。

位置引导的图像交叉注意机制和位置引导的 BEV 交叉注意机制,旨在选择性地收集潜规划轨迹上的特征。首先,从锚定轨迹中提取时刻 t 的引导点 P_t,作为规划先验。然后,将这些引导点投影到图像和 BEV 坐标上。根据先前的研究(Wang et al. 2022b;Liu et al. 2023),它们作为轨迹查询与图像和 BEV 特征之间交叉注意机制的参考点。

位置引导的智体交叉注意机制,旨在根据周围智体的距离有效地区分它们的重要性。正如图像编码部分所述,解码边框可以获取智体的位置。然后,使用引导点和解码后的智体位置计算周围智体与自身智体之间的成对相对距离。

相对距离首先由多层感知器 (ML智体代理特征 F_AgRel。受先前研究(Zhou et al. 2023;Zhang et al. 2024)的启发,随后应用交叉注意机制,在对齐维度后,实现轨迹查询和距离感知智体特征之间的交互。

局部自回归轨迹规划

轨迹规划模块旨在使用锚定轨迹作为粗规划轨迹,并结合场景特征生成最终规划轨迹。对于未来 T 步的锚定多模态轨迹,获得轨迹点集 {P_1,…,P_T},其中 P_t 与上述时间 t 处的轨迹点相同。这些轨迹点作为轨迹规划的引导点。该过程以自回归方式运行。在每个时间步 t,该模块将轨迹查询 Q_traj 和引导点 P_t 作为输入,而规划-觉察的整体感知模块与轨迹查询和场景特征进行交互。然后,使用 MLP 轨迹解码器预测时间步 t 的未来轨迹点。该模型估算偏移量 ∆P_ft 以优化引导点,从而生成最终的规划轨迹点P_ft。

最终规划轨迹点集 {P_f1,…,P_fT},构成最终的规划轨迹 P_f。在最终时间步 T,该模块解码多模态轨迹的分类得分S_f。为了对轨迹点的运动进行建模,采用运动感知层归一化(Wang et al. 2023)将轨迹查询从时间 t-1 转换为时间 t,并以时间 t 的引导点为条件,这一方法受到先前研究(Wang et al. 2023; Song et al. 2024)的启发。

端到端学习

损失函数由四个部分组成:BEV分割图损失 L_BEV、智体边框损失 L_agent、规划回归损失 L_reg 和规划分类损失L_cls。BEV分割图损失,使用交叉熵损失计算。智体边框损失分为用于框位置回归的 L1 损失和用于框标签分类的二分类交叉熵损失。规划回归损失为 L1 损失,而规划分类损失使用 Focal 损失计算。


数据集。NAVSIM(Dauner,2024)是一个大规模真实世界自动驾驶数据集,专为非反应式仿真和基准测试而设计。它专注于涉及动态意图变化的挑战性场景,同时滤除诸如静止或恒速驾驶等简单情况。NAVSIM 提供来自摄像头和激光雷达的传感器数据,以及带注释的高清地图和 2 Hz 的物体边框。它分为两个子集:navtrain(1,192 个场景)用于训练和验证,navtest(136 个场景)用于测试。

Bench2Drive (Jia et al. 2024) 是首个专为端到端自动驾驶量身定制的闭环评估基准。它通过提供更真实、更具交互性的测试设置,解决了传统开环评估的局限性。训练集包含 CARLA v2 (Dosovitskiy et al. 2017) 模拟器生成的 10,000 个短片段,而评估集包含 220 条独立的短路线。

评估指标:对于 NAVSIM 数据集,用官方基准中定义的 PDM 评分 (PDMS) 来评估方法。PDMS 包含几个子评分:无过错碰撞 (NC)、可驾驶区域合规性 (DAC)、碰撞时间 (TTC)、舒适度 (Comf.) 和自我进步 (EP)。对于 Bench2Drive 数据集,遵循官方评估协议。在开环评估中,使用平均 L2 误差。在闭环评估中,采用驾驶分数和成功率。

实现细节。该模型使用 8 块 NVIDIA GeForce RTX 3090 GPU 进行训练,总批次大小为 32,共 16 个周期。学习率和权重衰减分别设置为 2 × 10−4 和 1 × 10−4,并使用 AdamW 对模型进行优化。为了公平起见,图像主干网络沿用了先前的研究,并采用 ResNet-34 (He et al. 2016)。输入包括三幅图像:右前、前方和左前,尺寸调整为 768 × 432。规划模式数量设置为 20。用于损失计算的平衡因子 λ1、λ2、λ3 和 λ4 在 NAVSIM 中均设置为 10,在 Bench2Drive 中均设置为 1。锚定轨迹使用 K-Means 进行聚类,其步骤与先前的研究(Sun et al. 2025b;Liao et al. 2025)相同。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐