AutoDrive-R2:自动驾驶中 VLA 模型的激励推理和自我反思能力
25年9月来自阿里高德、澳大利亚Queensland大学、兰州大学和 Case Western Reserve 大学的论文“AutoDrive-R2: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving”。
自动驾驶系统中的视觉-语言-动作 (VLA) 模型最近通过将多模态感知与决策能力相结合展现出变革潜力。然而,决策过程的可解释性和连贯性以及动作序列的合理性仍然在很大程度上未被充分探索。为了解决这些问题,本文提出 AutoDrive-R2,这是一个VLA 框架,它通过思维链 (CoT) 处理和强化学习 (RL) 增强自动驾驶系统的推理和自我反思能力。具体而言,首先提出一个名为 nuScenesR2-6K 的 CoT 数据集,用于监督微调,它通过四步逻辑链有效地在输入信息和输出轨迹之间建立认知桥梁,并通过自我反思进行验证。此外,为了在强化学习阶段最大化推理和自我反思能力,进一步在基于物理的奖励框架内采用群体相对策略优化 (GRPO) 算法,该框架结合空间对齐、车辆动态和时间平滑度标准,以确保可靠且切合实际的轨迹规划。在 nuScenes 和 Waymo 数据集上的广泛评估结果证明提出方法的卓越性能和强大的泛化能力。
AutoDrive-R2如图所示:
概述
轨迹规划任务的目标要求模型根据车辆的历史传感器数据和上下文信息预测车辆的未来运动。形式化地讲,给定一系列历史车辆状态 H(包括位置、加速度、速度、转向角等)及其摄像头图像 F,模型 M 会以 0.5 秒的间隔输出未来 3 秒的预测鸟瞰图 (BEV) 轨迹坐标 T,定义为 T = M (H, F)。
如图所示,训练过程包含两个阶段。在第一阶段,构建一个高质量的冷启动数据集 nuScenesR2-6K,通过一个四步逻辑链在输入信息和输出轨迹之间建立认知桥梁,并通过自我反思进行验证。在第二阶段,采用基于物理的强化学习框架,该框架整合空间对齐、车辆动态和时间平滑度标准,以确保物理上可行且安全的轨迹生成。

具有自反思的逻辑CoT数据集
VLA模型在自动驾驶领域的成功,关键在于其能够同时生成可解释的推理和物理上可行的动作。然而,现有的训练方法往往无法满足这一双重要求,导致模型要么缺乏可解释的决策过程,要么生成不切实际的轨迹。为了探究这一挑战,首先探索直接强化学习优化轨迹规划,并借鉴基于推理强化学习的最新进展[10]。然而,初步实验表明,与先进行SFT预训练的模型相比,仅进行强化学习训练的模型在轨迹规划方面表现出显著的退化。因此,提前构建一个名为nuScenesR2-6K的高质量冷启动数据集,以增强模型对轨迹规划的基础理解。
为此,手动注释 nuScenes 训练集中的 6,000 个图像-轨迹对,然后利用先进的 Qwen2.5-VL-72B 模型合成思维链推理序列。具体而言,如上图 (a) 所示,给定结合车辆历史状态的前视图像作为输入,以相应的真实轨迹作为输出,预定义一个特定的思维链提示来指导模型构建以下格式的推理序列:
“此处的思考过程(x_1 , y_1 ), …,(x_n , y_n )”。
此外,许多现有方法依赖于通用的提示进行问题到答案的推理,缺乏结构化的理性分析指导。虽然这种策略对于简单任务有效,但在面对复杂的数学或逻辑问题时,它常常会失效。为了解决这一局限性,CoT 提示设计系统地将轨迹规划分解为三个相互依存的推理阶段:
- 图像驱动分析:建立基础场景理解(例如,障碍物和车道定位、交通标志检测),以锚定后续推理。
- 基于物理的计算:利用运动学方程(例如,角动量守恒)将抽象观察转化为可量化的预测。
- 上下文逻辑综合:整合特定领域知识(例如,交叉路口交通规则),以确保预测与现实世界的驾驶规则相符。
为了进一步增强稳健性和答案的正确性,明确引入自我反思阶段作为第四步,其灵感来自通过向后检查来验证结论的数学推理框架。这使得模型能够验证其推理的连贯性并纠正潜在的矛盾。因此,提示实现一个四步逻辑链:
可视化 → 计算 → 逻辑 → 反思,
从而提供系统性和容错性的推理。
最终,利用 nuScenesR2-6K 数据集对 Qwen2-VL-7B 模型进行监督微调,从而得到第一阶段模型。预训练模型可以通过结构化、逐步推理和自我反思机制有效地实现轨迹规划。
群体相对策略优化 (GRPO)
遵循 GRPO 算法 [14] 来训练模型。与依赖批评网络估计价值函数的传统方法不同,GRPO 引入候选响应之间的成对比较机制。这种设计不仅简化架构,还减少训练过程中的计算开销。该方法首先通过策略采样,针对给定的输入问题 q 生成 G 个不同的候选答案 o = {o_1, . . . , o_G}。针对具体任务,实现两个基于规则的可验证奖励函数来评估答案质量。
准确度奖励
为了更好地适应轨迹规划任务,定义一个基于物理的准确度奖励 r_acc,它整合空间、运动学和时间约束进行评估。
奖励格式
奖励格式 r_acc 严格遵循所需的输出格式。模型必须以以下形式生成响应:“此处的思考过程(x_1, y_1), …,(x_n, y_n)”。如果格式正确,则赋值为 1,否则赋值为 0。总而言之,响应 o_i 的总奖励定义为 r_i。
为了量化所有响应 {r_1, …, r_G} 的相对质量,GRPO 通过减去组平均值并除以标准差来对这些分数进行归一化。因此,可以公式化每个响应的优势,其中 A_i 是第 i 个答案的相对优势。然后,优化目标进一步包含一个正则化项,以确保更新后的策略 π_θ 保持接近原始参考策略 π_ref。这是通过在损失函数 J_GRPO (θ) 中添加一个 KL 散度项 D_KL (· || ·) 来实现的,其中 β 充当超参,在优化过程中平衡探索和稳定性之间的权衡。
基于物理的精度奖励
在自动驾驶任务中,传统的奖励函数设计通常仅关注轨迹位置误差,而忽略几何、动力学和时间维度上的复杂约束。为了解决这个问题,提出一个基于物理的奖励框架,该框架整合空间对齐、车辆动力学和时间连续性,以全面指导模型生成安全、可行和舒适的驾驶策略。这种多维方法不仅确保几何精度,还明确地考虑现实世界车辆的物理限制和对运动平滑度的感知要求,从而创建一个整体的优化目标。
空间对齐:平衡机动性
任何轨迹奖励函数的基础都在于其将预测路径与目标路线对齐的能力。将空间精度项 r_pos 定义为预测坐标与真值坐标之间的均方欧氏距离,其中 N 表示时间步长,xi, yi 表示第 i 个时间步长的预测坐标,而 xi_gt, yi_gt 对应于真值。该公式通过惩罚所有时间步长的偏差来优先考虑全局路径遵循性,确保车辆保持在预期路线上。然而,仅仅关注最小化位置误差可能会产生物理上不合理的结果。例如,严格遵循最短路径可能会导致急转向或急加速,这不仅违反车辆运动学原理,还会降低乘客的舒适度。为了平衡几何精度和实际可行性,引入源自车辆动力学的额外约束。
车辆动力学:感知与控制的桥梁
自动驾驶系统必须考虑现实世界的物理限制,这些限制由转向运动学和纵向动力学决定。忽视这些限制可能会导致轨迹无法执行(例如,急转弯需要无限大的扭矩)或乘客感到不适。为了确保运动学可行性,通过以下项 r_ste 来惩罚转向角的偏差,其中 θj 和 θj_gt 分别表示第 j 个时间步的预测转向角和对应的真实转向角。此外,通过引入额外的速度约束项 r_vel 来解决非物理的加速/制动模式问题,其中 vk 和 vj_gt 分别表示第 k 个时间步的预测速度和对应的真实速度。总而言之,r_ste 和 r_vel 均强制遵守特定于车辆的约束,确保生成的轨迹在混合交通场景中既具有物理可实现性,又具有社会可接受性。这些约束明确地弥合感知驱动规划和执行器级控制之间的差距,确保预测轨迹与物理边界一致,同时保持乘坐舒适性。
时间平滑度:导航可靠性
轨迹预测中的时间不连续性从根本上削弱自动驾驶系统的可靠性。当转向或加速指令在时间步之间出现突然跳跃时,预测轨迹可能会失去连贯性,这进一步损害系统维持安全导航所需的稳定、可预测的运动模式的能力。为了解决这个问题,引入一个时间平滑项 r_tem,用于惩罚连续控制信号的快速变化。
集成奖励函数
最终的奖励函数综合所有具有可学习权重的维度,其中λ_pos、λ_ste、λ_vel、λ_tem是可学习的系数,用于平衡相互竞争目标之间的权衡。在实验中将它们全部设置为1。这种整体公式确保模型生成的轨迹几何精确、动态可行且时间平滑,从而应对自动驾驶的多方面挑战。
实验设置
数据集
采用 nuScenesR2-6K 数据集进行训练。该数据集包含 6000 个图像-轨迹样本对,每个样本包含一张正面图像和一个 3 秒的轨迹规划,每个轨迹规划间隔为 0.5 秒。Qwen2.5-VL-7B 模型基于这些样本进行微调,以实现 SFT,从而在强化学习之前建立基础的感知能力。为了进行评估,该方法在 nuScenes 和 Waymo 数据集上进行测试,这两个数据集都提供全面的自动驾驶数据。nuScenes 数据集包含 1,000 个城市驾驶场景,并带有六个同步摄像头视图以支持规划任务。Waymo 数据集包含 4,021 个驾驶片段,捕捉八个摄像头视图和自车轨迹。
详细信息
在 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B 模型上进行实验。在两个阶段中,学习率均设置为 5e-7,累计总批次大小为 1。GRPO 的最大完成长度配置为 4,096 个 tokens,每个输入采样 6 个响应。
评估指标
采用未来 1 秒、2 秒和 3 秒时间范围内预测轨迹与真实轨迹之间的 L2 距离(以米为单位)以及平均 L2 误差。对于所有模型,用官方检查点,并使用相同的评估代码进行评估。
更多推荐

所有评论(0)