翻译:CarPlanner:用于自动驾驶大规模强化学习的一致性自回归轨迹规划(一)
CarPlanner:用于自动驾驶大规模强化学习的一致性自回归轨迹规划
Dongkun Zhang1,2 Jiaming Liang2 Ke Guo2 Sha Lu1 Qi Wang2 Rong Xiong1,B Zhenwei Miao2,† Yue Wang1
1 浙江大学 2 菜鸟网络
{张东坤,卢莎,熊瑞,王宇}@zju.edu.cn
liangjiaming.ljm、muguo.gk、ruifeng.wq、zhenwei.mzw@alibaba-inc.com
Abstract
轨迹规划对于自动驾驶至关重要,它能确保车辆在复杂环境中安全高效地行驶。尽管近期基于学习的方法,尤其是强化学习(RL),在特定场景中展现出良好前景,但 RL 规划器在大规模、真实世界的驾驶场景中仍面临训练效率低下和难以管理的问题。在本文中,我们提出了 CarPlanner,这是一种一致的自回归规划器,它利用 RL 生成多模态轨迹。自回归结构使得大规模 RL 训练变得高效,而一致性机制则通过保持时间步长间的连贯性来确保策略学习的稳定性。此外,CarPlanner 还采用了生成-选择框架,结合了专家指导的奖励函数和不变视图模块,简化了 RL 训练过程,并提升了策略性能。大量分析表明,我们提出的 RL 框架有效地解决了训练效率和性能提升的难题,使 CarPlanner 成为自动驾驶轨迹规划的一个有前景的解决方案。据我们所知,我们是首个证明基于强化学习的规划器能够在具有挑战性的大规模真实世界数据集 nuPlan 上超越基于模仿学习和基于规则的最先进方法(SOTA)的研究团队。我们提出的 CarPlanner 在这个要求极高的数据集上超越了基于强化学习、基于模仿学习和基于规则的最先进方法。
1. Introduction
轨迹规划[36]在自动驾驶中至关重要,它利用感知和轨迹预测模块的输出为自动驾驶车辆生成未来的位姿。控制器跟踪这一规划好的轨迹,生成闭环驾驶的控制指令。近来,基于学习的轨迹规划因其诸多优势而备受关注。

†Project lead. B Corresponding author.
图 1. 多步轨迹生成框架。(a)初始化 - 优化,即生成初始轨迹并进行迭代优化。(b)普通的自回归模型,按顺序解码后续姿态。(c)我们的时序一致自回归模型,整合了时序一致的模式信息。
具有自动化算法迭代的潜力,能够消除繁琐的规则设计,并确保在各种现实场景中的安全性和舒适性[36]。
大多数现有的研究 [11, 16, 29] 采用模仿学习(IL)来使规划的轨迹与人类专家的轨迹保持一致。然而,这种方法存在分布偏移 [28] 和因果混淆 [8] 的问题。强化学习(RL)提供了一种潜在的解决方案,能够应对这些挑战,并通过奖励函数提供更丰富的监督。尽管强化学习在诸如游戏 [34]、机器人技术 [19] 和语言模型 [25] 等领域表现出有效性,但在大规模驾驶任务中,它仍面临训练效率低下和性能不佳的问题。到目前为止,
据我们所知,目前还没有任何强化学习方法在诸如 nu-Plan [2] 这样包含多种真实场景的大规模开放数据集上取得具有竞争力的结果。
因此,本文旨在解决强化学习在轨迹规划中的两个关键挑战:1)训练效率低下;2)性能不佳。训练效率低下的问题源于强化学习通常在无模型的环境中运行,这需要在 CPU 上运行效率低下的模拟器来反复执行策略以收集数据。为了解决这一挑战,我们提出了一种基于模型的高效方法,利用神经网络作为转移模型。我们的方法针对硬件加速器(如 GPU)进行了优化,使得时间成本与基于模仿学习的方法相当。
为了将强化学习应用于解决轨迹规划问题,我们将其表述为一个利用马尔可夫决策过程(MDP)的多步序贯决策任务。现有的分多步生成轨迹的方法通常分为两类:初始化-细化方法[17, 20, 33, 45]和自回归模型[27, 32, 41, 46]。
第一类方法如图 1(a)所示,首先生成初始轨迹估计,然后通过反复应用强化学习(RL)对其进行优化。然而,包括 Gen-Drive [18] 在内的近期研究显示,这种方法仍落后于最先进的模仿学习(IL)和基于规则的规划器。该方法的一个显著局限在于忽略了轨迹规划任务中固有的时间因果关系。此外,直接在高维轨迹空间中进行优化的复杂性可能会限制强化学习算法的性能。第二类方法由自回归模型组成,如图 1(b)所示,这些模型在转换模型内使用单步策略递归生成自动驾驶车辆的位姿。在这一类中,所有时间步长的自动驾驶车辆位姿被整合起来形成整体规划轨迹。由于考虑了时间因果关系,当前的自回归模型能够实现交互行为。然而,一个常见的局限性在于它们依赖于从动作分布中自回归随机采样来生成多模态轨迹。这种普通的自回归过程可能会损害长期一致性,并在强化学习中不必要地扩大探索空间,从而导致性能不佳。
为解决自回归模型的局限性,我们引入了 CarPlanner,这是一种用于高效、大规模基于强化学习的规划器训练的一致性自回归模型(见图 1(c))。CarPlanner 的关键见解在于其将一致的模式表示作为自回归模型的条件。具体而言,我们采用纵向 - 横向分解的模式表示,其中纵向模式是一个标量,用于捕获平均值
†In this paper, the term “trajectory” refers to the future poses of the ego vehicle or traffic agents. To avoid confusion, we use the term “state (action) sequence” to refer to the “trajectory” in the RL community.
纵向模式包含当前时刻自动驾驶车辆的速度信息,而横向模式则涵盖了基于当前自动驾驶车辆状态以及地图信息所推导出的所有可能路径。这种模式在时间步长内保持不变,为策略采样提供稳定且一致的引导。
此外,我们提出了一种通用的奖励函数,适用于大规模和多样化的场景,无需针对特定场景设计奖励。该函数由专家指导和任务导向的两部分组成。第一部分量化了自我规划轨迹与专家轨迹之间的位移误差,结合一致的模式表示,缩小了策略的探索空间。第二部分纳入了驾驶任务中的常识,包括避免碰撞和遵循可行驶区域。此外,我们引入了一个不变视图模块(IVM),为策略提供不变视图输入,旨在提供与时间无关的策略输入,简化特征学习并促进泛化。为此,IVM 通过将代理、地图和路线信息转换为当前自车坐标,并裁剪远离自车的信息,对状态和横向模式进行预处理。
据我们所知,我们是首个证明基于强化学习的规划器在具有挑战性的大规模 nuPlan 数据集上优于最先进的模仿学习(IL)和基于规则的方法的研究团队。总之,本文的主要贡献如下:
我们提出了 CarPlanner,这是一种一致的自回归规划器,它训练强化学习策略以生成一致的多模态轨迹。
我们引入了一种专家指导的通用奖励函数和 IVM,以简化强化学习训练并提高策略泛化能力,从而提升闭环性能。
我们对归纳学习(IL)和强化学习(RL)训练的特点进行了严格分析,揭示了它们各自的优势和局限性,同时强调了强化学习在应对诸如分布偏移和因果混淆等挑战方面的优势。
我们的框架展现了卓越的性能,在 nuPlan 基准测试中超越了所有基于强化学习(RL)、模仿学习(IL)和规则的方法。这突显了强化学习在应对复杂现实驾驶场景方面的潜力。
2. 相关工作
2.1. 基于模仿的规划
基于人类驾驶示范来利用模仿学习(IL)训练规划器的方法近来引起了极大的关注。这种方法借助了经验丰富的驾驶员在各种现实场景中安全舒适驾驶的专业技能,同时还具有易于大规模收集驾驶数据的优势[2, 9, 15]。Nu-
图 2. CarPlanner 包含四个部分。(1)非反应式转换模型以初始状态 s0 为输入,预测交通参与者的未来轨迹。(2)模式选择器根据初始状态和模式 c 输出分数。(3)轨迹生成器遵循一致模式下的自回归结构条件,并生成与模式对齐的多模态轨迹。(4)规则增强选择器通过安全、舒适和进度指标对模式分数进行补偿。
众多研究 [5, 17, 29] 都致力于开发创新网络以提升该领域的开环性能。然而,自动驾驶的终极挑战在于实现闭环操作,这需要通过诸如安全性、遵守交通规则、舒适性和行进速度等驾驶相关指标来进行评估。这揭示了规划器在训练和测试阶段之间存在显著差距。此外,IL 特别容易受到诸如分布偏移 [28] 和因果混淆 [8] 等问题的影响。第一个问题导致系统在遇到训练数据分布中未出现的场景时做出次优决策。第二个问题则源于网络无意中捕捉到错误的相关性,并基于输入信息开发出捷径,这主要是由于依赖于专家演示的模仿损失。尽管一些研究 [1, 3, 4, 42] 努力解决这些挑战,但训练和测试之间的差距仍然很大。
2.2. 自动驾驶中的强化学习
在自动驾驶领域,强化学习(RL)已证明其在处理诸如高速公路驾驶[22, 39]、变道[14, 23]和无保护左转[22, 40]等特定场景方面具有有效性。大多数方法直接在控制空间(包括油门、刹车和转向指令)上学习策略。由于控制指令执行频率高,模拟过程可能耗时,且探索过程可能不一致[40]。一些研究[40, 44]提出学习轨迹规划器,将动作定义为自我规划的轨迹,这在时间上扩展了探索空间并提高了训练效率。然而,正如 ASAP-RL [40] 所指出的,轨迹时长与训练性能之间存在权衡。增加轨迹时长会导致反应性行为减少以及数据量减少,而较短的轨迹时长则会带来类似于控制空间中遇到的挑战。此外,这些方法通常采用无模型设置,这使得它们难以应用于大规模驾驶数据集中复杂多样的真实场景。在本文中,我们提出采用一种基于模型的公式化方法,以促进在大规模数据集上进行强化学习训练。在此公式化方法下,我们旨在通过使用转移模型来克服轨迹时长的权衡问题,该模型能够在测试期间为我们的策略提供对未来世界的预览,从而做出多步决策。
3. Method
3.1. Preliminaries
马尔可夫决策过程(MDP)用于对序贯决策问题进行建模,其形式化表示为一个元组 ⟨S, A, Pτ:, R, ρ0, γ, T⟩。S 表示状态空间。A 表示动作空间。Pτ:: S × A → ∆(S)† 是状态转移概率。R : S × A → R 表示奖励函数,且有界。ρ0 ∈ ∆(S) 是初始状态分布。T 是时间范围,γ 是未来奖励的折扣因子。状态-动作序列定义为 τ = (s0, a0, s1, a1, . . . , sT),其中 st ∈ S 和 at ∈ A 分别表示时间步 t 的状态和动作。强化学习的目标是最大化期望回报:

向量化状态表示。状态 st 包含地图和代理信息的向量化表示 [10]。地图信息 m 包括道路网络、交通信号灯等,这些由折线和多边形表示。代理信息包括自车和其它交通代理当前及过去的位姿,这些由折线表示。自车的索引为 0,交通代理的索引范围为 1 到 N。对于每个代理 i,其历史记录表示为 sit−H:t ,i ∈{0, 1, . . . , N},其中 H 是历史时间范围。
3.2. 问题陈述
我们将轨迹规划任务建模为一个顺序决策过程,并将自回归模型分解为策略模型和转移模型。将轨迹规划与自回归模型相连接的关键在于将动作定义为自动驾驶车辆的下一个姿态,即 at = s0t+1。因此,在自回归模型前向传播之后,解码的姿态被收集起来作为自动驾驶规划的轨迹。具体而言,在此定义和向量表示下,我们可以将状态-动作序列简化为状态序列:

状态序列可以进一步以自回归的形式进行表述,并分解为策略模型和转换模型:

从式(3)中,我们可以清楚地看出典型的自回归方法所固有的问题:由于策略分布取决于从动作分布中随机抽样,因此在不同的时间步长会出现不一致的行为。
为了解决上述问题,我们在自回归方式中引入了在时间步长间保持不变的一致模式信息 c :

由于我们专注于自我轨迹规划,所以一致模式 c 不会影响转换模型。
在式(4)中定义的这种一致的自回归公式揭示了一个生成-选择框架,其中模式选择器根据初始状态 s0 对每个模式进行评分,而轨迹生成器则通过从模式条件策略中采样来生成多模式轨迹。
非反应式转换模型。在每个时间步长中都需要使用在公式(4)中所构建的转换模型,因为它会基于当前状态 st 生成时间步长 t + 1 时交通代理的姿势。实际上,这一过程耗时较长,而且我们并未发现使用此转换模型能带来性能上的提升,因此,我们采用轨迹预测器 P(s1:N) 。
1: T |s0) 作为非反应性过渡态
一种在给定初始状态 s 的情况下一次性生成交通参与者所有未来姿态的预测模型0。
3.3. 规划架构
我们所提出的 CarPlanner 框架如图 2 所示,包含四个关键组件:1)非反应式转换模型,2)模式选择器,3)轨迹生成器,4)规则增强选择器。
我们的规划器在代际选择框架内运行。给定初始状态 s0 和所有可能的 Nmode 模式,轨迹选择器会对每个模式进行评估并分配分数。然后,轨迹生成器会生成 Nmode 对应于各自模式的轨迹。对于轨迹生成器,初始状态 s0 会被复制 Nmode 次,每次与 Nmode 种模式中的一种相关联,从而有效地创建 Nmode 个平行世界。策略在这些预览的世界中执行。在策略展开期间,轨迹预测器充当状态转换模型,生成所有时间范围内的交通代理的未来位置。
3.3.1. 非反应式过渡模型
此模块将初始状态 s0 作为输入,并输出交通代理的未来轨迹。初始状态先由代理和地图编码器处理,然后通过自注意力 Transformer 编码器 [38] 融合代理和地图特征。最后将代理特征解码为未来轨迹。
代理和地图编码器。状态 s0 包含地图和代理信息。地图信息 m 由 Nm,1 多段线和 Nm,2 多边形组成。多段线描述车道中心和车道边界,每个多段线包含 3Np 个点,其中 3 分别对应车道中心、左边界和右边界。每个点的维度为 Dm = 9,包括以下属性:x、y、航向、限速和类别。将左边界和右边界点与中心点连接起来,维度为 Nm,1 ×Np ×3Dm。我们利用 PointNet [26] 从每个多段线的点中提取特征,得到维度为 Nm,1 ×D 的特征,其中 D 表示特征维度。多边形代表交叉路口、人行横道、停车线等,每个多边形包含 Np 个点。我们利用另一个 PointNet 从每个多边形的点中提取特征,得到维度为 Nm,2 ×D 的特征。然后将多段线和多边形的特征连接起来,形成整体地图特征,维度为 Nm ×D。代理信息 A 包含 N 个代理,每个代理维护过去 H 个时间步的位姿。每个姿势的维度为 Da = 10,并包含具有以下属性:x、y、航向、速度、边界框、时间步长和类别。因此,智能体信息的维度为 N×H ×Da。我们应用另一个 PointNet 从每个智能体的姿态中提取特征,从而得到智能体特征维度为 N×D。
未完待续。。。
更多推荐

所有评论(0)