NeurIPS 耶鲁大学提出基于可视化解耦分析策略梯度的视觉策略学习方法
创新点提出了一种新的视觉策略学习方法D.Va该方法利用可微分仿真和一阶解析策略梯度,通过将渲染过程从计算图中解耦,无需专门的可微分渲染软件即可与现有的可微分仿真生态系统无缝集成。揭示了解耦策略梯度可以被解释为从开环轨迹优化中进行策略蒸馏的一种形式,从而揭示了开环轨迹优化和闭环策略学习之间的基本联系。方法本文的主要研究方法是提出了一种名为D.Va(Decoupled Visual-Based Analytical Policy Gradient)的视觉策略学习方法,该方法通过将渲染过程从计算图中解耦,避免了在像素空间中进行雅可比矩阵计算,从而提高了计算和内存效率,并稳定了策略梯度。具体而言,
D.Va基于可微分仿真和一阶解析策略梯度,利用短视域策略更新方法,结合GPU加速的并行仿真平台,支持并行化的物理和渲染过程,以提高训练效率。同时,D.Va使用卷积网络对连续的图像帧进行编码,生成用于策略网络的潜在向量,以捕捉时间线索,如速度和加速度。从像素输入快速训练人形机器人跑步策略本图展示了D.Va在短时间内成功训练出人形机器人跑步策略的过程。图中可以看到,人形机器人在仿真环境中从初始状态开始,逐渐学习到稳定的跑步步态。具体来说,该方法仅用了4小时在单个RTX 4080 GPU上就训练出了人形机器人的跑步策略。
这体现了D.Va方法在视觉策略学习方面的高效性,能够在有限的计算资源和较短的时间内实现复杂任务的学习,为机器人视觉控制领域带来了新的突破。解耦策略梯度与解析策略梯度的计算图本图展示了解耦策略梯度(DPG)和解析策略梯度(APG)的计算图对比。
在图中,从左到右分别表示了策略参数θ、状态s、观测o、动作a、奖励r以及前向和后向传播过程。对于APG,其后向传播会通过整个流程,包括渲染过程,这会导致计算和内存开销较大,尤其是在处理高维视觉观测(如图像)时。而DPG的核心改进在于阻止了梯度通过渲染过程的反向传播,从而避免了在像素空间中计算雅可比矩阵,这不仅提高了计算效率,还通过减少梯度范数来稳定优化过程。这种解耦方式使得策略梯度的计算更加高效和稳定,尤其适用于视觉控制任务,
因为这些任务通常涉及复杂的渲染过程和高维观测数据。通过这种解耦,D.Va方法能够在保持策略学习有效性的同时,显著降低计算资源的需求,并提高训练过程的稳定性。解析策略梯度(APG)与解耦策略梯度(DPG)的比较本图展示了解析策略梯度(APG)和解耦策略梯度(DPG)在Hopper任务中的比较。图中左侧展示了两种梯度之间的余弦相似性,右侧展示了它们的梯度范数。从图中可以看出,DPG和APG的梯度在大多数情况下具有正的余弦相似性,这表明DPG通常是一个有效的策略改进方向。此外,当在状态空间(即观测为状态本身)进行实验时,控制正则化项B起到了类似残差连接的作用,使得APG的梯度范数通常小于DPG。这是因为残差连接有助于平滑优化过程,使得APG的梯度范数较小。然而,在处理高维视觉观测时,加入控制正则化项B会增加梯度范数,从而阻碍优化过程。这表明在视觉策略学习中,DPG通过避免复杂的渲染过程,能够提供更稳定的优化路径,尤其是在处理复杂的3D视觉任务时。这种比较揭示了解耦策略梯度在视觉控制任务中的优势,尤其是在需要处理高维和复杂观测数据的情况下。与状态到视觉蒸馏方法的比较本图展示了本文提出的D.Va方法与状态到视觉蒸馏方法在四个不同任务(Cartpole、Hopper、Ant和Humanoid)上的性能比较。图中横轴表示任务,纵轴表示最终回报(final return)和训练时间(wall-clock time)。从图中可以看出,在相对简单的任务(Cartpole、Hopper和Ant)中,D.Va方法与状态到视觉蒸馏方法在最终回报和训练时间上表现相当,两者都能达到与状态空间中训练的专家策略相近的性能。然而,在更具挑战性的人形机器人(Humanoid)任务中,D.Va方法显著优于状态到视觉蒸馏方法,D.Va能够实现更高的最终回报,而蒸馏方法的回报则停滞在较低的水平。这表明D.Va方法在处理复杂任务时具有更强的适应性和学习能力,能够更有效地从视觉输入中学习到有效的控制策略。此外,图中还展示了学生策略(即视觉策略)相对于专家策略的训练时间,D.Va方法在训练时间上也显示出优势,尤其是在复杂任务中,这进一步证明了D.Va方法在视觉策略学习中的高效性和优越性。
题目: Accelerating Visual-Policy Learning through Parallel Differentiable Simulation论文地址:https://www.arxiv.org/pdf/2505.10646代码地址:https://haoxiangyou.github.io/Dva_website/
更多推荐
所有评论(0)