【AI论文】VLA-RFT:在世界模拟器中基于可验证奖励的视觉-语言-动作强化微调框架

摘要:视觉-语言-动作(Vision-Language-Action, VLA)模型虽能实现具身决策,但高度依赖模仿学习,导致误差累积和分布偏移下的鲁棒性不足。强化学习(RL)虽可缓解这些问题,但通常需要高成本的现实世界交互,或受困于仿真到现实的差距。我们提出VLA-RFT这一强化微调框架,利用数据驱动的世界模型作为可控模拟器。该模拟器基于真实交互数据训练,可根据动作预测未来视觉观测,支持通过目标达成参考生成密集的、轨迹级的奖励信号,进而实现策略推演。这种设计提供了高效且与动作对齐的学习信号,大幅降低了样本需求。仅需不到400步微调,VLA-RFT便超越了强监督基线模型,且效率优于基于模拟器的强化学习方法。此外,该框架在扰动条件下展现出强鲁棒性,可维持稳定的任务执行。我们的研究结果证实,基于世界模型的强化微调(RFT)是提升VLA模型泛化能力和鲁棒性的实用后训练范式。更多详情请访问:Github。Huggingface链接:Paper page,论文链接:2510.00406
研究背景和目的
研究背景:
随着深度学习技术的快速发展,视觉-语言-动作(Vision-Language-Action, VLA)模型在机器人决策和自主系统领域展现出巨大潜力。
这些模型通过整合视觉、语言和动作信息,能够在复杂环境中进行感知、理解和操作。然而,传统的VLA模型主要依赖于模仿学习(Imitation Learning, IL),这种方法在面对分布外(Out-of-Distribution, OOD)情况时表现不佳,容易因小偏差而累积错误,导致任务执行失败。此外,模仿学习需要大量高质量的专家演示数据,这在现实世界中往往难以获取且成本高昂。
为了克服这些挑战,强化学习(Reinforcement Learning, RL)被引入VLA模型的训练中。RL通过与环境交互来优化策略,能够在没有专家数据的情况下探索和发现更优的行为模式。然而,传统的RL方法在VLA领域面临两大挑战:一是需要大量真实世界交互,这在物理机器人上实现成本高且不安全;二是仿真到现实(Sim-to-Real)的迁移存在显著性能差距,仿真环境往往无法完全捕捉现实世界的复杂性和动态性。
研究目的:
本研究旨在提出一种基于世界模型的强化微调框架(VLA-RFT),通过利用世界模型作为高保真仿真器,实现VLA模型的高效、安全且鲁棒的强化学习优化。
具体目标包括:
- 减少真实世界交互:通过世界模型模拟环境动态,避免在物理世界中进行昂贵且不安全的交互。
- 提高样本效率:利用世界模型生成密集的、任务相关的奖励信号,加速策略优化过程。
- 增强鲁棒性:通过引入验证奖励机制,提高模型在面对分布外情况时的稳定性和可靠性。
- 推动VLA模型的实际应用:通过实验验证VLA-RFT框架的有效性,为VLA模型在机器人控制、自主导航等领域的实际应用提供理论基础和技术支持。
研究方法
1. 世界模型构建:
世界模型作为VLA-RFT框架的核心组件,负责模拟环境动态并生成未来状态预测。
本研究采用了一种基于视频生成模型的世界模型设计,通过预训练一个自回归Transformer骨干网络来预测未来视觉观测。该模型在离线数据集上进行预训练,以捕捉环境中的视觉和动作动态。在推理阶段,世界模型根据当前状态和动作序列生成未来视觉轨迹,为策略优化提供反馈。
2. 策略预训练与微调:
VLA-RFT框架采用两阶段训练策略:预训练阶段和强化微调阶段。
在预训练阶段,VLA策略通过监督学习在专家演示数据集上进行预训练,以产生稳定的动作块。同时,世界模型也在离线数据集上进行预训练,以捕捉环境动态。在强化微调阶段,利用世界模型生成的验证奖励对VLA策略进行微调,通过GRPO(Generalized Reinforcement Policy Optimization)算法优化策略参数。
3. 验证奖励机制:
为了提供稳定且可靠的优化信号,VLA-RFT引入了验证奖励机制。该机制通过比较世界模型生成的轨迹与目标轨迹之间的差异来计算奖励。具体地,采用负L1距离和LPIPS(Learned Perceptual Image Patch Similarity)作为奖励函数的一部分,以捕捉动作对视觉观测的直接影响。
此外,还引入了辅助监督信号(如动作级监督)以提高训练稳定性。
4. 实验设置:
实验在LIBERO基准测试集上进行,该数据集包含多样化的机器人交互任务。
通过比较VLA-RFT与基线模型(如VLA-SFT)在标准任务和扰动任务上的性能,验证框架的有效性和鲁棒性。实验硬件配置为4×A800 GPU,以确保高效的模型训练和评估。
研究结果
1. 世界模型性能:
实验结果表明,世界模型在预测未来视觉观测方面表现出色,具有低重构误差(MSE 0.0039)和高感知分数(PSNR 25.23dB, SSIM 0.906, LPIPS 0.059)。
这些指标表明世界模型能够生成高质量、时间一致的帧序列,有效捕捉静态背景和动作驱动的变化。
2. VLA模型性能提升:
在标准任务上,VLA-RFT通过仅400次微调迭代便显著提高了平均成功率(SR),从基线模型的86.6%提升至91.3%。
在所有子任务套件(Spatial, Object, Goal, Long)上均实现了性能提升,表明框架的有效性和通用性。特别是在扰动任务上,VLA-RFT展现出更强的鲁棒性,能够在对象位置偏移、目标位置偏移和机器人状态扰动等复杂环境下保持较高的成功率。
3. 关键因素分析:
通过对比不同验证奖励设计对VLA-RFT性能的影响,发现基于世界模型生成的轨迹比较奖励(Reward Type3)效果最佳。
该奖励设计通过比较世界模型生成的轨迹与目标轨迹之间的差异来计算奖励,提供了更稳定和可靠的优化信号。此外,实验还验证了世界模型在训练过程中的关键作用,通过提供密集的、任务相关的奖励信号,显著加速了策略优化过程。
研究局限
尽管VLA-RFT框架在提高VLA模型性能和鲁棒性方面取得了显著成果,但仍存在一些局限性:
1. 奖励信号质量依赖专家数据:
验证奖励信号仍然在很大程度上依赖于专家演示数据的质量。
如果专家数据存在偏差或不足,可能会限制策略发现超越专家表现的策略。
2. 世界模型容量瓶颈:
世界模型的表示能力成为限制因素。尽管当前的世界模型在捕捉环境动态方面表现出色,但其在处理更复杂和多样化数据时的泛化能力仍有待提高。
3. 长期推理能力不足:
当前框架未显式集成世界模型进行规划,这可能限制模型在长期推理任务上的表现。
未来的研究需要探索如何将世界模型与规划算法相结合,以增强模型的长期推理能力。
未来研究方向
1. 提高奖励信号质量:
未来的研究可以探索如何利用学习到的奖励模型(如VLAC)来提供更任务相关的反馈,减少对专家数据的依赖。
通过引入更复杂的奖励函数设计,提高奖励信号的准确性和多样性。
2. 扩展世界模型容量:
通过增加世界模型的参数规模和训练数据量,提高其在处理更复杂和多样化数据时的泛化能力。
同时,探索更先进的模型架构和训练技术,以进一步提升世界模型的性能。
3. 集成世界模型进行规划:
将世界模型与规划算法相结合,增强模型在长期推理任务上的表现。
通过引入层次化规划和蒙特卡洛树搜索等技术,提高模型在复杂环境中的决策能力和适应性。
4. 探索多模态融合:
进一步探索视觉、语言和动作等多模态信息的融合方式,提高模型在处理多模态数据时的效率和准确性。
通过引入更先进的融合算法和模型架构,实现更高效的多模态推理和决策。
5. 推动实际应用:
将VLA-RFT框架应用于实际机器人控制和自主导航等领域,验证其在实际场景中的有效性和可靠性。通过实际场景的测试和反馈,不断优化和改进框架设计,提高其实用性和应用范围。
更多推荐
所有评论(0)