【具身智能】RIPT-VLA:VLA 的交互式后训练
RIPT-VLA:VLA 的交互式后训练
关键词:#具身智能 #VLA #后训练 #强化学习
- 论文题目:Interactive Post-Training for Vision-Language-Action Models
- arXiv:2505.17016
- 单位:UT Austin & 南开
- https://ariostgx.github.io/ript_vla/
- 更多论文每日解读关注 v 公众号:https://mp.weixin.qq.com/s/V-D98qqyNVQDq7Z4kWmrOA

这篇论文针对 VLA 当前的训练范式,提出了一种基于 RL 的交互式后训练方法 —— RIPT-VLA,核心是在现有“预训练 + 监督微调”两阶段中加入第三个阶段,用稀疏的二元奖励 (成功 = 1,失败 = 0)来实现高效、稳定的性能提升,尤其解决了 “数据稀缺” 和 “离线训练不适应真实场景” 的关键问题。
研究背景
VLA 模型的目标是让机器人通过 “视觉观察 + 语言指令” 生成 “动作序列”,实现物理世界的交互(如 “拿起黑色碗放进抽屉”)。
现有 VLA 普遍采用两阶段训练:预训练 + SFT,但这种纯监督式的离线训练存在缺陷:(1)无环境交互,泛化性差;(2)依赖大量高质量数据,数据效率低。
方法:RIPT-VLA
论文提出 RIPT-VLA(Reinforcement Interactive Post-Training for VLA),在 “预训练 + SFT” 之后加入第三阶段,让模型通过与环境实时交互获取反馈,用强化学习优化策略 —— 核心是 “不用复杂奖励,只用稀疏二进制反馈;不用价值网络,用高效优势估计;动态过滤无效样本,保证训练稳定”。

RIPT-VLA 不替代现有两阶段,而是作为补充,完整流程如下:

RIPT-VLA 的核心是“rollout 收集 → 策略优化”的迭代循环,关键创新点集中在 “如何高效利用稀疏奖励” 和 “如何稳定训练”。
基础框架:LOOP 的改进
RIPT-VLA 基于 LOOP(Leave-One-Out Proximal Policy Optimization) 框架,但做了关键优化。
LOOP 的核心:结合 “留一法优势估计(RLOO)” 和 “近端策略优化(PPO)”,不用训练价值网络(减少计算成本),直接从稀疏奖励中提取有效梯度。
- 留一法优势估计(RLOO):对同一个初始场景(上下文 c),生成 K 条轨迹(动作序列 a),每条轨迹的优势 = 自身奖励 - 其他 K-1 条轨迹的平均奖励(比如 K=8,某条轨迹成功(R=1),其他 7 条失败(R=0),则优势 = 1 - 0=1,代表这条轨迹比平均好)。
- PPO:通过 “信任域约束” 避免策略更新幅度过大,保证训练稳定(目标是最大化 “优势 × 轨迹概率比”,但限制概率比在 [0.8,1.2] 内)。
RIPT-VLA 加入“动态采样过滤”:过滤掉 “所有轨迹优势为 0” 的场景组,只保留有差异的样本(如部分成功、部分失败),确保每个 batch 都有有效梯度,大幅提升训练稳定性。
适配多种 VLA 模型:离散 / 连续动作兼容
VLA 模型的动作输出分两类,RIPT-VLA 通过不同设计适配:
- 离散动作(如 QueST 模型):动作被编码为离散 token(类似语言模型的 token),直接通过 “分类头 + softmax” 计算轨迹的 log 概率(用于 PPO 的概率比计算)。
- 连续动作(如 OpenVLA-OFT 模型):动作是连续向量(如机器人关节角度),原 SFT 用 MSE/L1 损失训练,无法计算概率。RIPT-VLA 添加一个轻量级尺度头,用 “拉普拉斯分布” 或 “高斯分布” 建模动作概率(比如预测动作均值 μ 和尺度 σ,通过分布采样动作并计算 log 概率),无需改变原模型结构。
完整迭代步骤

- 初始化:输入 SFT 后的 VLA 模型 πθ、奖励函数(成功 = 1 / 失败 = 0)、初始场景数据集 Dcontext(从 SFT 数据中提取 “初始观察 + 任务指令”)。
- 迭代优化(共 M 步)
- Step 1:Rollout 收集:采样与优势计算
- Step 2:策略优化:使用 PPO 损失进行优化
输出最终模型:完成 M 步迭代后,得到优化后的 VLA 模型。
实验
论文在两大主流 VLA 基准(LIBERO:机器人操纵任务;MetaWorld:少样本操纵任务)上做了大量实验,覆盖 “标准多任务”“少样本”“跨场景”“跨目标” 等核心场景。
多任务性能提升(LIBERO 基准)
| 模型 | 原始成功率 | RIPT-VLA 后 | 提升 |
|---|---|---|---|
| QueST | 82.7% | 93.6% | +10.9% |
| OpenVLA-OFT | 96.7% | 97.5% | +0.8%(已接近上限) |
说明:即使是已经很强的模型,RIPT-VLA 仍能进一步提升。
小样本学习能力(Few-shot)
| 演示数量 | 原始成功率 | RIPT-VLA 后 | 提升 |
|---|---|---|---|
| 1 个演示 | 4% | 97% | +93% |
| 5 个演示 | 50.2% | 71.4% | +21.2% |
说明:RIPT-VLA 能在极少数据下实现“从无到有”的性能飞跃。
跨场景/跨任务泛化能力
- 跨场景(Cross-scenario):模型在一个场景中训练,在另一个新场景中测试。
- 原始 SFT 成功率仅 3.5%,RIPT-VLA 提升到 97.2%。
- 跨目标(Cross-goal):任务目标不同但动作技能相似。
- 原始 SFT 成功率接近 0%,RIPT-VLA 提升到 84.7%。
总结
RIPT-VLA 是一种简单、高效、通用的VLA模型后训练方法,它通过强化学习让模型在真实环境中“试错”,从而:
- 极大提升数据效率(1个演示就能训练)
- 显著增强泛化能力(跨场景、跨任务)
- 无需复杂奖励函数或价值函数,训练更稳定
更多推荐
所有评论(0)