【VLAs篇】04:RDT一个用于双臂操作的扩散基础模型
1. 论文摘要介绍表格
| 类别 | 详细内容 |
|---|---|
| 论文标题 | RDT-1B: A Diffusion Foundation Model for Bimanual Manipulation (RDT-1B:一个用于双臂操作的扩散基础模型) |
| 研究问题 | 如何为机器人双臂操作开发一个具有强大泛化能力的基础模型,以克服数据稀缺、动作多模态(即一个任务有多种完成方式)和机器人硬件异构性三大核心挑战。 |
| 核心贡献与创新点 | 1. 模型架构 (RDT-1B):首次将扩散模型 (Diffusion Model) 与Transformer相结合,并扩展到12亿参数,专为复杂的机器人双臂操作设计,是目前该领域最大的扩散基础模型。 2. 动作多模态解决方案:利用扩散模型强大的分布建模能力,有效捕捉双臂操作中固有的多模态动作分布,避免了传统方法可能产生的无效“平均”动作。 3. 数据异构性解决方案 (PIUAS):提出了一个物理可解释的统一动作空间 (Physically Interpretable Unified Action Space)。它像一个“通用机器人语言”,能将不同品牌、不同结构的机器人的动作映射到一个统一标准下,从而可以汇集海量异构数据进行训练,学习可迁移的物理知识。 4. 训练范式:采用了**“大规模预训练 + 特定任务微调”**的策略。在迄今最大规模(46个数据集,1M+轨迹)的多机器人数据集上进行预训练,然后在自建的高质量双臂操作数据集(6K+轨迹)上微调,成功解决了数据稀缺问题。 5. 架构优化:对标准的DiT(Diffusion Transformer)架构进行了多项关键改进(如QKNorm、MLP解码器、条件交替注入),以适应机器人数据非线性、高频变化的特性,并保证了大规模训练的稳定性。 |
| 关键成果 | 1. 卓越的性能:在7个具有挑战性的双臂操作任务中,RDT-1B的性能全面超越了包括ACT、OpenVLA在内的现有SOTA(业界顶尖)方法。 2. 强大的泛化能力:展示了出色的零样本 (Zero-shot) 和少样本 (Few-shot) 泛化能力。无需额外训练即可应对未见过的物体和场景;仅需1-5个演示就能学会全新的技能。 3. 高级能力:能够理解复杂的语言指令(如“用左手倒三分之一杯水”),并能完成需要精细操控的灵巧任务(如用遥控器控制机器狗走直线)。 |
2. 论文具体实现流程
RDT-1B的实现流程可以分为训练阶段和推理阶段,其核心是“数据处理 -> 编码 -> 模型处理 -> 解码”的闭环。
数据流程
-
预训练数据阶段:
- 收集:汇集了46个公开的多机器人数据集(如RT-1, DROID等),总计超过100万条轨迹,数据来源主要是单臂机器人。
- 处理:将所有机器人的动作和本体感知数据,通过**物理可解释的统一动作空间(PIUAS)**进行标准化。例如,无论机器人A的“手臂1关节3”还是机器人B的“右臂肘关节”,都被映射到统一空间中“右臂肘关节”的对应维度。这使得异构数据可以被模型统一处理。
-
微调数据阶段:
- 收集:作者团队使用ALOHA双臂机器人,自行收集了一个包含6000多条轨迹、300多个任务的高质量双臂操作数据集。
- 增强:利用GPT-4对语言指令进行扩充和改写,增加文本多样性。
模型实现流程(流转逻辑)
输入 (Inference/推理时):
- 视觉输入 (
X): 过去两帧的图像序列,来自3个摄像头(外部、左手腕、右手腕)。 - 语言输入 (
l): 人类下达的任务指令,例如“把短裤叠成一个长方形”。 - 本体感知输入 (
z): 机器人当前的状态,如各个关节的角度、夹爪开合度等。 - 初始动作 (
ã): 一个完全随机、充满噪声的“动作块”(即未来几十个时间步的动作序列)。
输出 (Inference/推理时):
- 最终动作 (
a): 一个去噪后的、清晰可执行的“动作块”,包含了未来一段时间内双臂所有关节的目标位置。
核心流转逻辑:
-
编码 (Encoding):
- 视觉编码:使用固定的SigLIP模型将多视角图像转换成图像Token序列。
- 语言编码:使用固定的T5-XXL模型将语言指令转换成文本Token序列。
- 低维数据编码:将机器人的本体感知和带噪声的初始动作,通过PIUAS格式化后,送入一个MLP网络,转换成动作Token序列。
-
核心处理 (RDT - Diffusion Transformer):
- 去噪迭代:这是扩散模型的核心。模型以当前的本体感知、图像Token和文本Token作为条件,对充满噪声的动作Token进行去噪处理。
- 迭代过程:这个去噪过程不是一步完成,而是迭代数次(推理时为5次)。每一次迭代,模型都会让噪声动作变得更清晰一点,更接近一个合理的、能完成任务的动作。
- 条件注入:为了防止信息量巨大的图像Token“淹没”信息量较少的文本Token,模型在Transformer的不同层中交替地注入图像和文本条件,确保机器人既“看懂”了场景,也“听懂”了指令。
-
解码 (Decoding):
- 经过多轮去噪后,Transformer输出一个“干净”的潜在表示。
- 这个潜在表示通过一个MLP解码器,被转换回物理世界中可执行的动作指令(即未来多个时间步的双臂关节目标位置)。
- 机器人执行这个动作块,然后重复整个“输入-处理-输出”循环,直到任务完成。
3. 有趣的白话版详细解说
给机器人装一个“超级大脑”:RDT-1B的故事
想象一下,你想教一个机器人帮你做家务,比如叠衣服。这件事对我们来说很简单,但对机器人来说却难于上青天。为什么呢?
机器人面临的三大难题:
- “学费”太贵,老师太少:能做复杂家务的双臂机器人非常昂贵,所以全世界也没多少。这就导致机器人“学习资料”(也就是训练数据)极其稀缺,没见过多少世面。
- “选择困难症”:叠衣服时,你可以先叠左边,也可以先叠右边,可以用手掌压,也可以用指尖捏。完成一个任务有无数种方法。如果一个笨机器人把所有方法“平均”一下,结果可能就是伸出两只手在衣服中间戳来戳去,啥也干不成。
- “身体不一样,没法学”:你想让你的家用机器人去学习工厂里一个高大威猛的机器人。但它俩“身高臂长”完全不同,直接照搬对方的动作,很可能就是“东施效颦”,把东西打翻一地。
为了解决这些问题,清华大学的科学家们给机器人开发了一个名叫RDT-1B的“超级大脑”。这个大脑有三个独门绝技:
绝技一:B站刷到饱——“跨物种”学习
既然双臂机器人的学习视频少,那就干脆让它去看所有机器人的视频!无论是只有一只手臂的“独臂侠”,还是轮式机器人,只要是做事的视频,RDT-1B都来者不拒。它为此发明了一套**“机器人通用肢体语言”(PIUAS)**。
这套语言就像一个万能翻译器,能把不同机器人“奇形怪状”的身体动作,都翻译成标准术语,比如“主手臂抬起”、“夹爪合拢”。这样一来,机器人看的虽然是成千上万种不同的身体,但学到的是背后通用的物理规律——怎么抓、怎么推、怎么放。这就好比我们看猫和狗都能跳,最终学会了“跳”这个概念,而不是模仿猫或狗的具体肌肉动作。通过这种方式,RDT-1B“刷”了相当于100多万集的“机器人动作片”,积累了海量的“常识”。
绝技二:从“马赛克”到“高清”——治好选择困难症
为了解决“选择困难症”,RDT-1B的大脑工作方式很特别,它用的是**“扩散模型”**,像一个搞创作的艺术家。
当接到“叠衣服”的指令时,它的大脑里不会立刻出现一个僵硬的计划。相反,它会先生成一个极其模糊、充满噪声的动作“草稿”,就像一张被打满马赛克的图片。然后,它会根据看到的场景和听到的指令,一步步地把这张“马赛克图”变清晰。每一次“擦除”噪声,动作就更合理一点。最终,它会“创作”出一幅清晰、连贯、可执行的“高清动作图”。这个过程保证了它最终选择的是一种具体的、有效的方案,而不是所有可能方案的滑稽混合体。
绝技三:名师一对一辅导
在“博览群片”掌握了通用技能后,RDT-1B会被带到它真正要操作的双臂机器人面前,进行最后的“一对一辅导”(微调)。这时候,它只需要看几千个高质量的演示,就能将之前学到的所有通用知识,完美应用到这个新身体上。它甚至能举一反三,看一两个新动作的演示,就能学会一个全新的技能,比如给人递东西或者用遥控器开动玩具车。
最终效果如何?
这个装了“超级大脑”的机器人变得异常聪明。它不仅能零基础完成没见过的任务(比如用一个从没见过的杯子接水),还能精确理解复杂的指令(比如“用左手倒三分之一杯水”),甚至能完成需要极高稳定性和精度的灵巧任务。
我的观点和理解
这篇论文最让我印象深刻的,不是它单纯地把模型做大、数据增多,而是它系统性地解决了将这些要素整合起来的工程难题。它就像一位高明的总建筑师,不仅设计了宏伟的蓝图(使用扩散模型和Transformer),更重要的是铺平了地基、统一了砖瓦标准(PIUAS),并设计了稳固的承重结构(架构优化)。
RDT-1B的成功,标志着机器人学习正在从“任务学习”向“能力学习”迈进。过去,我们训练一个机器人,目标是让它学会“开瓶盖”这一个任务。而现在,RDT-1B的目标是学习一种通用的“物理常识”和“操作能力”,使得它面对“开瓶盖”、“拧螺丝”、“叠衣服”等不同任务时,都能基于已有的能力进行泛化。这种零样本和少样本的能力,是通往通用人工智能机器人的关键一步。
当然,它并非没有局限。它本质上仍是一个顶级的“模仿大师”,而非真正理解物理世界的“思考者”。当遇到训练数据中从未暗示过的、需要创造性推理的极端情况时,它可能依然会束手无策。但我认为,这篇论文指明了一条清晰的道路:通过海量异构数据的预训练,赋予模型一个强大的通用先验知识,再结合特定场景的快速适应,是实现通用、智能机器人的可行之道。 它让我们离那个能帮我们端茶倒水、整理房间的未来,又近了一大步。
更多推荐
所有评论(0)