世界模型与具身智能:2026最前沿AI方向深度解析
世界模型与具身智能:2026最前沿AI方向深度解析
写在前面:2026 年的 AI 圈,风向变了。过去两年大家都在卷大语言模型(LLM),卷到 token 价格比白菜还便宜,但最终发现——光会"说话"的 AI,碰一下物理世界就露馅。让 GPT 去拧瓶盖?它能在文本里写出 1000 字的拧瓶盖攻略,但真让它控制机械臂,它连盖子在哪儿都搞不清楚。
于是 2026 年,整个 AI 圈的注意力开始往两个方向集中:世界模型(World Model) 和 具身智能(Embodied AI)。这两者的融合,正在推动 Agentic AI 从"数字空间"跨越到"物理世界"。Genie 3、混元 1.5、Marble、Gen-3C 四大巅峰架构扎堆涌现;VLA(Vision-Language-Action)模型成了机器人通用操控的核心赛道。
这篇文章,我会用"人话"把这条 2026 年最火的 AI 技术线彻底讲透。全文 12000+ 字,含可运行 PyTorch 代码、四张对比表、十道面试高频题,建议先收藏再慢慢看。
目录
- 一、什么是世界模型?——从 LeCun 的 JEPA 到 Genie 3
- 二、世界模型 vs 语言模型:预测下一个 token vs 预测物理世界动态
- 三、三大流派架构:自回归 Transformer、AR-DiT、空间原生 3D 引导
- 四、Genie 3 技术解析:Google DeepMind 的交互式世界模型
- 五、混元 1.5 技术解析:腾讯的 WorldPlay 方案
- 六、具身智能核心:VLA 模型(RT-2 / Octo / π0 / OpenVLA)
- 七、世界模型如何赋能机器人:从仿真到现实(Sim2Real)
- 八、代码实战:用 PyTorch 实现一个简化版世界模型
- 九、世界模型的评估:物理一致性、时间连贯性、交互可控性
- 十、2026 年四大巅峰架构对比:Genie 3、混元 1.5、Marble、Gen-3C
- 十一、挑战与展望:数据瓶颈、泛化能力、安全部署
- 十二、面试高频问答 10 题
- 十三、总结
一、什么是世界模型?——从 LeCun 的 JEPA 到 Genie 3
1.1 一个灵魂拷问:AI 真的"理解"世界吗?
先抛一个问题:你让一个三岁小孩看一只猫从桌上掉下去,小孩会立刻知道——猫会摔到地上,可能会"喵"一声跑掉。但如果让一个训练了万亿 token 的 LLM 来"预测"这件事,它会怎么说?
它会说:“根据物理定律,猫会以 9.8m/s² 的加速度下落……”——没错,它背下了物理公式,但它没有"看"过猫掉下去。它对世界的理解,是建立在文本符号上的,而不是建立在视觉、空间、因果的直觉上的。
图灵奖得主 Yann LeCun 早在 2022 年就提出了这个质疑。他在那篇著名的 “A Path Towards Autonomous Machine Intelligence” 中讲了一句很重的话:
“大语言模型本质上是预测下一个 token,它们对物理世界没有任何理解。”
LeCun 认为,真正通向 AGI 的路径,必须让 AI 拥有一个"世界模型"——一个能在内部模拟物理世界动态、预测行为后果的"脑内沙盘"。
1.2 LeCun 的 JEPA:世界模型的理论起点
LeCun 提出的架构叫 JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)。它的核心思想可以用一句话概括:
不要在像素层面预测未来,而要在抽象表征层面预测未来。
这是什么意思?打个比方:你看一段视频,一个人把玻璃杯推到桌子边缘。如果让模型去预测"下一帧每个像素是什么颜色",那太难了——杯子的反光、背景的纹理、桌面的木纹,每一个像素都要算,而且算错一个像素就觉得"不对劲"。但如果让模型在"抽象语义层面"预测——“杯子会掉下去、会碎”——那就简单多了,而且这才是真正有用的信息。
JEPA 的架构分三个部分:
- Encoder(编码器):把当前观测 x x x 和动作 a a a 编码成抽象表征 s = E ( x ) s = E(x) s=E(x)。
- Predictor(预测器):根据当前表征 s s s 和动作 a a a,预测下一时刻的表征 s ^ ′ = P ( s , a ) \hat{s}' = P(s, a) s^′=P(s,a)。
- Loss(损失函数):让预测表征 s ^ ′ \hat{s}' s^′ 和真实的下一帧表征 s ′ = E ( x ′ ) s' = E(x') s′=E(x′) 在潜在空间里靠近,而不是在像素空间里靠近。
这就是 JEPA 最反直觉的地方:它不要求模型重建画面,只要求它在"概念层面"预测对。这避免了模型把算力浪费在无意义的像素细节上。
从 2022 年提出概念,到 2023 年的 I-JEPA(图像版)、2024 年的 V-JEPA(视频版)、2025 年的 LeJEPA,再到 2026 年 7 月纽约大学联合 LeCun 的 AMI 公司发布的 AdaJEPA(自适应潜在世界模型),这条路线已经走了四年。2026 年的 AdaJEPA 已经能自适应地选择"预测多远的未来"和"在多抽象的层面预测",被业界称为"机器人 GPT-4 之前的最后一块拼图"。
1.3 从 JEPA 到 Genie 3:世界模型的工程化跃迁
LeCun 的 JEPA 是理论框架,但工程上有个大问题:它在潜在空间里预测,你没法直接"看到"它预测了什么。这对于做交互式游戏、机器人仿真的人来说不够直观——你得能看到画面才行。
于是工业界走了另一条路:直接在像素/视频层面做可控生成。这就是 Google DeepMind 的 Genie 系列的思路。
- Genie 1(2024):能从一张图生成可交互的 2D 游戏,但分辨率低、动作控制粗糙。
- Genie 2(2024 末):升级到 3D 视角,可玩性大幅提升。
- Genie 3(2025 年 8 月):参数量达到 110 亿,支持 720p 高清、文本到 3D 世界、128k 上下文窗口,成为 2026 年世界模型赛道的标杆。
Genie 3 最让业界震动的一点是:它不是"生成视频",而是"生成世界"。你输入一句话"一个赛博朋克风格的未来都市",它给你生成一个你可以用键盘 WASD 自由走动的 3D 环境——而且你走出房间再走回来,房间里的东西还在原位。
类比一下:Sora 像是给你放一部电影,你只能看不能动;Genie 3 像是给你一个游戏引擎,你可以在里面当主角。
2026 年,世界模型已经从一个"学术概念"变成了一个"工程刚需"。下面我们一步步拆解它的核心技术。
二、世界模型 vs 语言模型:预测下一个 token vs 预测物理世界动态
2.1 本质区别:一个在"续写文本",一个在"推演现实"
很多人第一次接触世界模型会懵:它和 LLM 不都是"预测下一个"吗?有什么区别?
区别大了。我用一张表把两者的核心差异列清楚:
| 维度 | 语言模型(LLM) | 世界模型(World Model) |
|---|---|---|
| 预测对象 | 下一个文本 token | 下一帧世界状态(视觉/3D/物理) |
| 输入模态 | 文本序列 | 图像/视频 + 动作指令 + 文本 |
| 输出模态 | 文本 token | 像素/3D 点云/潜变量 |
| 预测空间 | 离散符号空间 | 连续物理空间(含时间维度) |
| 因果模型 | 文本统计共现 | 物理因果(碰撞、重力、遮挡) |
| 一致性要求 | 语义连贯即可 | 几何稳定 + 时间连贯 + 物理合理 |
| 典型代表 | GPT-4、Claude、Llama | Genie 3、混元 1.5、Marble |
| 失败模式 | “幻觉”(编造事实) | “漂移”(物体变形/消失) |
2.2 一个形象的类比
打个比方,帮你建立直觉:
- 语言模型像是一个只会读小说的人。它读了上亿本小说,所以你给它一个开头,它能续写出一段看起来挺像样的故事。但你让它去"演"这个故事——比如让它描述"把杯子从桌上推下去会发生什么",它写出来的东西可能在文字上很流畅,但物理上完全不对(比如它可能写"杯子飘了起来")。
- 世界模型像是一个会打电动的小孩。它没读过多少书,但它"玩"过上百万个游戏场景。你给它一个画面和一个动作"按 W 键前进",它能在脑子里"演"出:角色会往前走一步,前方的门会越来越大,地上如果有水坑会溅起水花。它预测的是物理上会发生什么,而不是文字上该怎么接。
2.3 为什么 LLM 的"下一 token 预测"范式不够用?
LLM 的成功让很多人产生一个错觉:只要把"预测下一个 token"的范式搬到视觉上,就能做出世界模型。但实践证明这条路有坑:
- 视觉 token 的压缩损耗:图像被 VAE/分词器压缩成几百个 token 后,高频细节(纹理、边缘)会丢失。这导致生成的画面总有"数码感",像打了马赛克。
- 时间维度的灾难:文本是 1D 序列,视频是 3D 立方体(宽×高×时间)。纯自回归地一帧一帧预测,误差会像滚雪球一样累积——预测第 1 帧误差 1%,到第 100 帧可能就完全崩了。
- 缺乏几何锚点:LLM 预测 token 不需要管"这个词在三维空间的哪个位置"。但世界模型如果不知道物体的 3D 坐标,相机一转,物体就"飘"了。
这就是为什么 2026 年的世界模型没有一家走"纯 LLM 路线",而是演化出了三大流派——下一章详细讲。
2.4 但两者正在融合
有意思的是,2026 年的趋势是两者融合。世界模型开始借鉴 LLM 的自回归范式(Genie 3 就是"世界即语言"),而 LLM 也开始接入世界模型来获得"物理常识"(比如 Goal-VLA 把生成式 VLM 当世界模型用)。最终的终局,可能是一个统一的"世界-语言"基础模型——既能说话,也能推演现实。
三、三大流派架构:自回归 Transformer、AR-DiT、空间原生 3D 引导
2026 年的世界模型赛道,技术上分成了三大流派。这三大流派代表了三种截然不同的"世界观"——也就是三种"如何模拟现实"的哲学。
3.1 流派一:自回归 Transformer(AR-Transformer)——“世界即语言”
代表作:Google Genie 3
这个流派直接继承了 LLM 的衣钵。它的思路是:把世界当成一种"语言"来处理。
具体做法:
- 用一个时空分词器,把连续的视频帧压缩成离散的视觉 token(就像 LLM 把文字切成词)。
- 把动作指令也编码成 token。
- 用一个 Decoder-only 的 Transformer,像 GPT 预测下一个词一样,预测下一组视觉 token。
优势:
- 逻辑密度极高。因为是纯自回归,它特别擅长捕捉"动作→结果"的因果链条。比如在游戏里你按了一个开关,它能记住"远处的门应该开了"。
- 推理速度快。自回归生成可以利用 KV-Cache,做到低延迟交互。
- 可扩展性好。LLM 那套 scaling law 直接能用——参数越大、数据越多,效果越好。
劣势:
- 视觉细节有"数码感"。分词器的压缩损耗让画面不够细腻,纹理、光影容易糊。
- 长程漂移。预测帧数多了,像素级误差累积,物体会慢慢变形。
类比:AR-Transformer 像是一个会讲故事的人。它能把剧情的逻辑讲得严丝合缝(开关一按,门就开),但如果你让它画出来,画面可能有点"像素风"。
3.2 流派二:自回归扩散 Transformer(AR-DiT)——“世界即演化”
代表作:腾讯混元 1.5(WorldPlay)
这个流派结合了 Transformer 的序列处理能力和扩散模型(Diffusion)的精细重构能力。它不再预测离散 token,而是在潜空间里通过"去噪"过程还原出连续的视觉分布。
具体做法:
- 把视频帧编码到潜空间。
- 用 DiT(Diffusion Transformer)作为骨干,在潜空间里做扩散去噪来生成下一帧。
- 用"分块自回归"的方式,一块一块地往前生成,保证时间连贯。
优势:
- 视觉真实感是三大流派里的巅峰。它能完美还原光影的菲涅尔反射、流体的湍流、材质的细微纹理。
- 2026 年已实现实时化。通过蒸馏技术(如混元的 Context Forcing),AR-DiT 已经能在消费级 GPU 上跑到 24 FPS。
劣势:
- 物理逻辑有时"绵软"。虽然看着极其逼真,但物体碰撞可能像橡皮泥,缺乏刚性。
- 计算成本高。扩散过程需要多步去噪,即便蒸馏到 4 步,也比纯自回归重。
类比:AR-DiT 像是一个写实派画家。它画的每一帧都美到窒息,光影细节无可挑剔,但如果你让它讲"为什么这个球撞了那个球会弹开",它可能答得不够精准。
3.3 流派三:空间原生 / 3D 引导(Spatial-Native)——“世界即实体”
代表作:World Labs Marble、NVIDIA Gen-3C
这个流派跳出了"二维视频"的思维,直接在神经网络内部维护一套 3D 表示(如 3D 高斯泼溅 GS、点云、体素)。
具体做法:
- Marble:生成的是成千上万个具有颜色、不透明度、位置、旋转属性的"高斯椭球体",每帧画面都是对这些 3D 点的实时投影。
- Gen-3C:用并行的深度预测分支,把每帧像素投射成 3D 点云缓存,再以此为"骨架"引导扩散模型填充纹理。
优势:
- 空间稳定性的终极方案。因为物体是锚定在 3D 坐标上的,相机怎么转都不会"飘"。
- 支持资产导出。生成的是真正的 3D 数据,能导出成 USD/PLY,直接进 UE5 做游戏或数字孪生。
- 具身智能的绝佳训练环境。机器人需要的就是 3D 空间理解,这个流派天然契合。
劣势:
- 数据需求极其严苛。需要带深度、相机参数的高质量 4D(3D+时间)数据,这种数据稀缺且昂贵。
- 动态物体处理难。3DGS 对刚性场景效果好,但流体、火焰、人群这种高度动态的内容,3D 表示很难维护。
类比:Spatial-Native 像是一个建筑师。它不画 2D 图,它直接搭 3D 模型。你从任何角度看都不会穿帮,但它搭一个场景的成本比画一幅画高得多。
3.4 三大流派速查表
| 流派 | 代表作 | 核心思想 | 视觉真实感 | 逻辑因果 | 空间稳定 | 实时性 | 数据门槛 |
|---|---|---|---|---|---|---|---|
| AR-Transformer | Genie 3 | 世界即语言,预测下一 token | 中(数码感) | 强 | 中 | 强 | 中 |
| AR-DiT | 混元 1.5 | 世界即演化,潜空间去噪 | 强(巅峰) | 中(绵软) | 中 | 中(已实时) | 中 |
| Spatial-Native | Marble / Gen-3C | 世界即实体,维护 3D 表示 | 强 | 中 | 强(巅峰) | 中 | 高(需 4D 数据) |
一句话总结三大流派的取舍:AR-Transformer 押注逻辑,AR-DiT 押注视觉,Spatial-Native 押注几何。2026 年还没有一个流派能同时在三个维度上都拿到满分,这正是当前研究最激烈的战场。
四、Genie 3 技术解析:Google DeepMind 的交互式世界模型
Genie 3 是 2026 年世界模型赛道公认的"标杆之作"。它由 Google DeepMind 在 2025 年 8 月发布,参数量 110 亿,支持 720p 高清生成、文本到 3D 世界、128k 上下文窗口。2026 年,Waymo 还基于 Genie 3 打造了自动驾驶仿真系统,让自动驾驶能在模型里"脑补"各种极端路况。
4.1 核心架构思想:将世界视为一种"语言"
Genie 3 最核心的突破在于:它把"世界模拟"彻底转化成了一个序列预测问题。
2026 年主流的视频生成器大多走扩散路线,通过不断去噪来"拼凑"画面。但这种方式在实时交互中有致命伤:计算开销巨大、响应延迟高。Genie 3 坚定地选择了纯自回归 Transformer 路径。
底层逻辑是:如果我们把一个三维空间及其随时间的变化,压缩成一组有逻辑关联的"视觉词汇"(Tokens),那么生成世界就变成了像 ChatGPT 写文章一样——根据过去的"剧情",预测下一组"视觉词汇"。
110 亿参数让 Genie 3 不仅能记住画面,更能通过概率分布学习到物理法则。
4.2 关键组件一:分层时空分词器(Hierarchical Spatiotemporal Tokenizer)
这是 Genie 3 能处理 720p 高清视频的基石。传统图像分词器只能处理静态图片,而 Genie 3 采用了 3D 卷积分词技术:
- 多维度压缩:它不仅在宽和高上压缩像素,还在时间轴上压缩。它会把连续的 8 帧或 16 帧画面看作一个"视频立方体",折叠成一个高维特征向量,最后映射到一个庞大的数字词典。
- 分层策略:Genie 3 把视觉信息拆成两层:
- 结构层:锚定场景大轮廓(山川、墙壁、地平线)。
- 细节层:捕捉动态变化(飞溅的水花、树叶的颤动)。
这种分层处理确保了模型在快速运动时,背景大环境不会崩坏或漂移。
类比:就像你看一部电影,你会下意识地分成"剧情主线"和"画面细节"两层来记。即使某个镜头的花瓶换了个颜色,你也不会觉得剧情断了。Genie 3 的分层分词器干的就是这个事。
4.3 关键组件二:潜动作模型(Latent Action Model, LAM)
这是 Genie 3 区别于所有普通视频模型的最核心组件,也是它具备"可交互性"的源头。最神奇的是——它是通过自监督学习完成的,不需要人类手动标注动作。
工作原理:
- 从变化中学习:训练时,LAM 观察海量视频。它通过对比"当前帧"和"下一帧"之间的像素位移和物体形变,自动推断出导致这种变化的原因——这就是"动作"。
- 动作空间:它会自动构建一个 8 维或 16 维的控制向量空间。虽然没人告诉它什么是"跳跃",但当模型发现画面中的角色向上快速位移时,它会为这个变化分配一个特定编码。
- 控制映射:当你按下键盘的"W"键时,Genie 3 实际上是把你的按键信号映射到它自学出的"动作空间"里,从而驱动下一步画面演化。
这个设计非常优雅。它意味着 Genie 3 不需要"按键标注"的数据——你给它看视频,它自己就能学会"什么样的变化对应什么样的动作"。这就是自监督的威力。
4.4 关键组件三:动力学 Transformer(Dynamics Transformer)
这是世界的"大脑",一个巨大的 Decoder-only Transformer。
- 输入:过去的画面序列 + 当前的潜动作向量 + 用户的文本指令。
- 长程记忆缓冲区:它利用了 128k 甚至更长的上下文窗口。这在技术上解决了"转身即忘"的问题。通过 KV-Cache 优化,模型可以把之前生成过的场景特征保存在隐藏层中。当你走出房间再转回来,模型会优先从缓存中检索这些特征,确保门后的那把椅子依然在原地。
4.5 Genie 3 的技术亮点总结
| 组件 | 作用 | 技术创新点 |
|---|---|---|
| 分层时空分词器 | 720p 高清压缩 | 3D 卷积 + 结构/细节分层 |
| 潜动作模型 (LAM) | 自监督学习动作 | 无需标注,从帧间变化推断动作 |
| 动力学 Transformer | 世界推演大脑 | 110 亿参数 + 128k 上下文 + KV-Cache |
2026 年,Genie 3 已被 Waymo 用于自动驾驶仿真——让自动驾驶系统在模型生成的"虚拟城市"里练习应对各种罕见路况(比如突然冲出来的鹿、暴雪天的连环追尾),大幅降低了真实路测的成本和风险。
五、混元 1.5 技术解析:腾讯的 WorldPlay 方案
如果说 Genie 3 是"逻辑派"的巅峰,那腾讯的 混元 1.5(HY-World 1.5) 就是"视觉派"的代表作。它凭借核心引擎 WorldPlay,成功破解了世界模型领域长期存在的"实时性"与"几何一致性"无法兼得的技术悖论,实现了 24 FPS 的长程流式生成。
5.1 为什么混元 1.5 能做到实时?
世界模型要实时交互,面临一个根本矛盾:
- 扩散模型视觉质量好,但要多步去噪,太慢。
- 自回归模型快,但视觉质量差。
混元 1.5 的解法是:用 AR-DiT 架构(分块自回归 + 扩散),再通过蒸馏把去噪步数压到 4 步。但蒸馏有个坑——传统蒸馏方法会让学生模型"失忆"(因为教师模型训练时能看到全局,学生模型推理时只能看过去,信息不对齐导致误差爆炸)。
混元团队提出了 Context Forcing(上下文强迫) 策略来解决这个问题:
在蒸馏过程中,不是让教师模型自由地看全局,而是用掩码强制教师模型的"记忆环境"和学生模型完全一致。这样教师传授的知识才能精准适配学生的因果推理模式。
结果:学生模型仅需 4 步去噪就能生成高质量画面,跑满 24 FPS。
5.2 双分支动作表征:亚像素级精准控制
传统交互式模型面临一个选择题:
- 离散按键(WASD):对不同尺度场景适应性好,但精确位置缓存时模糊。
- 连续相机位姿(旋转+位移矩阵):能提供精确空间坐标,但场景尺度差异大时训练不稳定。
混元 1.5 提出了双分支动作表征(Dual Action Representation),两者都用:
| 动作类型 | 编码方式 | 注入位置 | 作用 |
|---|---|---|---|
| 离散按键 | 零初始化 MLP | 时间步嵌入,调制 DiT 块 | 场景尺度适应 |
| 连续位姿 | PRoPE(投影位置编码) | 自注意力块 | 精确空间坐标 |
这种设计确保了模型既能流畅响应即时指令,又能在底层逻辑上维持严密的坐标体系。
5.3 上下文记忆重构:对抗"时间遗忘"与"几何漂移"
长程一致性是世界模型的命门。你在一个虚拟城市里走了一公里再走回来,场景还能不能对上?混元 1.5 建立了双层记忆结构:
- 短期时序记忆:专注相邻帧间的微观动态,确保物体运动平滑无抖动。
- 长期空间记忆:基于视野重叠(FOV)和相机距离采样,把那些"暂时消失但空间逻辑上还在"的关键帧存起来,防止长距离移动后几何扭曲。
更巧妙的是 Temporal Reframing(时间重组) 算法:传统 RoPE(旋转位置编码)有个缺陷——历史帧的影响力随距离单调递减。混元通过动态分配 RoPE,把空间关联度高的历史帧在时间维度上"拉近"到当前时刻。这种"时间折叠"让关键参照点永远在模型的有效感知范围内。
类比:就像你逛街时,虽然走了一公里,但你脑子里"商场入口在哪"这个记忆被你"拉近"了,随时能调出来。混元的时间重组干的就是让 AI 保持这种"关键地标不遗忘"。
5.4 WorldCompass RL:3D 空间奖励的强化学习
光靠监督学习(SFT)只能学会像素间的统计规律,难以约束复杂的三维几何逻辑。混元 1.5 引入了 WorldCompass RL 框架:
- 3D 基础模型当"裁判":用预训练的 3D 视觉大模型生成奖励信号,对生成视频的几何一致性和动作跟随准确性做闭环优化。
- 分段渐进式 Roll-Out:在相同历史背景下重复采样评估,提高训练稳定性。
- 稠密奖励:放弃传统 PPO,改用 On-policy Distillation(在线策略蒸馏),反馈更稠密,RL 训练更稳。
5.5 数据策略:32 万条视频的战略设计
混元 1.5 的强大建立在 320,000 条高质量视频之上,数据构成经过严密设计:
| 数据来源 | 占比 | 数量 | 作用 |
|---|---|---|---|
| 3A 级游戏录像 | 53.125% | 170,000 | 丰富交互逻辑、物理碰撞 |
| DL3DV 真实 3D 场景 | 18.75% | 60,000 | 真实物理空间建模 |
| UE 渲染合成数据 | 15.625% | 50,000 | 精确几何标注(Ground Truth) |
| 自然动态真实视频 | 12.5% | 40,000 | 自然界动态与交互 |
注意这个数据配比的智慧:超过一半是游戏数据(因为游戏有丰富的交互逻辑和物理碰撞),再加上真实 3D 场景(保证真实感)、合成数据(提供精确几何标注)、自然视频(补充动态多样性)。这是一个非常平衡的"四菜一汤"配置。
2026 年,混元团队更进一步,开源了混元世界模型 2.0——它不再只生成视频文件,而是直接生成可二次编辑的 3D 资产文件,能直接导入游戏引擎。这是从"世界模拟"到"世界创造"的关键一步。
六、具身智能核心:VLA 模型(RT-2 / Octo / π0 / OpenVLA)
世界模型解决的是"AI 能不能在脑子里推演世界",而 VLA 模型 解决的是"AI 能不能在物理世界里动手"。VLA = Vision-Language-Action(视觉-语言-动作),它是 2026 年机器人通用操控的核心研究方向。
6.1 VLA 模型是什么?为什么它如此重要?
先说清楚 VLA 到底在干什么。一个 VLA 模型的输入输出是这样的:
输入:图像(摄像头看到的画面) + 语言指令("把红色的杯子拿到桌子上")
输出:动作(机械臂的关节角度 / 末端执行器位姿)
说白了,VLA 就是让机器人**“看图听话干活”**。
为什么这件事难?因为传统机器人控制是"编程式"的——你得给每个任务写死一套规则。倒水是一个程序,开门是另一个程序,换个杯子就得重写。而 VLA 的目标是"通用泛化"——一个模型,学会抓取、放置、倒水、开门等上百种技能,还能泛化到没见过的物体和场景。
这就跟 LLM 的故事一模一样:用一个大规模预训练模型,替代无数个小模型。
6.2 VLA 模型演进时间线
| 时间 | 模型 | 里程碑意义 |
|---|---|---|
| 2022 | RT-1 | 首个大规模真实世界机器人 Transformer,35M 参数 |
| 2023 | RT-2 | 首次把 VLM 用于端到端机器人控制,55B 参数,涌现推理能力 |
| 2024 | Octo | 开源通用机器人策略,27M/93M,支持多机器人平台 |
| 2024 | OpenVLA | 开源 VLA,LLaMA2-7B + DINOv2 + SigLIP,7B 参数 |
| 2024 | RDT-1B | 双臂操作的扩散基础模型,1.2B 参数 |
| 2024 | π0 | Physical Intelligence 的流匹配 VLA,跨 8 种机器人 |
| 2026 | Ψ0 | 英伟达 + 南加州大学,通用人形机器人 Locos-Manipulation 基石模型 |
| 2026 | Goal-VLA | NUS 邵林团队,把生成式 VLM 当世界模型用 |
6.3 RT-2:VLA 的开山之作
RT-2 是 Google DeepMind 在 2023 年的工作,它是第一个把预训练大规模 VLM 直接用于端到端机器人控制的模型。它的核心创新是"动作文本化":
机器人动作有 8 个维度(Δx, Δy, Δz 位置偏移 + Δroll, Δpitch, Δyaw 姿态偏移 + 夹爪开合 + 终止信号)。RT-2 把每个维度离散成 256 个 bin,于是动作变成了一串数字,像句子一样:
Instruction: Bring me a drink.
Action: 1 128 127 133 144 102 99 255
这样 VLM 就能直接"输出"动作了。为了防止模型输出非法动作(比如输出"banana"),RT-2 用了 Vocabulary Masking——在输出动作 token 时,把所有非动作词的 logit 压成 -inf。
RT-2 最惊艳的是涌现能力:它在训练时没被教过"符号理解",但它能完成"把苹果移到数字 3 上"这种需要理解数字符号的任务;它能做"把可乐递给戴眼镜的人"这种需要人类识别的任务。这些能力是从互联网图文数据里"免费"迁移过来的。
这就是 VLA 相比传统机器人控制的根本优势:它继承了互联网级别的常识和语义理解。传统机器人不知道"杯子"是什么,VLA 知道。
6.4 Octo:开源通用机器人策略
Octo 的思路和 RT-2 不同——它不依赖大模型,而是用大量数据堆出一个通用策略。
- 数据:来自 Open X-Embodiment 的 25 个子数据集,共 80 万条轨迹。
- 架构:Transformer + Diffusion 解码头。支持多种输入(语言指令 / 目标图像 / 历史观测)。
- 参数:27M(Small)/ 93M(Base),非常轻量。
- 亮点:支持快速微调到新机器人和新传感器配置。你换一个机械臂,只需要少量数据微调就能用。
Octo 证明了"不一定非要大模型,数据量足够大也能实现泛化"。但它的天花板也比 RT-2/OpenVLA 低——因为没有互联网常识的加持,它处理不了太复杂的语义指令。
6.5 π0:流匹配的优雅解法
π0 是 Physical Intelligence(PI)公司的工作,它是 2026 年前最被看好的 VLA 之一。它的核心创新是用 Flow Matching(流匹配) 替代了传统的动作输出方式。
- 两阶段训练:预训练用多样但质量较低的互联网数据,微调用高质量的 8 种机器人双臂数据。
- 流匹配生成连续动作:不像 RT-2 把动作离散成 token,π0 用流匹配在连续空间里生成动作流,更适合精细操控。
- 跨机器人泛化:一个模型控制 8 种不同的机器人本体。
2026 年 3 月,英伟达联合南加州大学发布了 Ψ0,号称"碾压 π0.5"——它是一个通用人形机器人 Locos-Manipulation(行走+操控)的基石模型,标志着 VLA 从"单臂操控"走向"全身协调"。
6.6 OpenVLA:开源社区的希望
OpenVLA 是开源 VLA 的标杆,架构是 Prismatic VLM:
- 骨干:LLaMA 2-7B(语言)+ DINOv2 + SigLIP(双视觉编码器)。
- 数据:Open X-Embodiment 的 97 万条轨迹。
- 特点:7B 参数,支持全量微调 / 部分微调 / LoRA,用 Flash-Attention + FSDP 加速。
OpenVLA 的意义在于:它让普通研究者也能玩转 VLA。你不需要 55B 参数的 PaLI-X,一张 4090 就能微调 OpenVLA 做自己的机器人任务。
6.7 六大 VLA 模型对比总表
| 模型 | 架构 | 参数规模 | 动作输出 | 数据规模 | 核心优势 |
|---|---|---|---|---|---|
| RT-1 | Transformer | 35M | 离散(11 维) | 13 万条 | 大规模真实世界验证 |
| RT-2 | VLM (PaLI-X) | 55B | 文本 token | RT-1 + 互联网 | 涌现推理能力 |
| Octo | Transformer+Diffusion | 27M/93M | 扩散解码 | 80 万条 | 轻量开源,多平台 |
| OpenVLA | Prismatic VLM | 7B | 动作 token | 97 万条 | 开源标杆,可微调 |
| RDT-1B | Diffusion Transformer | 1.2B | 64 步序列 | 100 万+ | 双臂操作 |
| π0 | Flow Matching+VLM | 未公开 | 连续流 | 8 种机器人 | 跨本体泛化 |
一句话总结 VLA 现状:2026 年的 VLA 还很"暴力"——对真实数据的依赖极高。谁能用世界模型生成合成数据来训练 VLA,谁就能突破数据瓶颈。 这正是下一章要讲的。
七、世界模型如何赋能机器人:从仿真到现实(Sim2Real)
7.1 机器人训练的根本痛点:数据从哪来?
训练一个 VLA 模型需要海量数据。但机器人数据采集的成本高得吓人:
- 真实采集:一个熟练的操作员,采集一条高质量的机械臂倒水轨迹要 1-2 分钟。采集 10 万条需要 2 个操作员不眠不休干一年。成本?一条数据 10-50 美元,10 万条就是百万美元级。
- 远程遥操:用 VR 设备遥操机器人,效率高一点,但设备贵、磨损快。
- 现有数据集:Open X-Embodiment 虽然有百万条数据,但来自不同机器人、不同场景,质量参差不齐。
这就是世界模型的用武之地——它能在"脑内"无限生成训练数据。
7.2 Sim2Real:从仿真到现实的迁移
Sim2Real(Simulation to Reality) 是具身智能的核心技术路线。思路是:先让机器人在仿真环境里大量学习,再把能力迁移到现实世界。
传统 Sim2Real 的流程:
- 用物理引擎(如 MuJoCo、Isaac Sim)搭建仿真环境。
- 在仿真里训练机器人策略(可以用强化学习跑上亿次)。
- 用域随机化(Domain Randomization) 等技术缩小"虚实差距(Reality Gap)"。
- 部署到真实机器人。
但传统 Sim2Real 有个致命问题:仿真环境的真实感不够。物理引擎渲染的画面和真实世界差太远,机器人在仿真里学到的策略,到现实里经常"水土不服"。
7.3 世界模型如何重塑 Sim2Real
2026 年,世界模型给 Sim2Real 带来了革命性变化——用世界模型替代传统物理引擎做仿真:
| 维度 | 传统物理引擎仿真 | 世界模型仿真 |
|---|---|---|
| 渲染真实感 | 低(卡通级) | 高(照片级) |
| 物理精度 | 高(精确方程) | 中(学习近似) |
| 场景多样性 | 低(手动搭建) | 高(无限生成) |
| 长尾场景 | 难(要手动设计) | 易(文本触发) |
| 计算成本 | 中 | 高(但下降中) |
世界模型的优势在于:它能生成照片级真实、无限多样的场景。你想让机器人练习"在暴雪天端着咖啡上楼梯"?用物理引擎你得花几天搭场景,用世界模型你只需输入一句文本。
7.4 2026 年的新趋势:Real2Sim 与 SimFoundry
2026 年夏天,机器人圈出了个大新闻——李飞飞团队在 arXiv 挂了一篇论文《SimFoundry》,提出了 Real2Sim 范式:
只需一段真实世界视频,就能自动生成一个可以交互、训练、评测的机器人仿真环境。
这跟传统 Sim2Real 的方向正好反过来:
- Sim2Real:先在仿真训练,再迁移到现实。
- Real2Sim:先拍现实视频,再生成仿真环境,然后在仿真里训练。
为什么 Real2Sim 火?因为 Sim2Real 烧不起——搭一个高质量仿真场景成本太高。而 Real2Sim 用世界模型"一键生成"仿真环境,量大管饱。你可以拍 100 个真实厨房的视频,生成 100 个仿真厨房,让机器人在里面疯狂练习。
类比:Sim2Real 像"先建训练场再练兵",Real2Sim 像"拍下战场照片直接复刻成训练场"。后者显然更高效。
7.5 世界模型 + VLA 的闭环
2026 年最前沿的研究方向,是把世界模型和 VLA 闭环起来:
┌──────────────────────────────────────────┐
│ │
▼ │
┌──────────┐ 动作 ┌──────────┐ │
│ VLA 模型 │ ─────────> │ 世界模型 │ │
│ (决策者) │ │ (推演者) │ │
└──────────┘ <───────── └──────────┘ │
▲ 新状态 │
│ │
└──────────────────────────────────────────┘
这个闭环的含义是:
- VLA 根据当前观测输出一个动作。
- 世界模型根据动作推演出"下一帧世界状态"。
- VLA 根据新状态再决策。
- 循环往复。
这样做的好处是:机器人可以先在"世界模型的脑内沙盘"里"想"一遍,再在现实里执行。这就是 LeCun 一直主张的"模型预测控制(MPC)"思路——AI 在行动前,先在内部世界模型里"预演"后果。
NUS 邵林团队在 ICRA 2026 发表的 Goal-VLA 就是这个方向:它把生成式 VLM 当作世界模型,让 VLA 先"想象"目标状态,再生成动作去达成目标。这种"先想后做"的范式,被认为是通向真正具身 AGI 的关键路径。
八、代码实战:用 PyTorch 实现一个简化版世界模型
光讲理论不过瘾,咱们来写代码。下面我用 PyTorch 实现一个简化版的下一帧预测世界模型,包含完整的训练循环。这个模型基于"潜空间预测"思路(借鉴 JEPA),能在 Atari 游戏环境上做下一帧预测。
8.1 整体架构设计
我们的简化版世界模型包含三个核心模块:
- Encoder(编码器):把图像编码到潜空间。
- Dynamics Predictor(动力学预测器):根据当前潜变量 + 动作,预测下一时刻潜变量。
- Decoder(解码器):把潜变量解码回图像(用于可视化)。
"""
简化版世界模型实现
基于潜空间预测的下一帧预测模型
适用于 Atari 等简单环境
"""
import torch
import torch.nn as nn
import torch.nn.functional as F
from torch.utils.data import DataLoader, Dataset
import numpy as np
from collections import deque
import random
# ============================================================
# 模块一:图像编码器(把图像压缩到潜空间)
# ============================================================
class Encoder(nn.Module):
"""将图像编码到潜空间表示"""
def __init__(self, in_channels=3, latent_dim=256):
super().__init__()
self.conv = nn.Sequential(
nn.Conv2d(in_channels, 32, kernel_size=4, stride=2, padding=1), # 64x64 -> 32x32
nn.ReLU(),
nn.Conv2d(32, 64, kernel_size=4, stride=2, padding=1), # 32x32 -> 16x16
nn.ReLU(),
nn.Conv2d(64, 128, kernel_size=4, stride=2, padding=1), # 16x16 -> 8x8
nn.ReLU(),
nn.Conv2d(128, 256, kernel_size=4, stride=2, padding=1), # 8x8 -> 4x4
nn.ReLU(),
)
self.fc = nn.Linear(256 * 4 * 4, latent_dim)
def forward(self, x):
# x: (B, C, 64, 64)
h = self.conv(x)
h = h.view(h.size(0), -1)
z = self.fc(h)
return z # (B, latent_dim)
# ============================================================
# 模块二:动力学预测器(在潜空间预测未来)
# ============================================================
class DynamicsPredictor(nn.Module):
"""根据当前潜变量和动作,预测下一时刻潜变量
这是世界模型的"大脑"——它学习物理世界的动态规律
"""
def __init__(self, latent_dim=256, action_dim=7, hidden_dim=512, num_layers=2):
super().__init__()
# 动作嵌入
self.action_embed = nn.Linear(action_dim, hidden_dim)
# 状态嵌入
self.state_embed = nn.Linear(latent_dim, hidden_dim)
# 循环网络(用 GRU 做时序建模)
self.gru = nn.GRU(hidden_dim, hidden_dim, num_layers=num_layers, batch_first=True)
# 输出层
self.output = nn.Linear(hidden_dim, latent_dim)
def forward(self, z, action, hidden=None):
"""
z: (B, latent_dim) 当前状态潜变量
action: (B, action_dim) 当前动作
hidden: (num_layers, B, hidden_dim) GRU 隐状态
"""
# 融合状态和动作
s = self.state_embed(z).unsqueeze(1) # (B, 1, hidden_dim)
a = self.action_embed(action).unsqueeze(1) # (B, 1, hidden_dim)
x = s + a # 简单相加(也可用拼接)
# GRU 前向
out, hidden = self.gru(x, hidden)
z_pred = self.output(out.squeeze(1)) # (B, latent_dim)
return z_pred, hidden
# ============================================================
# 模块三:图像解码器(把潜变量还原成图像,用于可视化)
# ============================================================
class Decoder(nn.Module):
"""将潜变量解码为图像"""
def __init__(self, latent_dim=256, out_channels=3):
super().__init__()
self.fc = nn.Linear(latent_dim, 256 * 4 * 4)
self.deconv = nn.Sequential(
nn.ConvTranspose2d(256, 128, kernel_size=4, stride=2, padding=1), # 4x4 -> 8x8
nn.ReLU(),
nn.ConvTranspose2d(128, 64, kernel_size=4, stride=2, padding=1), # 8x8 -> 16x16
nn.ReLU(),
nn.ConvTranspose2d(64, 32, kernel_size=4, stride=2, padding=1), # 16x16 -> 32x32
nn.ReLU(),
nn.ConvTranspose2d(32, out_channels, kernel_size=4, stride=2, padding=1), # 32x32 -> 64x64
)
def forward(self, z):
h = self.fc(z).view(z.size(0), 256, 4, 4)
x_recon = self.deconv(h)
return x_recon # (B, C, 64, 64)
# ============================================================
# 完整的世界模型
# ============================================================
class WorldModel(nn.Module):
"""完整的简化版世界模型
包含编码器、动力学预测器、解码器
支持单步预测和多步预测(rollout)
"""
def __init__(self, in_channels=3, latent_dim=256, action_dim=7, hidden_dim=512):
super().__init__()
self.encoder = Encoder(in_channels, latent_dim)
self.dynamics = DynamicsPredictor(latent_dim, action_dim, hidden_dim)
self.decoder = Decoder(latent_dim, in_channels)
self.latent_dim = latent_dim
def encode(self, obs):
"""观测 -> 潜变量"""
return self.encoder(obs)
def predict_next(self, z, action, hidden=None):
"""预测下一时刻潜变量"""
return self.dynamics(z, action, hidden)
def decode(self, z):
"""潜变量 -> 图像"""
return self.decoder(z)
def rollout(self, z0, actions, n_steps):
"""多步预测(在潜空间里"想象"未来)
z0: (B, latent_dim) 初始状态
actions: (B, n_steps, action_dim) 动作序列
返回: 预测的未来潜变量序列
"""
z = z0
hidden = None
predictions = []
for t in range(n_steps):
z, hidden = self.dynamics(z, actions[:, t], hidden)
predictions.append(z)
return torch.stack(predictions, dim=1) # (B, n_steps, latent_dim)
# ============================================================
# 训练用的经验回放缓冲区
# ============================================================
class ReplayBuffer:
"""存储 (obs, action, next_obs) 转换的回放缓冲区"""
def __init__(self, capacity=100000):
self.buffer = deque(maxlen=capacity)
def push(self, obs, action, next_obs):
self.buffer.append((obs, action, next_obs))
def sample(self, batch_size):
batch = random.sample(self.buffer, batch_size)
obs, action, next_obs = zip(*batch)
return (
torch.stack(obs),
torch.stack(action),
torch.stack(next_obs),
)
def __len__(self):
return len(self.buffer)
# ============================================================
# 训练函数
# ============================================================
def train_world_model(model, buffer, optimizer, device,
batch_size=64, n_steps=5, epochs=100):
"""训练世界模型
损失函数包含两部分:
1. 单步预测损失:在潜空间预测下一状态
2. 重建损失:解码器能正确还原图像(保证潜变量有语义)
"""
model.train()
for epoch in range(epochs):
total_loss = 0
total_pred_loss = 0
total_recon_loss = 0
for _ in range(len(buffer) // batch_size):
obs, actions, next_obs = buffer.sample(batch_size)
obs, actions, next_obs = obs.to(device), actions.to(device), next_obs.to(device)
# --- 编码当前和下一观测 ---
z = model.encode(obs) # (B, latent_dim)
z_next = model.encode(next_obs) # (B, latent_dim)
# --- 损失1:潜空间单步预测损失 ---
z_pred, _ = model.predict_next(z, actions)
pred_loss = F.mse_loss(z_pred, z_next.detach()) # 预测和真实潜变量的 MSE
# --- 损失2:重建损失(保证潜变量包含图像信息)---
obs_recon = model.decode(z)
recon_loss = F.mse_loss(obs_recon, obs)
# --- 总损失 ---
loss = pred_loss + 0.5 * recon_loss
optimizer.zero_grad()
loss.backward()
torch.nn.utils.clip_grad_norm_(model.parameters(), max_norm=1.0)
optimizer.step()
total_loss += loss.item()
total_pred_loss += pred_loss.item()
total_recon_loss += recon_loss.item()
n_batches = max(len(buffer) // batch_size, 1)
print(f"Epoch {epoch+1}/{epochs} | "
f"Loss: {total_loss/n_batches:.4f} | "
f"Pred: {total_pred_loss/n_batches:.4f} | "
f"Recon: {total_recon_loss/n_batches:.4f}")
return model
# ============================================================
# 推理:用世界模型"想象"未来
# ============================================================
@torch.no_grad()
def imagine_future(model, initial_obs, action_seq, device, n_steps=10):
"""用世界模型想象未来 n_steps 步的画面
initial_obs: (1, C, 64, 64) 初始观测
action_seq: (1, n_steps, action_dim) 动作序列
返回: 预测的未来画面序列
"""
model.eval()
initial_obs = initial_obs.to(device)
action_seq = action_seq.to(device)
# 编码初始状态
z = model.encode(initial_obs)
# 在潜空间里 rollout
future_z = model.rollout(z, action_seq, n_steps) # (1, n_steps, latent_dim)
# 解码成画面
future_frames = []
for t in range(n_steps):
frame = model.decode(future_z[:, t])
future_frames.append(frame)
return torch.stack(future_frames, dim=1) # (1, n_steps, C, 64, 64)
# ============================================================
# 主函数:完整训练 demo
# ============================================================
if __name__ == "__main__":
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
print(f"Using device: {device}")
# 超参数
LATENT_DIM = 256
ACTION_DIM = 7 # 假设 7 维动作(类似 RT-1)
HIDDEN_DIM = 512
BATCH_SIZE = 64
EPOCHS = 50
BUFFER_SIZE = 20000
# 初始化模型
model = WorldModel(
in_channels=3,
latent_dim=LATENT_DIM,
action_dim=ACTION_DIM,
hidden_dim=HIDDEN_DIM
).to(device)
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=1e-5)
buffer = ReplayBuffer(capacity=BUFFER_SIZE)
print(f"模型参数量: {sum(p.numel() for p in model.parameters()) / 1e6:.2f}M")
# === 用随机数据填充 buffer 做 demo ===
# 实际使用时,请替换为真实环境数据(如 gym 采集的轨迹)
print("正在生成模拟数据...")
for _ in range(BUFFER_SIZE):
obs = torch.rand(3, 64, 64) # 模拟观测
action = torch.rand(ACTION_DIM) # 模拟动作
next_obs = torch.rand(3, 64, 64) # 模拟下一观测
buffer.push(obs, action, next_obs)
# === 训练 ===
print("开始训练世界模型...")
model = train_world_model(model, buffer, optimizer, device,
batch_size=BATCH_SIZE, epochs=EPOCHS)
# === 推理:想象未来 ===
print("用世界模型想象未来 10 步...")
initial_obs = torch.rand(1, 3, 64, 64)
action_seq = torch.rand(1, 10, ACTION_DIM)
future = imagine_future(model, initial_obs, action_seq, device, n_steps=10)
print(f"未来画面形状: {future.shape}") # (1, 10, 3, 64, 64)
print("完成!预测的未来画面可用于规划或数据增强。")
8.2 代码解读
这段代码虽然简化,但包含了世界模型的几个核心设计思想:
- 潜空间预测(对应 JEPA 思想):我们不直接在像素空间预测下一帧,而是在 Encoder 编码出的潜空间里预测。
pred_loss = F.mse_loss(z_pred, z_next.detach())这一行就是关键——让预测的潜变量逼近真实的下一帧潜变量。 - 多步 rollout:
rollout方法可以在潜空间里连续预测多步未来,这就是世界模型的"想象力"。机器人可以用它来做模型预测控制(MPC)——在脑子里预演多个动作序列,选最优的执行。 - 重建损失辅助:光有潜空间预测损失不够(潜变量可能崩坏),所以加了重建损失让潜变量保持语义。注意重建损失权重(0.5)比预测损失(1.0)低,因为我们的重点是预测,不是重建。
- GRU 做时序记忆:动力学预测器用 GRU 维护隐状态,能记住历史信息,这对长程预测很重要。
8.3 如何扩展到真实场景
上面是教学版,要应用到真实场景,需要做这些升级:
| 升级点 | 教学版 | 工业版 |
|---|---|---|
| Encoder | 简单 CNN | ViT / 预训练视觉编码器 |
| Dynamics | GRU | Causal Transformer(如 Genie 3) |
| 预测方式 | 单步潜空间 | 多步潜空间 + 扩散去噪 |
| 动作表征 | 连续向量 | 潜动作模型(LAM)自监督学习 |
| 重建 | 像素 MSE | VAE / GAN / Diffusion 解码 |
| 记忆机制 | GRU 隐状态 | KV-Cache + 上下文记忆重构 |
| 训练数据 | 随机数据 | 真实视频 + 游戏录像 + 合成数据 |
想深入研究的同学,可以去看 Google 的 DreamerV3(基于世界模型的强化学习)、混元的 WorldPlay 开源代码(github.com/Tencent-Hunyuan/HY-WorldPlay),以及 LeCun 的 V-JEPA 开源实现。
九、世界模型的评估:物理一致性、时间连贯性、交互可控性
做完世界模型,怎么评估它好不好?这跟评估 LLM 完全不同——LLM 看 BLEU/ROUGE/MMLU,世界模型看的是"它模拟的世界像不像真的"。
9.1 三大核心评估维度
2026 年学术界和工业界已经形成共识,世界模型的评估围绕三大核心维度:
维度一:物理一致性(Physical Consistency)
问题:模型生成的世界,物理规律对不对?
评估内容:
- 物体不会穿墙(碰撞检测)
- 重力方向一致(东西往下掉,不会往上飘)
- 物体形状保持(球还是球,不会变成方块)
- 光影方向一致(太阳在左边,阴影就在右边)
评估方法:
- 用 3D 基础模型(如 Depth Anything、DUSt3R)提取生成视频的深度图和点云,检查几何一致性。
- 用物理引擎做"反验":把生成视频里的物体运动轨迹提取出来,放进物理引擎里跑,看是否符合物理定律。
- 闭环轨迹测试:让相机走一个闭环路径(出去再回来),检查场景是否复现。混元 1.5 在这个测试上表现优异。
维度二:时间连贯性(Temporal Coherence)
问题:视频在时间维度上连贯吗?
评估内容:
- 相邻帧之间没有跳变(运动平滑)
- 长程生成不崩坏(生成 250 帧以上还能保持质量)
- 误差不累积(不会越生成越糊)
评估指标:
| 指标 | 全称 | 含义 | 越X越好 |
|---|---|---|---|
| PSNR | Peak Signal-to-Noise Ratio | 峰值信噪比 | 越高越好 |
| SSIM | Structural Similarity Index | 结构相似性 | 越高越好 |
| LPIPS | Learned Perceptual Image Patch Similarity | 感知相似度 | 越低越好 |
| FVD | Fréchet Video Distance | 视频距离 | 越低越好 |
| VBench | Video Benchmark | 综合视频评测 | 越高越好 |
混元 1.5 在短程(61 帧)和长程(250+ 帧)评估中,PSNR、SSIM、LPIPS 均优于 CameraCtrl、ViewCrafter 等基准模型,且长程领先优势更大(得益于重构记忆机制)。
维度三:交互可控性(Interactive Controllability)
问题:用户能精准控制世界吗?
评估内容:
- 动作跟随准确性(按 W 真的往前走)
- 相机位姿控制精度(亚像素级)
- 文本指令响应("把天气改成下雨"能生效)
- 多步控制不漂移(连续控制 100 步还听话)
评估方法:
- 动作跟随评分:用预训练模型判断生成画面是否符合输入动作。
- 闭环控制测试:给定目标位置,看模型能否通过一系列动作到达。
- 人类评估:让真人玩模型生成的世界,打分"操控感"如何。
9.2 WorldArena:2026 年的世界模型竞技场
2026 年,国际顶级的世界模型评测榜单 WorldArena 已经成为各家公司刷榜的战场。评测维度就是上述三大核心:时空连贯性、动作可控性、物理一致性。
有意思的是,2026 年登上 WorldArena 最终榜单第一的,不是 Google 也不是 NVIDIA,而是一款"成都造"的中国模型——它在大幅降低训练成本的情况下,三项指标全面领先。这说明世界模型赛道还远未定型,算法创新比单纯堆算力更重要。
9.3 评估维度的权衡
三大维度之间往往存在权衡:
物理一致性
/\
/ \
/ \
/ 优化 \
/ 区域 \
/__________\
/ \
/ \
/ \
时间连贯性 ──── 交互可控性
- AR-Transformer(Genie 3):交互可控性强,物理一致性中,时间连贯性中。
- AR-DiT(混元 1.5):时间连贯性强,物理一致性中,交互可控性中。
- Spatial-Native(Marble):物理一致性强,时间连贯性中,交互可控性中。
没有模型能在三角形中心(三项全优),这就是当前研究的发力点。
十、2026 年四大巅峰架构对比:Genie 3、混元 1.5、Marble、Gen-3C
讲了这么多,这一章把 2026 年四大巅峰架构放在一起做个全面对比。这是全文最值得收藏的部分。
10.1 四大架构全景对比表
| 维度 | Genie 3 | 混元 1.5 | Marble | Gen-3C |
|---|---|---|---|---|
| 出品方 | Google DeepMind | 腾讯 | World Labs(李飞飞) | NVIDIA |
| 架构流派 | AR-Transformer | AR-DiT | Spatial-Native(3DGS) | Spatial-Native(点云引导) |
| 核心思想 | 世界即语言 | 世界即演化 | 世界即实体 | 先骨架后纹理 |
| 参数规模 | 110 亿 | 未公开(蒸馏后轻量) | 未公开 | 未公开(Cosmos 系列) |
| 分辨率 | 720p | 高清 | 高清 | 高清 |
| 实时性 | 是(KV-Cache) | 24 FPS | 是(RTFM) | 是 |
| 动作控制 | 潜动作模型(LAM) | 双分支表征 | Chisel 几何约束 | 相机位姿精确控制 |
| 记忆机制 | 128k 上下文 + KV-Cache | 重构上下文记忆 | 3D 场持久存在 | 3D Cache 点云缓存 |
| 长程一致性 | 强(因果链记忆) | 强(时间重组) | 巅峰(3D 锚定) | 强(点云重投影) |
| 视觉真实感 | 中(数码感) | 巅峰(扩散精细) | 强(神经渲染) | 强(骨架+纹理) |
| 物理逻辑 | 强(因果链) | 中(绵软) | 中 | 中 |
| 3D 资产导出 | 否 | 否(1.5)/ 是(2.0) | 是(USD/PLY) | 是(点云) |
| 开源情况 | 闭源 | 开源(1.5)/ 开源(2.0) | 部分开源 | Cosmos 部分开源 |
| 典型应用 | 自动驾驶仿真、游戏 | 交互叙事、3D 重建 | XR 创作、数字孪生 | 具身智能训练 |
10.2 四大架构的技术差异详解
Genie 3:因果逻辑之王
Genie 3 最大的护城河是因果逻辑密度。因为它走纯自回归路径,每一个动作的后果都是"显式预测"出来的,因果关系链条清晰。在游戏场景里,你按一个开关,它知道远处的门要开——这种长程因果在扩散模型里很难做到。
但代价是视觉细节的"数码感"——分词器压缩让纹理不够细腻。
混元 1.5:视觉真实感之王
混元 1.5 的杀手锏是视觉真实感 + 实时性兼得。AR-DiT 架构让它在光影、流体、材质上达到照片级;Context Forcing 蒸馏让它跑到 24 FPS。重构上下文记忆 + 时间重组算法解决了长程漂移。
短板是物理逻辑偶尔"绵软"——碰撞像橡皮泥,这是扩散模型的通病。
Marble:空间稳定之王
Marble 的核心优势是**“生成即资产”**。它生成的不是像素,而是 3D 高斯椭球体——这意味着世界是"实体存在"的。相机怎么转都不会穿帮,而且能导出成 USD/PLY 直接进 UE5。Chisel 交互层让用户能像雕刻师一样精准控制生成。
短板是数据门槛极高(需要 4D 数据),且动态物体处理弱。
Gen-3C:工程美学之王
Gen-3C 的 3D Cache 机制极具工程美感:先用深度预测把每帧像素投射成点云缓存,再用点云当"骨架"引导扩散模型填充纹理。这种"先建骨架,再填肉"的方法,让相机位姿控制达到亚像素级精度,是具身智能训练的绝佳环境。
10.3 如何选择?
根据你的应用场景选架构:
| 你的需求 | 推荐架构 | 理由 |
|---|---|---|
| 做交互式游戏,需要强因果逻辑 | Genie 3 | AR 路线因果链最清晰 |
| 做影视/虚拟制作,要极致画质 | 混元 1.5 | AR-DiT 视觉真实感巅峰 |
| 做 XR / 数字孪生 / 3D 建模 | Marble | 生成 3D 资产,可导出 |
| 做机器人训练仿真环境 | Gen-3C | 亚像素级位姿控制 |
| 做自动驾驶仿真 | Genie 3 | Waymo 已验证 |
| 做交互式叙事 | 混元 1.5 | 支持文本事件触发 |
十一、挑战与展望:数据瓶颈、泛化能力、安全部署
世界模型和具身智能虽然火,但远没到"大功告成"的时候。这一章讲讲 2026 年这个领域还面临的硬骨头。
11.1 挑战一:数据瓶颈
问题:世界模型和 VLA 都是"数据 hungry"的怪兽。
- 世界模型需要海量视频数据(混元 1.5 用了 32 万条),但高质量、带标注(深度、相机参数、动作)的 4D 数据极其稀缺。
- VLA 需要机器人操作轨迹数据,一条数据成本 10-50 美元,百万条就是天文数字。
- Open X-Embodiment 虽然有百万条数据,但来自不同机器人、不同场景,标准化困难。
破局方向:
- 世界模型生成合成数据:用世界模型无限生成训练数据,形成"世界模型 → 合成数据 → VLA 训练"的闭环。这是 2026 年最热的方向。
- Real2Sim:李飞飞的 SimFoundry 用一段视频自动生成仿真环境,大幅降低数据获取成本。
- 人类中心数据:像 DexCap 那样用人体动捕数据训练机器人,绕过机器人数据采集。
11.2 挑战二:泛化能力
问题:当前的世界模型和 VLA,泛化能力还远不够。
- 世界模型在训练分布内的场景表现好,但遇到没见过的物理现象(比如非牛顿流体)就会崩。
- VLA 在训练过的任务上表现不错,但换个稍微不同的场景(比如换一个形状奇怪的杯子)就抓不住。
- Sim2Real 的"虚实差距"依然存在——仿真里 100 分,现实里可能只有 60 分。
破局方向:
- 更大规模的预训练:让世界模型见过更多场景,提升分布外泛化。
- 组合泛化:让模型学会"原子技能"的组合,而不是死记硬背每个任务。
- 闭环纠错:VLA 在执行中持续观测、持续纠错,而不是一次性输出动作。
11.3 挑战三:安全部署
问题:让 AI 控制物理世界,安全是头等大事。
- 一个 LLM 幻觉最多编个假新闻,一个 VLA "幻觉"可能把人推下楼梯。
- 世界模型如果学错了物理规律(比如认为火可以摸),VLA 在它的指导下会做出危险动作。
- 长尾场景(比如突然冲出的行人)难以穷尽测试。
破局方向:
- 安全约束层:在 VLA 输出动作前加一层安全过滤(如控制障碍函数 CBF),保证动作不违反安全约束。
- 人机协作:AI 做规划,人类做审批;高风险动作必须人类确认。
- 渐进式部署:从低风险场景(矿山巡检、园区配送)起步,积累信任后再进家庭。
11.4 2026 后半年的展望
基于 2026 年上半年的技术进展,我对后半年的趋势做几个判断:
- 世界模型 2.0 浪潮:从"生成视频"走向"生成可编辑 3D 资产"(混元 2.0 已开先河),这是质变。
- VLA + 世界模型闭环成为主流范式:Goal-VLA 这类"先想后做"的架构会爆发。
- 人形机器人量产拐点:智元机器人产能突破 15000 台,宇树等厂商跟进,硬件成本下降会反哺算法迭代。
- 统一"世界-语言"基础模型浮现:一个模型既能说话、又能推演物理世界、还能输出动作——这可能是 AGI 的终极形态。
- WAIC 2026(7 月 17 日) 将成为世界模型和具身智能的"春晚",各大厂商会集中发布新成果。
十二、面试高频问答 10 题
这一章整理了世界模型和具身智能方向的高频面试题,每题都给出"面试官想听什么"的要点。
Q1:世界模型和视频生成模型有什么区别?
答:核心区别在于"是否理解世界"。
- 视频生成模型(如早期的 Sora)本质是像素级概率采样器,目标是让画面"看起来像",但缺乏状态持久性——相机转 360 度后物体会变形或消失。
- 世界模型必须满足三个硬指标:交互性(响应动作指令)、因果连贯性(动作后果符合物理逻辑)、几何稳定性(三维层面的持久性)。
一句话:视频生成是"放电影",世界模型是"造世界"。
Q2:LeCun 的 JEPA 和主流世界模型(如 Genie 3)有什么区别?
答:区别在"预测空间"。
- JEPA 在潜在抽象空间做预测,不要求重建像素,避免算力浪费在无意义细节上。优点是高效、抽象,缺点是不直观、难以可视化。
- Genie 3 等在像素/视频空间做预测,能直接看到生成画面,适合交互应用。缺点是计算开销大、容易陷入像素细节。
趋势是融合:JEPA 的潜空间预测用于"内部推演"(如机器人规划),像素级生成用于"可视化交互"。
Q3:世界模型的三大流派各有什么优劣?
答:
- AR-Transformer(Genie 3):因果逻辑强、推理快、可扩展;视觉有数码感、长程漂移。
- AR-DiT(混元 1.5):视觉真实感巅峰、已实时化;物理逻辑绵软、计算成本高。
- Spatial-Native(Marble/Gen-3C):空间稳定巅峰、支持 3D 资产导出;数据门槛高、动态物体弱。
选择取决于应用场景:游戏选 AR-Transformer,影视选 AR-DiT,XR/机器人选 Spatial-Native。
Q4:Genie 3 的潜动作模型(LAM)是如何工作的?为什么不需要动作标注?
答:LAM 通过自监督学习从视频帧间变化中推断动作。
训练时,LAM 对比"当前帧"和"下一帧"的像素位移和物体形变,自动推断导致变化的原因(即"动作"),并构建一个 8-16 维的控制向量空间。推理时,用户的按键信号被映射到这个自学出的动作空间。
不需要标注是因为:动作的本质就是"导致状态变化的原因",而状态变化(帧间差异)是可以从视频里自动提取的。
Q5:VLA 模型相比传统机器人控制有什么优势?
答:核心优势是通用泛化 + 互联网常识。
传统机器人控制是"一任务一程序",换个物体就得重写。VLA 用一个大规模预训练模型处理所有任务,而且继承了互联网图文数据的语义理解——它知道"杯子"是什么、"红色"是什么、"递给"是什么。
RT-2 展示了涌现能力:没专门训练过"把苹果移到数字 3 上",但它能完成,因为它从互联网数据里学会了数字和苹果的语义。
Q6:RT-2 是如何把连续动作变成文本 token 的?
答:RT-2 用了"动作离散化 + 文本化":
- 机器人动作有 8 个维度(位置偏移、姿态偏移、夹爪、终止信号)。
- 每个维度离散成 256 个 bin(编号 0-255)。
- 动作变成一串数字,像句子:“1 128 127 133 144 102 99 255”。
- VLM 直接输出这串数字 token。
- 用 Vocabulary Masking 防止输出非法 token(如"banana")。
这种设计让 VLM 不需要修改架构就能输出动作,非常优雅。
Q7:Sim2Real 的"虚实差距"如何缓解?世界模型能帮上什么忙?
答:传统方法用域随机化(随机化仿真中的光照、纹理、物理参数)来提升鲁棒性。
世界模型带来的新解法:
- 照片级仿真:世界模型生成的画面比物理引擎真实得多,天然缩小了视觉差距。
- 无限场景生成:世界模型可以文本触发各种长尾场景(暴雪、逆光、拥挤人群)。
- Real2Sim:用真实视频自动生成仿真环境,保证仿真和现实的分布一致。
Q8:混元 1.5 的 Context Forcing 解决了什么问题?
答:解决了扩散模型蒸馏中的"记忆失配"问题。
传统蒸馏时,教师模型(训练时)能看到全局信息,学生模型(推理时)只能看过去——这种信息不对称导致蒸馏误差爆炸,学生模型"失忆"。
Context Forcing 用掩码强制教师模型的记忆环境和学生模型完全一致,让教师传授的知识精准适配学生的因果推理模式。结果:学生模型 4 步去噪就能生成高质量画面,跑满 24 FPS。
Q9:世界模型如何用于机器人的模型预测控制(MPC)?
答:MPC 的思路是"先想后做":
- 当前观测输入世界模型,编码成潜变量。
- 假设多个候选动作序列,用世界模型在潜空间 rollout 预测未来。
- 用奖励函数评估每个动作序列的未来回报。
- 选最优动作序列的第一个动作执行。
- 观测真实结果,更新世界模型(修正预测误差)。
世界模型就是 MPC 的"内部仿真器"。LeCun 一直主张这是通向 AGI 的正确路径。
Q10:2026 年世界模型和具身智能最大的挑战是什么?
答:数据瓶颈 + 安全部署。
数据方面:高质量 4D 数据(带深度、相机参数)和机器人轨迹数据都极其昂贵,现有数据集规模远不够训练通用模型。破局方向是用世界模型生成合成数据形成闭环。
安全方面:AI 控制物理世界的风险远高于纯文本 AI。一个 VLA 幻觉可能造成物理伤害。需要安全约束层、人机协作、渐进式部署等多重保障。
十三、总结
写到这里,这篇万字长文该收尾了。最后帮你把全文核心串一遍:
世界模型的本质
世界模型是 AI 在"脑内"模拟物理世界动态的能力。它不是"放电影"(视频生成),而是"造世界"(可交互、因果连贯、几何稳定)。从 LeCun 的 JEPA 理论,到 Genie 3 的工程实现,世界模型正在成为通向物理 AGI 的底层操作系统。
三大流派的核心取舍
- AR-Transformer(Genie 3):押注逻辑,因果链最清晰,适合游戏和自动驾驶仿真。
- AR-DiT(混元 1.5):押注视觉,真实感巅峰且已实时化,适合影视和交互叙事。
- Spatial-Native(Marble/Gen-3C):押注几何,空间稳定且支持 3D 资产导出,适合 XR 和机器人训练。
没有流派能三项全优,这正是研究最激烈的战场。
VLA 是具身智能的"GPT 时刻"
从 RT-1 到 π0 到 Ψ0,VLA 正在重走 LLM 的路——用大规模预训练实现通用泛化。但它比 LLM 多了一个"物理执行"的维度,挑战也更大。VLA + 世界模型的闭环(先想后做),被认为是通向具身 AGI 的关键路径。
2026 年是关键拐点
- 混元 2.0 开创"生成可编辑 3D 资产"新范式
- Real2Sim(SimFoundry)让仿真环境"一键生成"
- 人形机器人量产拐点到来,硬件成本下降反哺算法
- WAIC 2026 将集中展示新成果
给读者的建议
如果你想进入这个赛道:
- 先跑通开源项目:混元 WorldPlay、OpenVLA、DreamerV3 都有开源代码,先跑起来再改。
- 理解三大流派的权衡:不要盲目追某个架构,要根据应用场景选。
- 关注数据闭环:世界模型生成合成数据训练 VLA,这是最可能突破数据瓶颈的方向。
- 盯紧 WAIC 2026:7 月 17 日,各大厂商会集中发布新成果,这是风向标。
世界模型和具身智能,本质上是让 AI 从"会说"走向"会做",从"数字空间"走向"物理世界"。这条路比 LLM 更难,但也更接近真正的智能。2026 年只是起点,好戏才刚开场。
如果这篇文章对你有帮助,点个赞收个藏,我们下篇见。
参考资料
- LeCun, Y. “A Path Towards Autonomous Machine Intelligence.” (2022)
- Google DeepMind. “Genie 3: Interactive World Model.” (2025)
- Tencent Hunyuan. “HY-World 1.5: WorldPlay Framework.” (2025) — github.com/Tencent-Hunyuan/HY-WorldPlay
- World Labs. “Marble: RTFM Architecture for 3D World Generation.” (2026)
- NVIDIA. “Gen-3C: 3D-Informed World-Consistent Video Generation.” CVPR 2025
- Brohan et al. “RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.” (2023)
- Octo Team. “Octo: An Open-Source Generalist Robot Policy.” (2024)
- Physical Intelligence. “π0: A Vision-Language-Action Flow Model for General Robot Control.” (2024)
- NVIDIA + USC. “Ψ0: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation.” (2026)
- NUS 邵林团队. “Goal-VLA: Image-Generative VLMs as Object-Centric World Models.” ICRA 2026
- 李飞飞团队. “SimFoundry: Real2Sim via Video-to-Simulation.” arXiv 2606.28276 (2026)
- NYU + AMI. “AdaJEPA: Adaptive Latent World Model.” (2026)
本文内容跟进至 2026 年 7 月最新技术进展。世界模型和具身智能领域发展极快,部分信息可能随时间推移而更新,请以官方发布为准。
更多推荐

所有评论(0)