表征式世界模型的布局公司(含JEPA谱系)
表征式世界模型的布局公司(含JEPA谱系)
| 作者 | Qwen |
|---|---|
| 提示词作者 | 将狼才鲸 |
| 创建日期 | 2026-07-30 |
一、表征式世界模型(抽象表征、潜空间):概念简述与全部公司详解
第一部分:什么是表征式世界模型?
一句话定义
表征式世界模型(Representational World Model)是一种在学习到的抽象表征空间(latent space)中预测未来状态演化的AI架构,不需要也不追求像素级重建。
核心思想
传统生成式世界模型(如Sora、视频扩散模型)的逻辑是:
看到画面 → 生成下一帧像素画面 → 从画面中提取信息
表征式世界模型的逻辑是:
看到画面 → 编码为抽象语义向量 → 在潜空间预测未来状态 → 直接用于决策/规划
两大经典谱系
| 谱系 | 代表 | 核心机制 | 关键特征 |
|---|---|---|---|
| JEPA谱系 | Meta I-JEPA → V-JEPA → AdaJEPA → LeWorldModel | 联合嵌入预测架构:编码器将输入映射到latent space,预测器在latent space预测未来表征 | 自监督、不重建像素、预测抽象特征 |
| Dreamer谱系 | DeepMind DreamerV1/V2/V3 | 在潜空间学习状态转移动力学 s_{t+1}=f(s_t, a_t),用"想象"(imagination)做规划 | 强化学习、潜空间动力学、奖励预测 |
与生成式世界模型的根本区别
| 维度 | 表征式(JEPA/Dreamer等) | 生成式(Sora/视频扩散等) |
|---|---|---|
| 预测目标 | 抽象语义特征/状态向量 | 像素/视频帧 |
| 是否需要像素重建 | ❌ 不需要 | ✅ 需要 |
| 计算效率 | 高(低维潜空间) | 低(高维像素空间) |
| 物理泛化性 | 强(跨越视觉噪声) | 弱(受纹理/光照干扰) |
| 适用场景 | 机器人控制、规划、决策 | 视频生成、仿真可视化 |
为什么2026年爆发?
2026年被业界称为"世界模型元年"。LeCun离开Meta创立AMI Labs(10.3亿美元种子轮),明确押注JEPA路线;智源研究院提出从"Next Token Prediction"到"Next State Prediction"的范式迁移;WAIC 2026设立"世界模型六小龙"巅峰论坛——表征式世界模型从学术前沿全面进入产业化竞速。
第二部分:全部15家公司详细介绍
1. Meta FAIR(JEPA发源地)
| 维度 | 详情 |
|---|---|
| 总部 | 美国(Meta基础人工智能研究院) |
| 核心人物 | Yann LeCun(图灵奖得主,前首席AI科学家) |
| 核心模型 | I-JEPA(2023)→ V-JEPA(2024)→ V-JEPA 2(2025.6开源)→ AdaJEPA(2026.7)→ LeWorldModel |
| 技术路线 | JEPA谱系发源地。在抽象表征空间中预测未来或缺失信息,不重建原始像素 |
| 关键突破 | V-JEPA 2:遮蔽75%视频片段,训练模型预测缺失部分的抽象特征(非像素),训练效率达传统模型1.5-6倍;支持零样本规划与机器人控制 |
| 最新进展 | 2026.7发布AdaJEPA(与AMI Labs/纽约大学联合):支持测试时自适应(TTA),世界模型可在部署中"边规划边学习" |
| 开源 | V-JEPA 2已在GitHub/HuggingFace完全开源 |
| 定位 | 学术研究与开源生态建设,为整个JEPA谱系提供理论基础和参考实现 |
2. AMI Labs(JEPA产业化)
| 维度 | 详情 |
|---|---|
| 总部 | 法国巴黎 |
| 成立时间 | 2026年1月正式启动 |
| 核心人物 | Yann LeCun(执行董事长)、谢赛宁(联合创始人)、Alexandre LeBrun(CEO,原FAIR工程主管) |
| 融资 | 10.3亿美元种子轮(2026.3),投前估值35亿美元,创欧洲史上最大种子轮纪录 |
| 投资方 | 贝索斯远征基金(领投)、英伟达(领投)、三星等 |
| 技术路线 | JEPA架构产业化载体。明确"不做更大的LLM",押注世界模型。核心论断:“LLM处理的是人类发明的符号系统,是对世界的二次抽象;真正的智能需要直接从连续的感官信号中建模物理世界” |
| 技术进展 | 2026.5发布两篇预印本论文,首次公开界定JEPA世界模型的能力边界;2026.7联合纽约大学发布AdaJEPA |
| 目标领域 | 工业、机器人、医疗 |
| 路线定位 | "先研究、后产品"的长期路线,开源世界模型 |
3. 具脑磐石(JEPA谱系·类脑认知)
| 维度 | 详情 |
|---|---|
| 总部 | 上海 |
| 成立时间 | 2025年6月 |
| 创始人 | 朱森华(宾夕法尼亚大学认知神经科学博士,中科院脑科学国家重点实验室博士后,前华为云AI算法创新Lab主任,“华为具身大脑一号位”) |
| 融资 | 2026年初数千万元种子轮 → 2026.5亿元级融资(顶尖类脑产业资本领投,格罗博、东方精工等跟投),另一轮同步交割中 |
| 核心模型 | 认知世界模型(Cognitive World Model, CWM) |
| 技术路线 | 直接对标LeCun JEPA路线,以类脑智能为底层范式。“在抽象表征空间中学习状态如何演化、推理未来趋势”。聚焦提炼"倾倒"“重心变化”"易碎"等抽象概念和底层物理规律 |
| 与JEPA的关系 | “JEPA增强版”——将JEPA的世界表征能力推进到完整链路:感知→认知→预测→规划→行动→学习 |
| 差异化 | 不生成"看起来像"的视频世界,而是为机器人提供可参与真实任务闭环的认知计算推理引擎 |
| 落地方向 | 日本工业场景为优先突破口,“一脑多机”“一脑多形” |
4. 日冕开物(JEPA谱系·三重表征)
| 维度 | 详情 |
|---|---|
| 总部 | 北京 |
| 成立时间 | 2026年3月 |
| 团队背景 | 清华自动驾驶背景,主导过行业首批智驾世界模型研发落地及首批具身强化学习与交付工作(蔚来、华为背景) |
| 融资 | 连续两轮种子轮,合计数亿元人民币(2026.7),鼎峰科创、远图未来、百度风投、沃衍资本、武岳峰科创、万林国际 |
| 核心模型 | LaMPA(世界模型) |
| 技术路线 | 基于JEPA理论体系延伸,构建三重表征体系(环境表征/本体表征/经验表征)+ 块扩散架构 + 世界奖励模型加速强化学习 |
| 核心目标 | 打造能理解物理世界、预测环境变化并驱动机器人执行任务的基础模型,实现跨场景泛化 |
| 落地场景 | 与远图未来合作,进入服务器制造高精度装配场景,计划跨产线部署 |
5. 智澄AI(JEPA谱系)
| 维度 | 详情 |
|---|---|
| 总部 | 杭州(余杭) |
| 创始人/CEO | 胡鲁辉 |
| 核心定位 | 国内自研世界模型代表企业,“长期深耕JEPA技术体系” |
| 技术路线 | 从空间感知、规律建模到具身执行的完整JEPA技术链路。"感知-理解-决策-执行"核心逻辑 |
| 产品 | 自研世界模型 + 自研机器人本体(TR4 X、TR5 Pro、TR6双足人形、XR1轮式复合型) |
| WAIC 2026 | 携TR6、XR1首发亮相,展示"自研世界模型赋予机器人的智能潜力" |
| 媒体定位 | 《清华金融评论》专访:“世界模型路线下的物理智能实践” |
| 特色 | 软硬一体(世界模型+机器人本体),覆盖工业制造与生活交互场景 |
6. 视启未来(JEPA谱系·隐空间WM)
| 维度 | 详情 |
|---|---|
| 总部 | 深圳 |
| 成立时间 | 2025年8月 |
| 孵化 | IDEA研究院(粤港澳大湾区数字经济研究院) |
| 创始人 | 张磊博士(张钹院士门生,前微软总部及亚洲研究院首席研究员,200+顶会论文,Google Scholar引用62000+,H-Index 102) |
| 融资 | 近亿元天使轮(2025.11,安凯微领投,昊辰资本、元禾璞华等跟投) |
| 核心模型 | 隐空间世界模型(以"物体-动作"为核心) |
| 技术路线 | 明确押注LeCun隐空间世界模型路线。“不同于主流世界模型预测下一帧画面长什么样,隐空间世界模型要求AI在更抽象的表征空间里,学习动作和世界状态变化之间的因果规律” |
| 差异化 | 依托Grounding DINO、DINO-X等全球领先视觉大模型积累,将物体理解能力融入隐空间表征学习 |
| 产品 | EgoTwin(Ego人手3D对齐引擎,联合百度智能云) |
| 创始人原话 | “隐空间世界模型是落地物理通用智能的最优路径” |
7. DeepMind Dreamer(Dreamer谱系·学术经典)
| 维度 | 详情 |
|---|---|
| 所属机构 | Google DeepMind + 多伦多大学 |
| 核心人物 | Danijar Hafner、Jurgis Pasukonis、Jimmy Ba、Timothy Lillicrap |
| 核心模型 | DreamerV1(2019)→ DreamerV2(2021)→ DreamerV3(2023) |
| 技术路线 | 潜空间世界模型 + 强化学习。在低维潜在空间(latent space)中学习状态转移动力学,通过"想象"(imagination)在潜空间中做规划,不在像素空间做任何事 |
| 核心机制 | 编码器将观测映射到潜空间 → 在潜空间学习转移动力学 → 在潜空间中"想象"未来轨迹 → 学习奖励预测 → 策略优化 |
| 里程碑 | DreamerV3:首个在Minecraft中无需人类数据或课程、从头开始收集钻石的算法;固定超参数跨多领域通用 |
| 学术地位 | 潜空间世界模型的学术奠基之作,被后续所有Dreamer谱系公司(无界动力、超脑未来等)直接引用和继承 |
| 最新延伸 | DeepMind Genie 3(2026.1开放):实时可交互3D世界生成,但Genie偏交互式/生成式,Dreamer系列才是潜空间表征式代表 |
8. 无界动力(Dreamer谱系·隐空间+RL)
| 维度 | 详情 |
|---|---|
| 总部 | 北京 |
| 成立时间 | 2025年 |
| 核心人物 | 张玉峰(创始人兼CEO)、夏中谱(联合创始人兼CTO) |
| 融资 | 2026上半年累计数亿美元(超2亿美元天使轮 + Pre-A轮近2亿美元),京东关联基金、C资本、弘毅投资、红杉中国、线性资本等 |
| 核心模型 | MWA™(长时序双向物理因果链隐空间世界模型) |
| 技术路线 | “隐空间世界模型+强化学习"双轮驱动。隐空间世界模型负责建立机器人"世界观”(理解物理因果规律),强化学习优化实体决策 |
| WAIC 2026 | 世界模型"六小龙"之一,CTO夏中谱在巅峰论坛发言。明确批判"将生成逼真视频等同于真正理解世界" |
| 成绩 | RoboCasa桌面任务权威测试75.2%平均成功率,全球第一(超越英伟达GR00T、小鹏DIAL等) |
| 创始人原话 | “隐空间世界模型才是通用具身智能的底层解法” |
| 落地 | 已获近1亿美元订单,侧重移动机器人、无人车低算力端侧部署 |
9. 超脑未来(Dreamer谱系·群体世界模型)
| 维度 | 详情 |
|---|---|
| 核心模型 | WorldDreamer V4(群体智能体世界动作基础模型,Shared World-Action Model) |
| 发布时间 | 2026年7月27日 |
| 技术路线 | Dreamer谱系的群体智能延伸。“在隐空间中实现’预测信息’而非’传递信息’”。从训练阶段即以多智能体为基本单位,让多个机器人共享同一个世界模型 |
| 核心理念 | “One World One Model”——下一代机器人智能的核心不是让机器人交换更多信息,而是让机器人共享同一个世界认知 |
| 成绩 | RoboCasa和WorldScore两大国际权威榜单均取得盲测第一(无专项微调) |
| 差异化 | 当其他玩家还在比拼单体智能时,超脑未来开辟了"群体世界模型"新维度 |
| 技术底层 | 潜空间建模(Dreamer架构),但创新点在于多智能体共享潜空间世界表征 |
10. 千诀科技(预测式/类脑分区)
| 维度 | 详情 |
|---|---|
| 总部 | 北京 |
| 成立时间 | 2023年6月 |
| 孵化 | 清华大学类脑计算研究中心 |
| 创始人 | 高海川 |
| 融资 | 数亿元A轮(2026.6,京铭资本领投,山东新动能、元禾厚望、英诺天使等十余家机构) |
| 核心模型 | 类脑分区预测世界模型 + 机器人大脑系统OS |
| 技术路线 | 预测式世界模型:通过预测物理状态的低维演化轨迹(而非还原像素),帮助机器人理解世界。类脑分区机制实现环境连续感知、状态预测与自主决策的闭环协同 |
| 与生成式的区别 | “生成式世界模型通过生成未来画面来预测变化,而千诀选择预测式路线——不生成画面,预判物理状态的低维演化轨迹” |
| 商业模式 | 不做硬件,只做机器人大脑供应商(“具身智能界的安卓”)。大脑与小脑解耦,世界模型负责感知/预测/规划,不绑定具体执行动作空间 |
| 落地规模 | 累计接入终端设备十万台量级,覆盖7大品类,主力战场家庭场景(酒店清洁、餐厅服务等) |
| 荣誉 | LeadeRobot 2026"年度具身智能大模型架构引擎奖" |
11. 逆矩阵科技(RL+物理潜空间)
| 维度 | 详情 |
|---|---|
| 总部 | 北京 |
| 成立时间 | 2026年2月 |
| 创始人 | 吉嘉铭(27岁)、陈博远(22岁,北大元培,NeurIPS Oral + ACL最佳论文) |
| 融资 | 超千万美元天使轮(2026.3,高瓴创投+燕缘创投)→ 超亿美元种子++轮(2026.6,经纬创投、光合创投、五源资本、BAI资本、钟鼎资本,蚂蚁集团战略投资) |
| 核心模型 | 悟界·Physis-v0.1(全球首个通用世界基座模型,2026.6智源大会发布) |
| 技术路线 | “通过主动干预在模型的隐空间中学习物理因果,而不仅是被动观察像素”。基于强化学习的"主动干预式验证"——让模型在动作出现后主动改变物理条件,验证因果 |
| 核心能力 | 物理隐空间推理50+场景;原生理解重力/碰撞;预测下一物理状态 |
| 与其他路线的区别 | Sora追求视觉逼真(存在物理幻觉),World Labs只解决空间不涉及物理,Cosmos侧重场景模拟——逆矩阵追求"物理正确性" |
| WAIC 2026 | 创始人陈博远以《迈向真实物理世界:通用世界基座模型》为主题分享 |
| 团队特色 | 几乎全部由"95后""00后"组成,内部不设KPI、没有部门墙 |
12. LiberAI(物理模态潜空间)
| 维度 | 详情 |
|---|---|
| 总部 | 北京 |
| 成立时间 | 2025年12月 |
| 创始人 | 刘松铭(00后,清华大学在读博士,清华特奖获得者,主导RDT-1B——全球首个大规模预训练+扩散Transformer范式基座模型) |
| 融资 | 种子轮+天使轮+天使+轮累计数亿元(真格基金、红杉中国、美团龙珠、顺为资本)→ 数亿元Pre-A轮(2026.6,顺为资本领投,凯辉基金、元禾原点等) |
| 核心定位 | “全球首创物理世界模型” |
| 技术路线 | UMI数据+物理世界模型融合范式。核心创新:模态对齐——“将力、位置、轨迹等物理模态信息对齐到已有的视频表示空间”,在隐空间里把物理数据与视频对齐,用视频模态的泛化性增强物理的泛化性 |
| 关键表述 | “在数据多、泛化性强的视频空间和数据少的物理空间之间建立桥梁”——这是潜空间对齐技术 |
| 技术特色 | 引入归纳偏置(牛顿力学约束),确保物理因果正确性 |
| 产品 | 具身智能大模型 + 配套UMI硬件 + 数据采集与训练体系 |
| 全流程 | 已跑通UMI硬件→数据采集→大模型训练全流程闭环 |
13. 星尘智能(隐空间世界-动作模型)
| 维度 | 详情 |
|---|---|
| 总部 | 深圳 |
| 核心模型 | Lumo-2(业界首个家庭隐式世界-动作模型,Latent World-Action Model) |
| 发布时间 | 2026年7月15日 |
| 技术路线 | "先预判世界变化、再输出动作"的隐空间推理范式。彻底摒弃显式坐标编程规则,采用"轻量级隐空间推演"策略——先预测未来世界动态,再生成动作 |
| 核心能力 | 时序推理、物理规律理解、长时序高精度灵巧操作 |
| 与像素级的区别 | “隐空间世界模型路线的效率优势,使其在单张消费级显卡上即可实现实时闭环控制”——如果是像素级生成,不可能在消费级显卡上实时运行 |
| 架构创新 | 三阶段渐进预对齐范式(面向跨模态表征),区别于VLA和WAM模型 |
| 成绩 | 22项复杂家庭任务真机自动化,端到端推理速度提升2.71倍 |
| 公司定位 | "AI模型—具身OS—绳驱本体"三位一体全栈架构(绳驱AI机器人公司) |
| WAIC 2026 | 发布"三位一体"多场景落地方案 |
14. 它石智航(隐空间具身基座·AI World Engine)
| 维度 | 详情 |
|---|---|
| 总部 | 上海(徐汇) |
| 核心人物 | 陈亦伦(创始人兼CEO)、丁文超(首席科学家) |
| 核心模型 | AWE 3.0 → AWE 3.5(AI World Engine,具身原生基座大模型) |
| 融资/荣誉 | WAIC 2026 SAIL之星(本届唯一获SAIL奖的具身智能基座模型) |
| 底层技术 | "隐空间"技术(新华网专访确认)。LAS(Latent Action Smoothing,隐空间丝滑动作):在隐空间内通过对动作隐变量的复用和调优,动作抖动降低超45% |
| 明确拒绝像素级 | 丁文超:“VLA处理的本质是’视网膜级’信息——像素、颜色、轮廓。但它石追求的是对时间、空间、力及环境交互等物理量,以及世界本质信息的精准表达” |
| 世界模型定义 | 陈亦伦(WAIC 2026主论坛):“一个真正的世界模型不仅需要预测机器人下一步动作(Action),更需要预测动作执行后世界状态(State)将如何演化” |
| 因果能力 | “打通了’动作-结果’的因果链条”,“具备’假如……那么……'的假设推演能力” |
| 数据规模 | 超百万小时human-centric真实数据,预计冲击千万小时级 |
| 产品 | A1机器人 + DexHand灵巧手 + SenseHub数据采集套件 |
| 落地 | 汽车线束真实产线(亚毫米级装配),吉尼斯世界纪录 |
15. 跨维智能(因果潜空间世界模型·CLWM)
| 维度 | 详情 |
|---|---|
| 总部 | 深圳 |
| 成立时间 | 2021年 |
| 创始人 | 贾奎(港中文(深圳)终身教授,国内最早深耕空间智能和三维数据生成) |
| 融资 | 10亿元B轮,估值破百亿,筹备港股IPO |
| 核心模型 | DexWorldModel(技术栈第一层:因果潜空间世界模型CLWM) |
| 技术路线 | “不同于主流世界模型’像素到像素’的直接预测路线,DexWorldModel选择在DINO语义特征空间中建模未来世界状态”。“预测未来语义特征而非像素重建” |
| 创始人原话 | “我们不追求直接生成RGB视频帧,而是生成可支撑机器人精准执行的隐空间特征” |
| 核心优势 | 跨越背景、材质与视觉噪声的干扰(抽象表征的泛化优势) |
| 技术栈 | CLWM + 双状态测试时记忆 + 推测式异步推理 + 具身数据链 |
| 成绩 | WorldArena Track 2全球第一(2026.5,击败NVIDIA、Google、OpenAI);RoboTwin 94%成功率;零样本Sim2Real迁移 |
| WAIC 2026 | 发布全球首个跨本体贯通仿真到真机的时空动作对齐大规模数据集Aligned DexWorld + 仿真引擎DexVerse |
| 落地 | 商超扫码、手机装盒等实景机器人Demo,15城服务50万人次 |
第三部分:总览表
| # | 公司 | 谱系/路线 | 核心模型 | 成立/总部 | 融资阶段 |
|---|---|---|---|---|---|
| 1 | Meta FAIR | JEPA(发源地) | I-JEPA → V-JEPA 2 → AdaJEPA → LeWorldModel | 美国 | 大厂研究院 |
| 2 | AMI Labs | JEPA(产业化) | JEPA世界模型 | 2026.1/巴黎 | 10.3亿美元种子轮 |
| 3 | 具脑磐石 | JEPA(类脑认知) | 认知世界模型CWM | 2025.6/上海 | 亿元级 |
| 4 | 日冕开物 | JEPA(三重表征) | LaMPA | 2026.3/北京 | 数亿元种子轮 |
| 5 | 智澄AI | JEPA | 自研世界模型+机器人 | 杭州 | 未公开 |
| 6 | 视启未来 | JEPA(隐空间WM) | 隐空间世界模型 | 2025.8/深圳 | 近亿元天使轮 |
| 7 | DeepMind Dreamer | Dreamer(学术经典) | DreamerV1/V2/V3 | 学术 | 大厂研究院 |
| 8 | 无界动力 | Dreamer(隐空间+RL) | MWA™ | 2025/北京 | 数亿美元 |
| 9 | 超脑未来 | Dreamer(群体WM) | WorldDreamer V4 | — | 未公开 |
| 10 | 千诀科技 | 预测式/类脑分区 | 类脑分区预测世界模型 | 2023.6/北京 | 数亿元A轮 |
| 11 | 逆矩阵科技 | RL+物理潜空间 | 悟界·Physis-v0.1 | 2026.2/北京 | 超亿美元种子++轮 |
| 12 | LiberAI | 物理模态潜空间 | 物理世界模型 | 2025.12/北京 | 累计数亿元+Pre-A |
| 13 | 星尘智能 | 隐空间世界-动作模型 | Lumo-2 | 深圳 | 未公开 |
| 14 | 它石智航 | 隐空间具身基座 | AWE 3.5 | 上海 | SAIL之星 |
| 15 | 跨维智能 | 因果潜空间(CLWM) | DexWorldModel | 2021/深圳 | 10亿元B轮,筹备IPO |
第四部分:谱系关系图
表征式世界模型(抽象表征、潜空间)
│
├── JEPA谱系(预测抽象语义特征,不重建像素)
│ ├── Meta FAIR(发源地:I-JEPA → V-JEPA → AdaJEPA → LeWorldModel)
│ ├── AMI Labs(LeCun产业化:10.3亿美元)
│ ├── 具脑磐石(类脑认知世界模型CWM)
│ ├── 日冕开物(LaMPA,三重表征体系)
│ ├── 智澄AI(JEPA全链路+机器人本体)
│ ├── 视启未来("物体-动作"隐空间WM)
│ └── 跨维智能(CLWM,DINO语义特征空间)
│
├── Dreamer谱系(潜空间动力学+强化学习)
│ ├── DeepMind Dreamer(学术奠基:V1/V2/V3)
│ ├── 无界动力(MWA,隐空间+RL双轮驱动)
│ └── 超脑未来(WorldDreamer V4,群体共享WM)
│
├── 预测式/类脑分区(低维状态演化预测)
│ └── 千诀科技(类脑分区预测世界模型)
│
├── RL+物理潜空间(主动干预式因果学习)
│ └── 逆矩阵科技(Physis-v0.1)
│
├── 物理模态潜空间(模态对齐到隐空间)
│ └── LiberAI(物理世界模型)
│
├── 隐空间世界-动作模型(Latent WAM)
│ └── 星尘智能(Lumo-2)
│
└── 隐空间具身基座(AI World Engine)
└── 它石智航(AWE 3.5,LAS隐空间动作)
以上即为表征式世界模型的完整概念简述及全部15家公司的详细介绍。
二、表征式世界模型需要的硬件平台
表征式世界模型能否使用大模型同款算力硬件?
直接结论
完全可以,且表征式世界模型对大模型同款硬件的适配性甚至优于大模型本身。 当前用于训练/推理大语言模型的主流GPU/NPU(H100、H200、L40S、摩尔线程MTT S5000、华为昇腾910C等),正是表征式世界模型最理想的运行平台,无需任何专用硬件。
一、为什么可以?——计算范式完全一致
| 维度 | 大语言模型(LLM) | 表征式世界模型(JEPA/Dreamer) | 硬件需求是否一致 |
|---|---|---|---|
| 核心架构 | Transformer | Transformer / 类Transformer | ✅ 一致 |
| 核心运算 | 大规模矩阵乘法(GEMM) | 潜空间状态转移(同为GEMM) | ✅ 一致 |
| 精度需求 | FP16/BF16/FP8 | FP16/BF16/FP8 | ✅ 一致 |
| 显存需求 | 高(KV Cache) | 中低(潜空间向量远小于像素) | ✅ 表征式更省 |
| 互联需求 | NVLink/InfiniBand(多卡训练) | 同上 | ✅ 一致 |
| 加速单元 | Tensor Core | Tensor Core | ✅ 一致 |
核心逻辑:表征式世界模型在潜空间中做的"状态预测",本质上就是一系列矩阵变换——与大模型做的"下一个token预测"在计算图层面几乎同构。为大模型设计的Tensor Core、HBM高带宽显存、NVLink互联,可以零修改地加速表征式世界模型。
二、已验证的实测案例
| 模型/公司 | 硬件 | 表现 | 来源 |
|---|---|---|---|
| LeWorldModel(LeCun/AMI Labs) | 单张NVIDIA L40S | 1500万参数,完整规划仅需1秒,比大模型方案快48倍,几小时训完 | 36氪,2026.3 |
| RTFM(李飞飞/World Labs) | 单张H100 | 实时渲染持久3D世界,交互级帧率 | 量子位/36氪,2025.10 |
| EvoPhys-World(北大) | 摩尔线程MTT S5000(国产大模型GPU) | 连续37天登顶PhysWorldBench,多机弱扩展效率~90% | 今日头条,2026.6 |
| MoWorld(魔芯科技) | 华为昇腾910C NPU | 14B参数,50FPS实时推理,成本仅为同规模GPU方案30% | 官方发布 |
| Lumo-2(星尘智能) | 单张消费级显卡 | 实时闭环控制,推理速度提升2.71倍 | 官方发布,2026.7 |
| V-JEPA 2(Meta FAIR) | 标准GPU集群 | 训练效率达传统视频生成模型的1.5-6倍 | Meta开源,2025.6 |
关键事实:LeCun的LeWorldModel甚至不需要H100——一张中端L40S(大模型推理常用卡)就能完成全部训练和规划。这比跑一个7B大模型还轻量。
三、表征式反而比大模型更"省硬件"
这是最反直觉但最重要的结论:
| 对比维度 | 大语言模型 | 生成式世界模型(Sora等) | 表征式世界模型 |
|---|---|---|---|
| 推理算力 | 高(长序列注意力) | 极高(像素级去噪) | 低(低维潜空间预测) |
| 显存占用 | 高(KV Cache随序列增长) | 极高(视频帧缓冲) | 低(状态向量固定维度) |
| 峰值GPU需求 | 数千~数万张H100 | 72万张H100(Sora峰值) | 1张L40S/H100 |
| 训练效率 | 基准 | 0.2-0.7×(更慢) | 1.5-6×(更快) |
原因:
- 大模型处理的是离散token序列(数万~数十万token)
- 生成式世界模型处理的是连续像素空间(每帧数百万像素×多帧)
- 表征式世界模型处理的是低维潜空间向量(通常256~2048维)
潜空间向量的计算量比像素空间低3-5个数量级,这就是为什么单卡就能跑。
四、国产大模型算力硬件的适配验证
WAIC 2026(2026.7)明确展示了一个趋势:国产大模型算力正在成为世界模型的底座。
| 国产硬件 | 原定位 | 世界模型适配验证 |
|---|---|---|
| 摩尔线程MTT S5000 | 大模型训推一体GPU | ✅ 北大EvoPhys-World全程原生训练,登顶WorldScore |
| 华为昇腾910C | 大模型训练NPU | ✅ 魔芯MoWorld 50FPS实时推理 |
| 寒武纪思元590 | 大模型推理加速卡 | ✅ 多家具身智能公司适配中 |
| 海光DCU | 大模型训练加速卡 | ✅ 智算中心世界模型训练集群部署 |
爱集微报道(2026.7.23):“整个WAIC展会现场,从智算基础设施厂商、芯片设计公司到具身智能算法企业,共同铺展出一套从底层硬件、集群调度软件到模型训练的完全国产化世界模型算力栈。”
五、唯一需要注意的差异:软件栈
虽然硬件完全通用,但软件优化策略有所不同:
| 优化维度 | 大模型重点 | 表征式世界模型重点 |
|---|---|---|
| 注意力机制 | 长序列FlashAttention | 短序列但高频调用(每步控制都要推理) |
| 显存管理 | KV Cache分页/压缩 | 潜空间状态缓存 + 空间记忆检索 |
| 算子融合 | Attention + FFN融合 | 动力学预测 + 奖励预测 + 策略网络融合 |
| 推理模式 | 自回归逐token生成 | 单步并行预测(一次前向传播出完整状态) |
| 实时性要求 | 可接受秒级延迟 | 必须毫秒级(机器人控制闭环) |
实际影响:
- 直接用vLLM/TensorRT-LLM等大模型推理框架跑表征式世界模型可以工作,但不是最优
- 最优方案是针对潜空间动力学做专门算子优化(如摩尔线程MUSA对EvoPhys-World的全链路适配)
- 但这属于软件调优问题,不需要更换硬件
六、总结
┌─────────────────────────────────────────────────────────┐
│ 表征式世界模型 vs 大模型同款硬件:完全兼容且更优 │
├─────────────────────────────────────────────────────────┤
│ │
│ ✅ 计算范式一致(Transformer + GEMM + Tensor Core) │
│ ✅ 精度需求一致(FP16/BF16/FP8) │
│ ✅ 互联需求一致(NVLink/InfiniBand) │
│ ✅ 已有大量实测验证(H100/L40S/昇腾/MTT S5000) │
│ ✅ 算力需求远低于大模型(单卡 vs 万卡) │
│ ✅ 国产大模型硬件已验证适配 │
│ │
│ ⚠️ 唯一差异:软件栈优化策略不同(非硬件问题) │
│ │
│ 结论:已建成的大模型智算中心可直接复用, │
│ 无需任何硬件改造即可训练/部署表征式世界模型。 │
│ │
└─────────────────────────────────────────────────────────┘
一句话总结:表征式世界模型不仅能用大模型同款硬件,而且是当前所有AI范式中对硬件最友好的——它用大模型1/1000的算力,实现了比生成式世界模型更强的物理理解能力。对于已投资大模型算力的企业和地方政府而言,这是将现有基础设施价值最大化的最佳技术路线。
三、表征式世界模型应用于自动驾驶
本次回答将:
- 绝对排除云端(不提任何云端训练、云端仿真、云端世界引擎)。
- 绝对排除生成式(不提任何像素级重建、视频生成、自回归图像预测)。
- 绝对排除机器人(不提任何具身智能、机械臂、人形机器人)。
- 只聚焦“本地端侧(车端芯片)” + “表征式(纯潜空间/Latent Space状态推演)” + “自动驾驶”。
基于以上严苛的限定条件:
一、 本地端侧表征式世界模型的响应时间是多少?
直接结论:截至2026年7月,全球没有任何一家公司或机构,公布过“严格意义上的本地端侧表征式世界模型”在真实车端芯片上的闭环响应时间实测数据。
由于没有真车实测,我们只能基于学术模型参数量进行车端理论推算:
- 推算基准:长安+中科院的
Latent-WAM是目前参数最小的纯表征式自动驾驶世界模型,仅 104M(1.04亿)参数。 - 理论响应时间:若将 104M 参数的 Latent 模型进行 INT8 量化,部署在主流车端芯片(如英伟达 Orin-X 254TOPS 或 高通 8650 200TOPS)上,其单步潜空间状态推演(Latent Dynamics Step)的理论响应时间在 5ms - 15ms 之间。
- 结论:在纯理论层面,端侧表征式世界模型的响应时间完全能够满足自动驾驶实时控制(<20ms)的需求。它跑得足够快,问题在于它目前还没有真正在车端跑起来。
二、 当前能应用于自动驾驶领域吗?
直接结论:不能。当前没有任何量产自动驾驶系统在车端本地独立运行“表征式世界模型”作为核心决策引擎。
为什么不能?
- 车企在端侧跑的不是表征式:蔚来NWM在端侧跑的是多元自回归生成模型(偏生成式);华为ADS车端WA是端到端行为网络(非潜空间动力学);特斯拉FSD车端是纯端到端感知决策网络(世界模拟器在云端)。
- 学术界的表征式模型没上过车:如
Latent-WAM、DreamerAD等纯正的表征式世界模型,目前100%只在服务器离线数据集(如NAVSIM)上跑分,从未在真实车辆的本地计算平台上进行过闭环部署和实时控制验证。
三、 如果不能,还需要做哪些硬件突破?
既然 104M 参数的表征式模型理论算力足够、延迟够低,为什么依然无法在端侧真正落地?因为当前的车规硬件在以下三个维度存在致命缺陷:
1. 缺乏“确定性计算”与 AI 功能安全硬件(最核心瓶颈)
- 当前缺陷:表征式世界模型在潜空间(Latent Space)推演时,一旦遇到分布外(OOD)的极端场景,潜空间状态向量可能会发生不可预测的“漂移”或“崩溃”。当前的车端 AI 芯片(如 Orin-X)是“尽力而为(Best-effort)”的概率计算架构,无法保证推理的绝对时限。
- 硬件突破:需要芯片底层集成硬件级确定性计算单元(如独立的锁步核、硬件看门狗、运行时状态监控 IP)。必须做到:如果潜空间推演在 10ms 内未收敛或出现异常,硬件能在 2ms 内强制熔断并无缝切换至安全降级规则系统。目前没有任何车规 AI 芯片通过了包含此类概率推理的 ASIL-D 认证。
2. 高频潜空间状态读写的“存储墙”
- 当前缺陷:表征式世界模型不生成像素,但需要**极高频地读写潜空间状态向量(Latent State)**和隐式记忆(如 RNN Hidden State 或 Transformer KV Cache)。当前车端 LPDDR5 内存带宽(约 100GB/s)在进行长时序(>3秒)潜空间连续推演时,会因频繁访存导致延迟飙升。
- 硬件突破:需要普及车规级 LPDDR5X(带宽 >200GB/s),或者在 NPU 内部集成 近存计算(PIM)/ 存算一体架构,让潜空间状态的更新在存储单元内部直接完成,彻底消除数据搬运延迟。
3. 传感器到潜空间的“零拷贝硬编码”接口
- 当前缺陷:目前摄像头 Raw 数据进入 NPU 需要经过 ISP 处理、总线传输,这会产生 10-20ms 的物理延迟。
四、 当前正在将“本地端侧表征式世界模型”用于自动驾驶的公司及研究成果
严格限定:必须是(1)纯潜空间/表征式 (2)试图推向车端本地 (3)自动驾驶 (4)排除机器人。
残酷的真相是:在如此严苛的限定下,目前全球没有任何一家公司拿出了“真车端侧闭环实测”的成果。 所有进展均处于“为了端侧部署而设计的学术/离线验证阶段”或“工程妥协阶段”。
以下是目前最接近该目标的 4 家机构/公司及其真实研究成果:
1. 长安汽车 + 中科院自动化所(最纯粹的端侧表征式学术探索)
- 研究成果:Latent-WAM (Latent World Action Modeling) 与 DreamerAD。
- 端侧意图:研究团队深刻意识到庞大的世界模型无法上车,因此专门设计了仅 104M(1.04亿)参数的极轻量级潜空间动力学模型,其核心目的就是为了适配端侧低算力平台。
- 当前真实进度:❌ 纯离线学术阶段。在 NAVSIM v2 离线数据集上取得 EPDMS 89.3 的优异成绩,证明了小参数潜空间模型的有效性,但尚未进行任何真车端侧部署和闭环测试。
2. 小米汽车 + 清华大学(潜空间推理的端侧加速探索)
- 研究成果:Xiaomi OneVL 及其前置论文 LaST-VLA 中的“隐式时空潜空间推理”模块。
- 端侧意图:虽然 OneVL 整体是 4B 参数的 VLA,但其核心创新是摒弃了传统的自回归像素/Token生成,采用一步式潜空间并行计算。这种架构设计的初衷就是为了大幅降低延迟,使其未来能够蒸馏并部署到车端。
- 当前真实进度:❌ 服务器开源阶段。已开源模型权重,服务器端推理延迟降至 240ms,但尚未进行真车端侧部署。
3. 比亚迪新技术研究院(混合架构中的端侧潜空间模块)
- 研究成果:HyWorldVLA 中的 Future Latent Prediction(未来潜空间预测) 模块。
- 端侧意图:该研究将像素级重建(用于离线监督)与潜空间预测(用于端侧动作生成)解耦。在端侧推理时,仅运行 Latent 预测分支,从而避开像素生成的巨大算力消耗,以适应车端算力。
- 当前真实进度:❌ 纯离线学术阶段。2026年7月发表论文,在 NAVSIM v1 取得 PDMS 90.59,尚未进行真车端侧部署。
4. 零跑汽车(工程妥协版的“端侧潜空间预测”)
- 研究成果:基于高通 8650(200TOPS)平台的潜空间序列预测系统。
- 端侧意图:零跑没有做完整的、庞大的表征式世界模型,而是做了一个工程妥协版——在端侧低算力平台上,部署了一个轻量级的“潜空间序列预测器”,在潜在空间模拟物理规律以辅助规划。
- 当前真实进度:✅ 已量产上车(零跑 A10 等车型)。
- 严格定性:这是目前行业内唯一真正在低算力端侧跑通“潜空间预测”并量产的案例。但必须指出,它在学术定义上缺乏完整的“动作干预(Action-conditioned)因果推演”能力,只能算作潜空间特征预测模块,而非严格意义上完整的“表征式世界模型”。
最终总结
如果您严格限定 “本地端侧”+“表征式”+“自动驾驶”:
- 响应时间:无真车实测数据,理论推算 104M 参数模型在车端可达 5-15ms。
- 能否应用:当前不能。没有任何量产车在端侧独立运行严格的表征式世界模型。
- 硬件突破:核心不在于算力,而在于确定性计算硬件(ASIL-D for AI)、**近存计算(打破存储墙)*和*硬件级潜空间编码器。
- 公司现状:长安+中科院(Latent-WAM)、小米(OneVL)、比亚迪(HyWorldVLA)都在做面向端侧优化的纯表征式学术研究,但均未上车;零跑量产了妥协版的端侧潜空间预测模块,但非完整世界模型。
四、当前已量产自动驾驶系统方案和生成式世界模型、表征式世界模型、大模型的区别
从数学本质和工程架构的底层逻辑出发,回答核心问题:当前最新已量产的自动驾驶系统,在端侧(车端本地芯片)运行的本质是“数据驱动的条件概率映射网络(端到端/VLA)”配合“安全规则兜底”,不是世界模型。
以下是当前端侧量产方案的真实面目,以及它与生成式世界模型、表征式世界模型、大模型(车端VLM)的硬核区别。
一、 当前最新已量产的端侧方案到底是什么?
截至2026年,无论是特斯拉FSD V13/V14、华为ADS 3.0/4.0/5.0的车端部分、小鹏第二代VLA,还是理想、蔚来的最新无图NOA,其在车端本地(Orin-X/昇腾/高通8650等芯片) 实际运行的方案,可以归结为以下两种主流形态:
1. 单片式端到端(One-Model End-to-End)
- 代表:特斯拉 FSD、小鹏 第二代VLA(车端推理部分)。
- 本质:一个巨大的前馈神经网络(或Transformer)。
- 运行逻辑:输入当前几帧的传感器数据(图像/点云)和导航指令,网络内部通过隐式特征提取,直接输出未来的控制轨迹(Waypoints)或方向盘/油门指令。
- 数学本质:行为克隆(Behavior Cloning),学习条件概率 P(Action∣Observation)P(Action | Observation)P(Action∣Observation)。即“看到这种画面,人类老司机通常怎么开”。
2. 双系统混合架构(快思考 + 慢思考)
- 代表:华为 ADS(端到端+安全兜底)、理想(端到端+VLM)、Momenta。
- 本质:系统1(快思考,几十Hz的端到端网络负责常规控车) + 系统2(慢思考,1-2Hz的车端VLM视觉语言模型或规则引擎负责复杂场景逻辑校验)。
- 运行逻辑:端到端网络生成轨迹,VLM或规则引擎在后台进行“安全审查”(例如:识别出前方是异形施工车,强制覆盖端到端的错误轨迹并刹车)。
核心结论:当前端侧量产方案是 “高级的条件反射系统”。它没有构建物理世界的内部模型,不具备“如果我这么做,世界会怎么变”的推演能力。
二、 四大方案的核心区别(硬核对比)
我们将当前端侧量产方案与生成式世界模型、表征式世界模型、车端大模型(VLM) 进行本质对比:
| 维度 | 当前端侧量产方案 (端到端/VLA) | 表征式世界模型 (Latent WM) | 生成式世界模型 (Generative WM) | 车端大模型 (VLM/慢思考) |
|---|---|---|---|---|
| 数学本质 | P(Action∣Obs)P(Action \mid Obs)P(Action∣Obs)条件概率映射(行为克隆) | P(St+1∣St,At)P(S_{t+1} \mid S_t, A_t)P(St+1∣St,At)潜空间状态转移动力学 | P(Pixelst+1∣Pixelst,At)P(Pixels_{t+1} \mid Pixels_t, A_t)P(Pixelst+1∣Pixelst,At)像素级视频生成 | P(Tokenn∣Token1..n−1)P(Token_{n} \mid Token_{1..n-1})P(Tokenn∣Token1..n−1)自回归语义/逻辑推理 |
| 核心能力 | 模仿:拟合人类驾驶数据中的动作分布。 | 推演:在抽象空间中模拟物理因果,进行动作-结果想象。 | 生成:高保真预测未来画面的视觉演变。 | 理解:常识推理、语义识别、长尾场景逻辑判断。 |
| 是否具备“想象力”(未来推演) | ❌ 无。只看当前,直接输出动作。 | ✅ 有。在脑海中(潜空间)沙盘推演多种未来。 | ✅ 有。在像素空间生成未来视频。 | ❌ 无。只做静态或短时序的逻辑推理。 |
| 输入 →\rightarrow→ 输出 | 传感器数据 →\rightarrow→ 控制指令/轨迹 | 潜空间状态+动作 →\rightarrow→ 未来潜空间状态+奖励 | 视频帧+动作 →\rightarrow→ 未来视频帧(像素) | 图像+文本Query →\rightarrow→ 文本描述/逻辑判断 |
| 端侧算力需求 | 中等(几十~几百 TOPS) | 极低(100M参数仅需几十TOPS) | 极高(需数千TOPS,端侧无法实时运行) | 较高(7B模型需上百TOPS,需量化) |
| 端侧推理延迟 | 极低(10ms - 50ms),满足实时控车 | 理论极低(5ms - 15ms),满足实时控车 | 极高(秒级),端侧无法用于实时控车 | 较高(100ms - 500ms),只能低频调用 |
| 端侧量产现状 | ✅ 已全面量产(作为主控) | ❌ 未量产(处于学术/离线验证阶段) | ❌ 未量产(仅限云端或车端离线记录) | ✅ 已量产(作为低频安全兜底/慢思考) |
三、 深度辨析:它们到底有什么区别?
为了更直观地理解,我们用“人类司机”的类比来拆解这四种技术的本质区别:
1. 当前端侧量产方案(端到端) = “肌肉记忆与条件反射”
- 区别:它像一个背熟了题库的新手司机。看到前面有车切入(Observation),它回忆起训练数据里人类司机这时候踩了刹车(Action),于是它输出刹车指令。
- 致命缺陷:它不知道为什么要刹车,也不理解物理惯性。如果遇到训练数据里没见过的奇葩切入角度(OOD场景),它可能会输出错误的动作,因为它没有物理常识,只有统计概率。
2. 表征式世界模型(Latent WM) = “老司机的脑内沙盘推演”
- 区别:它不直接输出动作,而是先在脑子里建立一个抽象的物理沙盘(潜空间)。当看到前车切入时,它在脑海中快速推演(Imagination):“如果我加速(Action A),根据物理规律,0.5秒后我的状态(State)会和他碰撞;如果我减速(Action B),0.5秒后状态安全”。推演完毕后,选择Action B。
- 核心优势:具备因果推理能力。它理解“动作会导致世界状态发生何种改变”,因此能处理从未见过的长尾场景。
3. 生成式世界模型(Generative WM) = “脑内高清VR模拟器”
- 区别:它也在推演未来,但它是在像素级别把未来的画面一帧一帧“画”出来。
- 核心缺陷:在车端毫无意义且算力爆炸。自动驾驶控车只需要知道“前车距离和速度(抽象物理量)”,根本不需要在脑子里把“前车的车漆反光和树叶的阴影(像素)”画出来。生成式世界模型在端侧是严重的算力浪费。
4. 车端大模型(VLM/慢思考) = “坐在副驾的导航员/安全员”
- 区别:大模型(如理想的System 2)不懂物理动力学,它不知道车距几米、速度多快。但它懂语义和常识。
- 应用场景:当端到端系统(肌肉记忆)准备变道时,VLM(副驾)看了一眼窗外,识别出“前方是实线且有交警手势禁止变道”(逻辑推理),于是强行接管,踩下刹车。它不负责高频控车,只负责逻辑兜底。
四、 总结:为什么当前端侧不用“表征式世界模型”?
既然表征式世界模型(Latent WM)算力需求低、延迟低,且具备强大的因果推演能力,为什么当前量产车端侧不用它,而用“端到端”?
- 工程成熟度差异:端到端(行为克隆)的工程链路已经跑通,只要有海量高质量人类驾驶数据,就能暴力拟合出不错的效果。而表征式世界模型需要在潜空间设计复杂的奖励函数(Reward)和强化学习(RL)闭环,工程难度极高。
- 安全认证的鸿沟(最致命):表征式世界模型在潜空间推演时,本质是一个动态非线性系统。在极端情况下,潜空间状态可能会发生“漂移”或“混沌”,导致推演出的未来状态完全违背物理常识。当前的车规硬件和ISO 26262功能安全标准,无法对这种“概率性、动态推演的黑盒”进行安全认证。
- 退而求其次的妥协:车企为了量产,选择了“端到端(负责拟人化控车) + 规则/VLM(负责安全兜底)”的妥协方案。用确定性的规则,去弥补端到端缺乏“世界物理推演”的缺陷。
一句话概括:
当前端侧量产的是 “基于统计概率的肌肉记忆(端到端)” 加上 “基于语义逻辑的副驾安全员(大模型)”;而真正能在脑内进行物理因果推演的 “沙盘模拟器(表征式世界模型)”,虽然理论上是端侧自动驾驶的终极形态,但目前仍被锁在学术界的实验室里,等待车规级确定性硬件的突破。
五、当前重点研究使用端侧表征式世界模型作为自动驾驶系统的公司
当前重点研究"端侧表征式世界模型"用于自动驾驶的公司、进度、成果与规划
严格限定:(1)端侧/车端本地 (2)表征式/潜空间(非生成式/像素级) (3)世界模型(具备状态转移动力学) (4)自动驾驶(非机器人)
核心结论(先说最残酷的事实)
截至2026年7月,全球没有任何一家公司实现了"严格意义上的端侧表征式世界模型"在量产车上的独立闭环运行。 所有进展均处于以下三种状态之一:
| 状态 | 含义 | 对应公司 |
|---|---|---|
| 🔬 纯学术验证 | 仅在服务器离线数据集跑分,无车端部署 | 长安+中科院、比亚迪 |
| 🧪 面向端侧设计但未上车 | 架构为车端优化,已开源/发表,但无真车闭环 | 小米 |
| ⚙️ 工程妥协版已量产 | 在车端跑了"潜空间预测",但非完整世界模型 | 零跑 |
一、各公司详细情况
① 长安汽车 + 中科院自动化所(最纯粹的表征式世界模型学术研究)
研究进度:🔬 纯学术阶段,与量产路线完全脱钩
| 维度 | 详情 |
|---|---|
| 研究成果1 | Latent-WAM(Latent World Action Modeling for End-to-End Autonomous Driving) |
| 研究成果2 | DreamerAD(Efficient Reinforcement Learning via Latent World Model for Autonomous Driving) |
| 发表时间 | 2026年3月底(arXiv) |
| 项目负责人 | 郑宇鹏(Yupeng Zheng) |
| 合作机构 | 中科院自动化所 + 长安汽车 + 北京中关村学院 |
| 核心架构 | 空间感知压缩世界编码器 + 动态隐世界模型(Latent Dynamics Model) |
| Latent-WAM参数 | 仅104M(1.04亿) |
| 训练成本 | 零标注数据训练,训练与推理硬件成本降低90%以上 |
| 基准成绩 | NAVSIM v2 EPDMS 89.3 |
| 端侧部署 | ❌ 无任何车端部署 |
| 端侧部署计划 | ❌ 无任何公开计划 |
关键事实:长安的量产路线与Latent-WAM完全无关
长安汽车2026年下半年的量产计划是**“天枢领航一段式端到端”**(来源:重庆日报2026.5.21、央广网2026.3.26),这是一个传统的端到端神经网络,不是表征式世界模型。
长安汽车首席智能驾驶技术官陶吉明确表示:“端到端自动驾驶城区领航功能即将实现量产搭载。”(央广网,2026.3.26)
结论:Latent-WAM是长安与中科院的学术合作项目,目的是发论文、刷基准,不在长安的量产技术路线图中。长安的量产路线是"一段式端到端",2027年规划L3规模化落地。
未来规划
- 量产路线:2026下半年"一段式端到端"城区领航量产 → 2027年L3规模化 → 2028年L4(来源:百度百科"天枢端到端"词条)
- Latent-WAM后续:❌ 无任何公开的端侧部署规划
② 小米汽车 + 清华大学(最接近端侧部署的潜空间推理框架)
研究进度:🧪 面向端侧设计,已开源,但尚未真车闭环
| 维度 | 详情 |
|---|---|
| 研究成果1 | LaST-VLA(Thinking in Latent Spatio-Temporal Space for VLA in Autonomous Driving) |
| 发表时间 | 2026年3月12日 |
| 合作机构 | 小米 + 清华大学 + 澳门大学 + 中科院自动化所 |
| 核心方法 | 隐式时空VLA:将推理从离散符号处理转变为隐式时空潜空间CoT;通过双特征对齐将3D基础模型几何约束和世界模型动态预见能力蒸馏到隐式空间 |
| 成绩 | NAVSIM v2 EPDMS 87.1 / v1 PDMS 91.3(发布时双榜第一) |
| 研究成果2 | Xiaomi OneVL(一步式潜空间语言视觉推理框架) |
| 发布时间 | 2026年5月13日,雷军亲自宣布 |
| 核心架构 | 统一VLA + 世界模型 + 潜空间推理三大技术路线;"语言推理+视觉未来预测"双重监督;一步式并行计算 |
| 参数量 | 4B(打10B参数效果) |
| 推理延迟 | 0.24秒(240ms),为传统VLA自回归推理的5.4%,快18.5倍 |
| 成绩 | NAVSIM PDM-score 88.84,首次超越显式CoT(88.29) |
| 开源 | ✅ 模型权重、训练代码、推理代码全面开源(Apache 2.0) |
| 端侧部署 | ❌ 尚未真车部署(0.24秒为服务器推理延迟) |
端侧部署的关键线索
- 新一代SU7已搭载700TOPS辅助驾驶算力(来源:百度百科"新一代小米SU7"词条)
- XLA认知大模型已于2026年4月随新一代SU7交付(来源:百度百科"Xiaomi XLA认知大模型"词条)
- OneVL官方定位明确:“为车端实时部署提供了新的技术路径”(来源:今日头条/新浪网多源,2026.5.14)
- 小米开源OneVL的首要目的被解读为**“解决自家SU7等车型的量产落地难题”**(来源:今日头条,2026.5.14)
严格定性
OneVL不是一个独立的"表征式世界模型",而是一个包含潜空间推理的VLA框架。其中的"世界模型"组件是在潜空间中预测未来场景演变,但它是VLA的一个子模块,而非独立的状态转移动力学系统。
未来规划
- 短期(2026):XLA认知大模型已在新一代SU7上量产交付;OneVL作为下一代技术储备
- 中期(推测):OneVL的潜空间推理模块有望蒸馏后部署到700TOPS平台
- 长期:小米明确表示XLA架构可同时服务于自动驾驶与具身机器人(来源:百度百科)
③ 比亚迪新技术研究院(混合架构中的潜空间预测分支)
研究进度:🔬 纯学术阶段
| 维度 | 详情 |
|---|---|
| 研究成果 | HyWorldVLA(A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving) |
| 发表时间 | 2026年7月27日 |
| 机构 | 比亚迪汽车新技术研究院 |
| 作者 | Quanfu Yu、Xian Wu、Hao Xu、Liulong Ma |
| 核心方法 | 将pixel-level future reconstruction与future latent prediction放入同一VLA框架;像素监督提供细粒度grounding,latent表征服务鲁棒动作生成 |
| 成绩 | NAVSIM v1 PDMS 90.59(SOTA) |
| 端侧部署 | ❌ 无 |
| 端侧部署计划 | ❌ 无任何公开计划 |
严格定性
HyWorldVLA的核心创新是**“混合世界建模”——同时使用像素级重建(生成式)和潜空间预测(表征式)。在端侧推理时,理论上可以仅运行Latent预测分支**(避开像素生成的算力消耗),但论文中未进行任何端侧部署实验。
未来规划
- ❌ 无任何公开的端侧部署规划
- 比亚迪在智驾领域的公开战略是与英伟达合作Drive Hyperion平台开发L4(来源:有驾,2026.3.20),而非自研表征式世界模型
④ 零跑汽车(唯一在端侧跑通"潜空间预测"并量产的公司)
研究进度:⚙️ 工程妥协版已量产
| 维度 | 详情 |
|---|---|
| 系统名称 | 零跑全新世界模型辅助驾驶系统 |
| 发布时间 | 2026年3月27日(A10上市发布会) |
| 发布人 | 零跑科技创始人、董事长、CEO 朱江明 |
| 核心描述 | “视觉编码器将摄像头数据压缩为潜在向量,再由序列预测器在潜在空间模拟物理世界运行规律,最终通过解码器生成可视化决策路径”(来源:搜狐/新浪,2026.3.28) |
| 核心创新 | “不吃高算力即可实现世界模型能力”;通过知识蒸馏将云端大模型压缩至端侧可运行水平 |
| 车端芯片(入门) | 高通8650(200TOPS)—— 零跑A10(6.58万-8.68万元) |
| 车端芯片(旗舰) | 双高通骁龙8797(1280TOPS)—— 零跑D19(25-30万元) |
| 量产车型 | A10、B10、B01、C10、C11、C16、D19等全系激光雷达版本 |
| 团队 | 超700人,近600台训练服务器 |
| 具体延迟 | 未公开 |
| 参数量/架构细节 | 未公开 |
严格定性
零跑的"世界模型"在学术定义上不是完整的表征式世界模型:
- ✅ 在潜空间工作(非像素级)
- ✅ 在端侧运行(200TOPS即可)
- ❌ 缺乏完整的"动作干预(Action-conditioned)因果推演"能力
- ❌ 更接近"潜空间序列预测模块",而非Dreamer/JEPA式的状态转移动力学
未来规划
- 已明确:通过知识蒸馏、神经网络结构优化,让所有在售和已售的8650芯片车型进一步实现辅助驾驶进阶,具备世界模型能力(来源:车东西/百家号,2026.3.27)
- 旗舰方向:D19搭载双8797(1280TOPS),运行"VLA世界模型"(来源:易车,2026.4.17)
- 架构演进:LEAP 4.0中央集成架构,实现舱驾融合、算力集中(来源:百度百科)
⑤ 理想汽车(VLA内嵌隐世界模型 + 端侧部署定律研究)
研究进度:⚙️ 隐世界模型作为VLA子模块已量产
| 维度 | 详情 |
|---|---|
| 研究成果1 | MindVLA-o1(下一代统一VLA自动驾驶基础模型) |
| 发布时间 | 2026年3月17日(NVIDIA GTC 2026) |
| 发布人 | 理想汽车基座模型负责人 詹锟 |
| 世界模型组件 | “预测式隐世界模型”:先把当前场景转成隐空间里的表达,再在这个空间里预测未来变化。不用直接去生成复杂画面(来源:有驾,2026.3.18) |
| 五大技术创新 | 3D空间理解(原生3D ViT)、多模态思考、统一行为生成、闭环强化学习、软硬件协同设计 |
| 研究成果2 | Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs |
| 发表时间 | 2026年2月 |
| 合作机构 | 理想MindVLA团队 + 国创决策智能技术研究所 |
| 核心贡献 | 提出面向端侧大语言模型的"硬件协同设计扩展定律",将模型精度、推理延迟与硬件特性统一纳入数学建模 |
| 量产状态 | MindVLA-o1为下一代模型(2025年已量产VLA司机大模型);OTA 6.0/8.2已推送 |
| 车端芯片 | 自研芯片(具体型号未公开) |
严格定性
理想MindVLA-o1中的"预测式隐世界模型"不是独立的表征式世界模型,而是VLA内部的一个隐式预测子模块。它不具备独立的状态转移动力学和动作-结果因果推演能力。
但理想在端侧部署方法论上的研究(Hardware Co-Design Scaling Laws)是所有公司中最深入的,直接解决了"如何在有限功耗/算力下部署大模型"的核心问题。
未来规划
- 短期:MindVLA-o1量产上车(OTA持续推送)
- 长期:詹锟明确表示"基于同一套VLA模型,不仅可以控制车辆,也能够扩展到机器人"(来源:网易/IT之家,2026.3.17)
- 端侧优化:持续基于Hardware Co-Design Scaling Laws进行芯片-算法协同优化
⑥ 华为(学术SOTA + 量产双线,但车端非表征式)
研究进度:学术端有表征式成果,量产端车侧不是
| 维度 | 详情 |
|---|---|
| 学术成果 | WAM-Diff(World Action Model with Diffusion) |
| 骨干网络 | LLADA-V-8B(扩散式语言模型) |
| 核心方法 | 在潜空间中用扩散模型建模世界状态转移 |
| 成绩 | NAVSIM v2 EPDMS 89.7(当前端到端算法全球第一) |
| 量产系统 | 乾崑智驾ADS 5(WEWA 2.0架构),2026年4月23日发布 |
| 车端WA | 一段式端到端 + MoE混合专家(256个场景专家子模型)+ 安全风险场 |
| 车端WA是否为表征式世界模型 | ❌ 不是。车端WA是端到端行为决策网络,非潜空间状态转移动力学 |
| 云端WE | 世界引擎(多智能体博弈 + 在线RL),在云端 |
| 量产规模 | 整车搭载量突破170万辆 |
| 投入 | 2026年智驾投入超180亿元 |
严格定性
华为的WAM-Diff是纯学术论文,在潜空间中用扩散模型做世界建模,成绩全球第一。但华为的量产车端系统(WA)完全不是表征式世界模型,而是端到端行为网络。世界模型(WE)在云端。
未来规划
- 华为未公开任何将WAM-Diff或类似表征式世界模型部署到车端的计划
- 车端持续迭代WA(端到端+MoE+安全风险场)
- 云端持续强化WE(世界引擎)
二、总结对比表
| 公司 | 研究成果 | 是否严格"表征式世界模型" | 是否端侧 | 是否量产 | 端侧部署计划 |
|---|---|---|---|---|---|
| 长安+中科院 | Latent-WAM (104M) / DreamerAD | ✅ 最纯粹 | ❌ 纯服务器 | ❌ | ❌ 无 |
| 小米+清华 | OneVL (4B) / LaST-VLA | ⚠️ VLA内嵌潜空间推理 | ⚠️ 面向端侧设计 | ❌ | ⚠️ 暗示中(700TOPS SU7) |
| 比亚迪 | HyWorldVLA | ⚠️ 混合式(含latent分支) | ❌ 纯服务器 | ❌ | ❌ 无 |
| 零跑 | 世界模型辅助驾驶系统 | ⚠️ 潜空间预测模块(非完整WM) | ✅ 200TOPS量产 | ✅ | ✅ 全系OTA升级 |
| 理想 | MindVLA-o1 + 端侧定律 | ⚠️ VLA内嵌隐世界模型 | ✅ 已量产 | ✅ | ✅ 持续OTA |
| 华为 | WAM-Diff (学术) / WEWA (量产) | ✅ 学术是 / ❌ 量产不是 | ❌ 学术在服务器 / 量产车端非WM | ✅ (但车端非WM) | ❌ 无 |
三、最终判断
谁在"真正"研究端侧表征式世界模型?
严格来说,只有一家公司在做"面向端侧的纯表征式世界模型"研究:
长安汽车 + 中科院自动化所(Latent-WAM,104M参数)
这是唯一一个:
- ✅ 纯潜空间状态转移动力学(非生成式、非VLA子模块)
- ✅ 参数量极小(104M),明确为端侧低算力设计
- ✅ 自动驾驶领域
- ❌ 但没有任何端侧部署计划,纯属学术探索
谁最有可能率先实现端侧部署?
小米汽车(OneVL)
理由:
- OneVL明确以"车端实时部署"为设计目标
- 新一代SU7已具备700TOPS算力
- XLA认知大模型已在SU7上量产交付
- 开源策略暗示正在为量产做生态准备
- 但OneVL是VLA框架(含潜空间推理),不是独立的表征式世界模型
谁已经在端侧跑了"最接近"的东西?
零跑汽车
理由:
- 唯一在200TOPS低算力平台上量产"潜空间预测"的公司
- 通过知识蒸馏实现"不吃高算力"
- 但学术上只能算"潜空间预测模块",非完整世界模型
四、为什么没有公司真正在端侧部署"完整的表征式世界模型"?
| 障碍 | 说明 |
|---|---|
| 功能安全认证 | 潜空间动态推演是概率性、非线性的,当前ISO 26262/ASIL-D无法认证 |
| 长时序漂移 | 潜空间状态在>3秒推演后可能发散,导致决策崩溃 |
| 工程成熟度 | 端到端(行为克隆)的工程链路已跑通,表征式WM的RL闭环工程难度极高 |
| 投入产出比 | 车企选择"端到端+规则兜底"的妥协方案即可满足当前L2+/L3需求,无需冒险 |
一句话总结:端侧表征式世界模型在自动驾驶领域,目前处于**“学术已证明可行(EPDMS 89.7)、工程尚未落地、量产仅有妥协版”** 的阶段。最纯粹的学术研究来自长安+中科院(Latent-WAM),最接近端侧部署的是小米(OneVL),唯一量产了"潜空间预测"的是零跑——但三者均非严格意义上的"端侧独立表征式世界模型决策引擎"。
更多推荐

所有评论(0)