算力进入「每瓦特 Token」时代:英伟达 Hot Chips 2026 发布 Vera Rubin 与 Groq 3 LPX,每兆瓦吞吐暴涨 30 倍# 算力进入「每瓦特 Token」时代:英伟
一、导语:当「电力效率」取代「峰值算力」
过去十年,我们评价一块 AI 芯片,习惯看 FLOPS(每秒浮点运算次数)。但 2026 年 8 月 25 日,在 Hot Chips 2026 半导体设计大会上,英伟达用一整套新品把行业的标尺悄悄换成了 Tokens per Watt(每瓦特 Token) 和 Cost per Token(每 Token 成本)。
一句话总结今天的发布会:推理,才是 AI 增长的引擎;而智能体(Agentic AI)时代,比的是谁能用一度电产出更多 Token。
二、重磅:Groq 3 LPX 全面投产,单柜 3400 Token/秒
英伟达在 Hot Chips 上宣布,面向交互式推理的 NVIDIA Groq 3 LPX 已进入全面量产。它是 Vera Rubin 平台的延伸,专为「超低延迟 Token 生成」而生。
核心实测数据(Artificial Analysis 基准,Gemma 4 31B 开源 Agent 模型,10 万 Token 上下文):
| 指标 | 数据 |
| 输出速度 | 3400 Token/秒(该模型历史最快纪录) |
| 对比竞品 | 响应速度领先次优平台约 4 倍 |
| 首批采用方 | AI 云厂商 Nebius(Token Factory)、Grok |
| 定位 | 把 Agent「编码从几小时压缩到几分钟」 |
为什么这件事重要?因为 Agentic AI 会在几百到几千步推理里产生海量 Token,生成慢一步,整个任务就被拖垮。Groq 3 LPX 就是把「单用户 Token 生成速度」拉满的那块拼图。
三、Vera Rubin NVL72:每兆瓦吞吐约为 GB300 的 30 倍
更炸裂的是平台级数据。英伟达用 SemiAnalysis 的 AgentX 工作负载、跑 1.6 万亿参数的 DeepSeek-V4-Pro 做了实测:
| 平台 | 每兆瓦吞吐量(相对值) | 每百万 Token 成本 |
| H200 NVL8 | 1× | 基准 |
| GB300 NVL72 | 约 15× | 约为上一代 1/10 |
| Vera Rubin NVL72 | 约 30×(相对 GB300) | 降至 GB300 的 1/35 |
注意这里的对比链:Vera Rubin 相对 GB300 是 30 倍/兆瓦,而 GB300 相对 H200 又是 15 倍——也就是说,新一代平台相对两年前的方案,单位电力的智能产出提升了 两个数量级。这从根本上改变了「AI 工厂」的经济账。
四、网络与基础设施:把 51.2 万张 GPU 连成一张网
光有芯片不够。英伟达同时抛出两项网络技术,目标都是「无第三层网络也能无限扩展」:
- Spectrum-X Multiplane:把服务器的网络连接拆成多条独立路径(plane),各自跑成独立的二层网络。八平面配置下,即便坏掉一个平面,整体带宽仍保留约 90%,硬件故障恢复比软件负载均衡快 11 倍,AI 工厂吞吐提升 1.6 倍,可扩展到 512,000 张 GPU。
- ScaleIn(基于 BlueField-4 + DOCA):把网络、存储、安全、运维这类「基础设施服务」本身也作为加速对象,随 AI 计算同步加速。
配套新品还包括 Spectrum-X SN6000 系列交换机、ConnectX-9 SuperNIC,以及把多数据中心连成「单一 AI 超级工厂」的 Spectrum-XGS Ethernet(跨站 NCCL 集合通信加速 1.9 倍)。
五、把算力送上太空:SpaceXAI 采用 Vera CPU
最出圈的彩蛋:英伟达宣布 SpaceXAI 将采用 Vera CPU(首个为 AI 智能体设计的 CPU)加速下一代 Agent 工作负载,并计划把优化版 Vera Rubin NVL72 用于首代 Starmind AI 卫星,把 AI 计算从地面数据中心延伸到轨道。
这不只是噱头——轨道环境的供电、散热、带宽、可靠性约束与地面完全不同,Vera 架构从设计之初就考虑了这些。
六、桌面与边缘:DGX Station 与 Jetson Orin Nano 2
- DGX Station(GB300) 桌面超算定价曝光:约 9.49 万美元起,748GB 统一内存(其中 252GB HBM3e),面向本地微调与部署,标志「桌面级 AI 基建化」。
- Jetson Orin Nano 2 发布:入门级边缘 AI 平台,推理性能较上代翻 2 倍、同性能功耗降 40%,78 TOPS,可跑 Qwen3 / Gemma4 / Nemotron,瞄准机器人、无人机等端侧物理 AI。Matic 扫地机器人已宣布采用。
七、开发者小结:这意味着什么?
- 评测范式迁移:选型别只看算力峰值,要看
tokens/watt和cost/token。
- Agent 落地门槛骤降:低延迟 + 大上下文 + 长任务,让「Agent 替你干几小时活」从 demo 走向生产。
- 本地化与边缘化并行:从 9 万美元桌面超算到 78 TOPS 边缘模组,AI 基建正在同时向「中心」和「边缘」两端扩散。
- 电力即算力:AI 工厂的竞争,本质变成了「谁能更高效地把电变成 Token」。
如果你是做推理服务、Agent 平台或边缘部署的开发者,这一波硬件迭代值得在 Q4 排进技术选型评估。
如果你觉得多模型 切换 、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。官网:https://www.shengsuanyun.com/?from=CH_M2SUSXRR
更多推荐
所有评论(0)