一、导语:当「电力效率」取代「峰值算力」

过去十年,我们评价一块 AI 芯片,习惯看 FLOPS(每秒浮点运算次数)。但 2026 年 8 月 25 日,在 Hot Chips 2026 半导体设计大会上,英伟达用一整套新品把行业的标尺悄悄换成了 Tokens per Watt(每瓦特 Token) 和 Cost per Token(每 Token 成本)。

一句话总结今天的发布会:推理,才是 AI 增长的引擎;而智能体(Agentic AI)时代,比的是谁能用一度电产出更多 Token。


二、重磅:Groq 3 LPX 全面投产,单柜 3400 Token/秒

英伟达在 Hot Chips 上宣布,面向交互式推理的 NVIDIA Groq 3 LPX 已进入全面量产。它是 Vera Rubin 平台的延伸,专为「超低延迟 Token 生成」而生。

核心实测数据(Artificial Analysis 基准,Gemma 4 31B 开源 Agent 模型,10 万 Token 上下文):

指标

数据

输出速度

3400 Token/秒(该模型历史最快纪录)

对比竞品

响应速度领先次优平台约 4 倍

首批采用方

AI 云厂商 Nebius(Token Factory)、Grok

定位

把 Agent「编码从几小时压缩到几分钟」

为什么这件事重要?因为 Agentic AI 会在几百到几千步推理里产生海量 Token,生成慢一步,整个任务就被拖垮。Groq 3 LPX 就是把「单用户 Token 生成速度」拉满的那块拼图。


三、Vera Rubin NVL72:每兆瓦吞吐约为 GB300 的 30 倍

更炸裂的是平台级数据。英伟达用 SemiAnalysis 的 AgentX 工作负载、跑 1.6 万亿参数的 DeepSeek-V4-Pro 做了实测:

平台

每兆瓦吞吐量(相对值)

每百万 Token 成本

H200 NVL8

1×

基准

GB300 NVL72

约 15×

约为上一代 1/10

Vera Rubin NVL72

约 30×(相对 GB300)

降至 GB300 的 1/35

注意这里的对比链:Vera Rubin 相对 GB300 是 30 倍/兆瓦,而 GB300 相对 H200 又是 15 倍——也就是说,新一代平台相对两年前的方案,单位电力的智能产出提升了 两个数量级。这从根本上改变了「AI 工厂」的经济账。


四、网络与基础设施:把 51.2 万张 GPU 连成一张网

光有芯片不够。英伟达同时抛出两项网络技术,目标都是「无第三层网络也能无限扩展」:

  • Spectrum-X Multiplane:把服务器的网络连接拆成多条独立路径(plane),各自跑成独立的二层网络。八平面配置下,即便坏掉一个平面,整体带宽仍保留约 90%,硬件故障恢复比软件负载均衡快 11 倍,AI 工厂吞吐提升 1.6 倍,可扩展到 512,000 张 GPU。
  • ScaleIn(基于 BlueField-4 + DOCA):把网络、存储、安全、运维这类「基础设施服务」本身也作为加速对象,随 AI 计算同步加速。

配套新品还包括 Spectrum-X SN6000 系列交换机、ConnectX-9 SuperNIC,以及把多数据中心连成「单一 AI 超级工厂」的 Spectrum-XGS Ethernet(跨站 NCCL 集合通信加速 1.9 倍)。


五、把算力送上太空:SpaceXAI 采用 Vera CPU

最出圈的彩蛋:英伟达宣布 SpaceXAI 将采用 Vera CPU(首个为 AI 智能体设计的 CPU)加速下一代 Agent 工作负载,并计划把优化版 Vera Rubin NVL72 用于首代 Starmind AI 卫星,把 AI 计算从地面数据中心延伸到轨道。

这不只是噱头——轨道环境的供电、散热、带宽、可靠性约束与地面完全不同,Vera 架构从设计之初就考虑了这些。


六、桌面与边缘:DGX Station 与 Jetson Orin Nano 2

  • DGX Station(GB300) 桌面超算定价曝光:约 9.49 万美元起,748GB 统一内存(其中 252GB HBM3e),面向本地微调与部署,标志「桌面级 AI 基建化」。
  • Jetson Orin Nano 2 发布:入门级边缘 AI 平台,推理性能较上代翻 2 倍、同性能功耗降 40%,78 TOPS,可跑 Qwen3 / Gemma4 / Nemotron,瞄准机器人、无人机等端侧物理 AI。Matic 扫地机器人已宣布采用。

七、开发者小结:这意味着什么?

  1. 评测范式迁移:选型别只看算力峰值,要看 tokens/watt 和 cost/token。
  1. Agent 落地门槛骤降:低延迟 + 大上下文 + 长任务,让「Agent 替你干几小时活」从 demo 走向生产。
  1. 本地化与边缘化并行:从 9 万美元桌面超算到 78 TOPS 边缘模组,AI 基建正在同时向「中心」和「边缘」两端扩散。
  1. 电力即算力:AI 工厂的竞争,本质变成了「谁能更高效地把电变成 Token」。

如果你是做推理服务、Agent 平台或边缘部署的开发者,这一波硬件迭代值得在 Q4 排进技术选型评估。


如果你觉得多模型 切换 、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。官网:https://www.shengsuanyun.com/?from=CH_M2SUSXRR

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐