摘要

8 月 24 日 Hot Chips 2026 大会,NVIDIA 宣布 Groq 3 LPX 交互式推理加速器全面量产。在 Artificial Analysis 基准测试中,Groq 3 LPX 搭载 Gemma 4 31B 模型、100K Token 上下文,实现每秒 3400 个输出 Token——该模型历史最高纪录,比最近竞争平台快 4 倍。Nebius 成为首个采用的 AI 云。同日,彭博社披露英伟达通知客户 2027 年初服务器涨价 15% 以上,内存芯片成本飙升是核心推手。核心判断:AI 硬件竞争正从"谁训练得更快"转向"谁的 Token 生成得更快"——Agent 时代的推理经济学已经到来


一、Groq 3 LPX:为 Agent 而生的推理加速器

1.1 为什么 Agent 需要专用推理硬件

传统聊天机器人是"一问一答":用户发一条消息,模型回复几百 Token,结束。Agent 完全不同——一次任务可能包含数百甚至数千个推理步骤:

Agent 任务类型典型步骤数每步 Token 量总 Token 量
代码生成与测试50-200500-200025K-400K
文件审查与分析100-500300-100030K-500K
多 Agent 协作200-1000+200-80040K-800K+
深度研究300-2000+500-1500150K-3M+

每一步的 Token 生成速度直接决定任务完成时间。如果一个 Agent 需要 500 步,每步生成 500 Token,那么:

  • 50 Token/s(传统推理):500 × 500 / 50 = 5000 秒 ≈ 83 分钟
  • 3400 Token/s(Groq 3 LPX):500 × 500 / 3400 ≈ 74 秒 ≈ 1.2 分钟

这就是 NVIDIA 把 Groq 3 LPX 定位为"交互式推理加速器"而非通用推理芯片的技术逻辑。

1.2 核心规格与基准数据

指标数值来源
模型Gemma 4 31B(开源 Agent 模型)NVIDIA / Artificial Analysis
上下文长度100,000 TokenNVIDIA
输出速度3,400 Token/s(历史最高)Artificial Analysis
响应速度优势 vs 最近竞争平台NVIDIA
架构定位Vera Rubin NVL72 的推理扩展层NVIDIA
首个云采用方Nebius(Token Factory 平台)NVIDIA / Nebius
后续采用方Groq 公司(推理云)NVIDIA
发布场合Hot Chips 2026(8 月 24 日)NVIDIA

1.3 架构解构:GPU + LPU 的"极致协同设计"

Groq 3 LPX 的核心设计理念不是用专用推理芯片取代 GPU,而是为 Vera Rubin 补充低延迟 Token 生成能力:

┌─────────────────────────────────────────────────┐
│            Vera Rubin NVL72 机架                 │
│  ┌──────────────────┐  ┌──────────────────────┐ │
│  │   Rubin GPU 层    │  │   Groq 3 LPX LPU 层  │ │
│  │                    │  │                      │ │
│  │ • 大规模上下文处理  │  │ • 低延迟解码加速      │ │
│  │ • Prefill 阶段     │  │ • Decode 阶段         │ │
│  │ • 训练 + 推理      │  │ • 纯推理(确定性)     │ │
│  │ • 批处理吞吐优化    │  │ • 单用户响应速度优化   │ │
│  └──────────────────┘  └──────────────────────┘ │
│         │                    │                   │
│         └──── 芯片到芯片直连 ──┘                   │
│              每层联合计算                         │
└─────────────────────────────────────────────────┘

关键区别

维度传统推理加速器Groq 3 LPX
优化目标Token/s/$(批处理吞吐)Token/s/用户(单用户响应速度)
适用场景多用户并发聊天Agent 交互式推理
架构独立加速器GPU + LPU 联合计算
部署规模单卡到多卡256 个 LP30 加速器(机架级)

NVIDIA 官方博客解释:Rubin GPU 处理大规模上下文,LPU 加速延迟敏感的解码工作负载,“消除速度与吞吐量之间的传统权衡”。

1.4 为什么叫"Groq":一场命名混乱

一个值得注意的细节:NVIDIA 的推理加速器叫 “Groq 3 LPX”,而独立推理云公司 Groq(同名)也计划采用该平台。这导致了行业讨论中的命名混乱——一家叫 Groq 的公司将运营名为 Groq 3 LPX 的 NVIDIA 硬件。

这并非巧合。2025 年 NVIDIA 收购了 Groq 公司的部分 IP 和团队,将其 LPU 技术整合进 Vera Rubin 平台。Groq 公司作为独立推理云继续运营,同时成为 NVIDIA 硬件的早期采用方。


二、Vera Rubin 平台经济学:30 倍能效跃迁

2.1 真实 Agent 工作负载测试

除了 Groq 3 LPX 的 Token 速度记录,NVIDIA 还公布了 Vera Rubin NVL72 在真实 Agent 工作负载下的能效数据:

指标上一代 GB300 NVL72Vera Rubin NVL72倍数
每兆瓦吞吐量30×30 倍
每 Token 成本1/35降低 35 倍
测试工作负载SemiAnalysis AgentXSemiAnalysis AgentX
测试模型DeepSeek V4 ProDeepSeek V4 Pro

这意味着什么:在同等功耗下,Vera Rubin 能处理的 Agent 推理量是上一代的 30 倍。对于运营 AI 云的公司来说,每 Token 推理成本降低 35 倍是一个量级跳跃。

2.2 Token 工厂:NVIDIA 的新叙事

黄仁勋在 Hot Chips 上明确提出"Token 工厂"概念:

“推理是 AI 的增长引擎。Grace Blackwell 和 NVL72 革命了大型语言模型推理。Vera Rubin 通过面向 Agent AI 时代的工作负载优化 AI 工厂配置,将这一愿景延伸,以 LPX 实现超快 Token 生成。这正在改变智能的生产方式。”
—— Jensen Huang, NVIDIA CEO

“Token 工厂"的叙事意味着 NVIDIA 正在将 AI 数据中心重新定义为"Token 生产线”——不再以"训练了多少参数"衡量,而是以"每秒能生产多少 Token"衡量。这与 Agent 时代的需求高度吻合。

2.3 SpaceXAI:从地球到太空的 Agent 推理

同日,NVIDIA 宣布 SpaceXAI 将采用 Vera CPU 加速下一代 Agent AI 应用,并扩大 Vera Rubin 平台建设。更引人注目的是,SpaceXAI 计划将优化版 Vera Rubin NVL72 延伸至太空,用于首代 Starmind AI 卫星。

维度详情
合作方SpaceXAI
采用硬件Vera CPU + Vera Rubin NVL72
算力规模向数 GW 扩张
太空计划首代 Starmind AI 卫星
来源NVIDIA,2026-08-24

三、内存危机:英伟达涨价 15%+ 的深层原因

3.1 涨价事实

就在 Groq 3 LPX 宣布全面量产的同一天,彭博社披露英伟达已通知最大客户:搭载 AI 芯片的服务器价格将上涨 15% 以上。

维度详情来源
涨价幅度>15%,部分型号约 17%Bloomberg / The Information
生效时间2027 年初出货系统Bloomberg
覆盖平台Vera Rubin + Grace BlackwellBloomberg
72 GPU 机架价格~700 万 → ~800 万美元Bloomberg
1 GW 数据中心额外成本≥$50 亿The Information
CFO 表态内存芯片与先进封装成本攀升Colette Kress
受影响客户微软、Google、Oracle 等Bloomberg

3.2 BOM 拆解:GPU 不再是最大成本项

摩根士丹利 5 月供应链报告揭示了 Vera Rubin VR200 NVL72 整柜 BOM 构成的剧变:

成本项Blackwell 世代占比Vera Rubin 世代占比变化
GPU~65%~51%↓ 14pp
HBM4 + LPDDR5X5-10%25-30%↑ 15-25pp
PCB+233%↑↑↑
MLCC(被动元件)+182%↑↑
ABF 封装载板+82%
整柜 BOM<400 万美元~780 万美元~2×

核心变化:GPU 在整柜成本中的占比从 65% 下降到 51%,而内存(HBM4 + LPDDR5X)从 5-10% 跃升至 25-30%,金额从约 37 万美元扩大到约 200 万美元。

3.3 内存供应:2027 年可能是最紧张的一年

时间线内存市场判断来源
2025Counterpoint 预测服务器内存价格 2026 年底前翻倍Counterpoint
2026 H1美光宣布 2026 年 HBM 产能全部售罄美光
2026-07SK 海力士 CEO:2027 年可能成为存储芯片供应最紧张的一年SK 海力士
2026-07需求超过产能的情况可能持续到 2030 年以后SK 海力士
2026 Q3TrendForce 预测服务器 DRAM 合约价环比涨 13-18%TrendForce

3.4 涨价对 AI 产业链的连锁影响

英伟达涨价 15%+
    │
    ├── 云厂商(微软/Google/Oracle)
    │   ├── 资本支出增加 20-30%
    │   └── 推理成本转嫁给 AI 公司
    │
    ├── AI 模型公司(OpenAI/Anthropic)
    │   ├── 推理成本上升 → 模型 API 涨价或利润压缩
    │   └── 自研 ASIC 动力增强(Google TPU / Amazon Trainium)
    │
    ├── 企业客户
    │   ├── AI 部署 TCO 上升
    │   └── 开源模型 + 自托管吸引力增加
    │
    └── 推理 ASIC 厂商
        ├── Groq / Cerebras / SambaNova 受益
        └── AMD MI450 / Intel Gaudi 替代需求上升

四、Agent 推理经济学:为什么 Token 速度决定一切

4.1 从"训练吞吐量"到"Token 生成速度"

时代核心指标硬件优化方向代表产品
预训练时代(2020-2024)TFLOPS / 训练吞吐量大算力、大显存A100 / H100 / B200
推理时代(2024-2026)Token/s / 批处理吞吐高带宽、低成本推理GB300 NVL72
Agent 时代(2026+)Token/s / 用户(延迟)超低延迟解码Groq 3 LPX / Groq

4.2 Agent 推理的成本结构

一个典型的 Agent 任务(代码生成 + 测试 + 修复):

阶段Token 量传统推理(50 Token/s)Groq 3 LPX(3400 Token/s)
读取上下文50K1 秒(prefill)1 秒(prefill)
第 1 步生成80016 秒0.24 秒
第 2 步生成60012 秒0.18 秒
第 200 步生成50010 秒0.15 秒
总生成时间~120K~40 分钟~35 秒

关键洞察:Agent 任务的瓶颈不在 prefill(上下文处理),而在 decode(Token 生成)。200 步 × 平均 600 Token / 50 Token/s = 2400 秒 = 40 分钟。同样任务在 Groq 3 LPX 上仅需 35 秒。

4.3 Nebius Token Factory:开发者无感迁移

Nebius CTO Danila Shtan 的关键表述:

“生成阶段决定了 AI 系统的实际响应速度,这正是 NVIDIA Groq 3 LPX 要加速的。作为第一个通过 Nebius Token Factory 将其投入生产的 AI 云,我们确保 Agent 循环的每一步都感觉是即时的——通过开发者已经在使用的相同 API,无需迁移到新栈。”

这意味着开发者不需要修改代码——Nebius 在后端自动将推理请求路由到 Groq 3 LPX,开发者通过同一套 API 获得加速。


五、竞争格局:Agent 推理硬件的多方博弈

5.1 主要玩家对比

厂商产品定位Token 速度优势
NVIDIAGroq 3 LPXGPU + LPU 协同3,400 Token/s生态完整、部署规模
Groq(公司)GroqCloud纯 LPU 推理~800 Token/s(Llama)先发优势、开发者社区
CerebrasWSE-3晶圆级推理~1,500 Token/s超大 SRAM、无 HBM 依赖
SambaNovaSN40L数据流架构~500 Token/s多模型并发
GoogleTPU v6e自研推理芯片未公开与 Gemini 深度整合
AmazonTrainium 2自研推理芯片未公开与 AWS Bedrock 整合
AMDMI450GPU 推理未公开价格竞争力

5.2 NVIDIA 的护城河

NVIDIA 在 Agent 推理市场的护城河来自三个层面:

  1. 硬件协同:Rubin GPU + Groq 3 LPX + BlueField-4 DPU + Spectrum-6 以太网 = 全栈协同设计
  2. 软件生态:CUDA / TensorRT / Triton Inference Server 已被全球 AI 工程师掌握
  3. 部署规模:Vera Rubin 平台的 7 芯片 × 5 机架架构已在大规模验证

5.3 Spectrum-X Multiplane:网络也变了

Hot Chips 上 NVIDIA 还发布了 Spectrum-X Multiplane 网络:

维度传统扩展Spectrum-X Multiplane
扩展方式增加第三层网络分裂为多个独立平面
规模上限受三层延迟限制512,000 GPU
故障恢复软件负载均衡硬件级,11× 更快
单平面故障整网受影响仍保持 ~90% 带宽
AI 工厂产出1.6×

六、对开发者的影响:你需要知道什么

6.1 立即影响

开发者类型影响行动建议
Agent 开发者Token 生成速度直接影响 Agent 用户体验选择支持 Groq 3 LPX 的云(Nebius)获得加速
推理服务运维需要重新评估推理基础设施 TCO对比 GPU-only vs GPU+LPU 的成本/速度
AI 应用产品经理Agent 响应速度从分钟级降到秒级重新设计 UX——用户可能不再需要"等待中"动画
开源模型开发者模型需优化 LPU 推理关注 Gemma 4 31B 等已优化模型

6.2 中期趋势

  1. 推理成本曲线将分化:传统推理(聊天/摘要)继续降价,Agent 推理(长链路/多步)可能出现溢价
  2. 自研 ASIC 加速:英伟达涨价 15%+ 将推动 Google/Amazon/Meta 加速自研推理芯片
  3. Token 计费模式变化:从"按 Token 计费"可能演进为"按任务完成时间计费"或"按 Agent 步数计费"
  4. 边缘 Agent 推理:低延迟需求可能推动部分 Agent 推理下沉到边缘节点

七、FAQ

Q1:Groq 3 LPX 和 Groq 公司是什么关系?

NVIDIA 在 2025 年收购了 Groq 公司的部分 IP 和团队,将其 LPU 技术整合进 Vera Rubin 平台,命名为 “Groq 3 LPX”。Groq 公司作为独立推理云继续运营,同时也是 NVIDIA 硬件的早期采用方。

Q2:普通开发者能直接使用 Groq 3 LPX 吗?

目前只能通过 Nebius Token Factory 平台间接使用。开发者使用 Nebius 的标准 API,后端自动路由到 Groq 3 LPX。Groq 公司也计划后续采用该平台。

Q3:英伟达涨价会让我用 AI 更贵吗?

短期不会直接影响终端用户。涨价针对 2027 年初出货的系统,云厂商会通过长期合约锁定价格。但中长期推理成本可能传导至 API 定价。

Q4:Vera Rubin 和 Grace Blackwell 有什么区别?

Grace Blackwell(GB300)是当前一代 AI 芯片平台,Vera Rubin 是下一代。Vera Rubin 在 Agent 推理工作负载下每兆瓦吞吐量是 GB300 的 30 倍,每 Token 成本降低 35 倍。

Q5:内存危机什么时候能缓解?

SK 海力士预测 2027 年可能是供应最紧张的一年,需求超过产能的情况可能持续到 2030 年以后。短期内无缓解迹象。

Q6:为什么 Agent 推理比聊天推理更吃硬件?

Agent 任务需要数百到数千个顺序推理步骤,每步依赖前一步的输出。总任务时间由每步 Token 生成速度决定,而非批处理吞吐量。这就像单线程延迟 vs 多线程吞吐的区别。

Q7:Spectrum-X Multiplane 对普通 AI 公司有什么影响?

如果你运营超过 10 万 GPU 的 AI 集群,Multiplane 可以让网络扩展到 51.2 万 GPU 而不增加第三层网络。对于中小规模部署影响较小。

Q8:Groq 3 LPX 的 3400 Token/s 对比人类阅读速度是什么概念?

人类平均阅读速度约 5-8 Token/s。3400 Token/s 意味着 Groq 3 LPX 生成文本的速度是人类阅读速度的 425-680 倍——远超人类实时跟读能力,适合 Agent 内部推理而非人机交互。


八、参考资料

  1. NVIDIA. “NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI.” NVIDIA Newsroom, 2026-08-24.
  2. NVIDIA Blog. “With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents.” 2026-08-24.
  3. Inside AI. “NVIDIA Groq 3 LPX Enters Full Production for Agentic AI Inference.” 2026-08-24.
  4. Bloomberg. “NVIDIA Customers Notified About AI-Related Price Hikes Above 15%.” 2026-08-22.
  5. TrendForce. “NVIDIA Reportedly Eyes More Than 15% Price Hikes for Vera Rubin, Grace Blackwell Servers.” 2026-08-24.
  6. WCCF Tech. “NVIDIA’s Vera Rubin & Blackwell GPU Server Prices Could Soar By As Much As 17%.” 2026-08-24.
  7. Morgan Stanley. “Vera Rubin VR200 NVL72 BOM Analysis.” 2026-05.
  8. 华尔街见闻. “英伟达宣布 Groq 3 LPX 全面投产,Vera Rubin 推理效率数倍提升.” 2026-08-25.
  9. DIGITIMES. “NVIDIA 漲價 15% 牽動 AI 供應鏈.” 2026-08-24.
  10. Nebius. “Token Factory Production Inference Platform.” 2026-08-24.

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐