过去,大模型部署常见的优化方式是:

模型太大 → 做量化 → 把 FP16 压成 INT8、INT4。

量化一直被看作一种“部署阶段的压缩技术”。

但到了 2026 年,这个逻辑开始发生变化。

NVIDIA 已经把 NVFP4 从单纯推理格式,进一步扩展到:

  • 模型推理;
  • KV Cache;
  • 大模型预训练;
  • 视频生成模型。

2026 年 NVIDIA 的研究甚至提出:

4-bit 浮点开始覆盖模型完整生命周期。

这意味着低精度计算正在从“模型发布后的优化手段”,变成:

模型设计和训练阶段就开始考虑的基础能力。


一、为什么大模型喜欢低精度?

一个参数如果使用 FP16,需要 16 bit。

如果换成 FP8,只需要 8 bit。

换成 FP4,则理论上只需要 4 bit。

因此同一个模型:

FP16 → 100%
FP8  → 约 50%
FP4  → 约 25%

实际还会存在 Scale 等额外数据,但核心方向不变:

精度越低,模型越省内存。

这会直接带来三个好处:

  1. 同一张 GPU 可以放更大的模型;
  2. HBM 需要搬运的数据更少;
  3. Tensor Core 可以一次处理更多数据。

所以低精度不仅解决“显存不够”。

还会同时影响:

吞吐、带宽和功耗。


二、FP4 和传统 INT4 有什么区别?

INT4 是 4-bit Integer。

它适合表达固定范围内的整数。

而 FP4 是 4-bit Floating Point。

它仍然保留:

  • Sign;
  • Exponent;
  • Mantissa。

也就是说,它仍然具有一定“浮点数动态范围”。

NVIDIA 的 NVFP4 使用 E2M1:

1 bit Sign
2 bit Exponent
1 bit Mantissa

但只有 4 bit 远远不够精确。

所以 NVFP4 还使用了:

Micro-block Scaling。

它会对一小组数据使用额外 Scale,帮助这 4 bit 更准确地表示原始数值。

可以理解成:

不是让所有数据共用一把尺子,而是给不同小区域分别配一把尺子。

这样能明显减少量化误差。


三、为什么以前 FP4 很难直接训练模型?

推理和训练的要求完全不同。

推理只需要:

Forward。

训练还需要:

  • Forward;
  • Backward;
  • Gradient;
  • Weight Update。

梯度中的很多数值非常小。

如果精度太低,就可能直接被舍入成 0。

结果就是:

模型无法稳定收敛。

因此过去大家更愿意:

高精度训练 → 低精度推理。

但 2026 年 NVIDIA 已经展示了 NVFP4 Mixed-Precision Pretraining。

关键不是“所有东西都强行变成 4 bit”。

而是:

不同计算阶段采用不同精度。

例如部分 GEMM 使用 FP4,而敏感层仍保持更高精度。

这也是 Mixed Precision 的核心。


四、为什么低精度首先解决的是“内存墙”?

很多人认为 FP4 最大的价值是:

Tensor Core 算得更快。

其实另一个同样重要的价值是:

减少内存访问。

假设模型权重原来需要 200GB。

如果低精度后显著降低,那么每生成一个 Token,需要从 HBM 读取的数据也会减少。

对于 Decode 阶段来说,这非常关键。

因为很多大模型 Decode 并不是算力不足。

而是:

HBM 来不及把模型权重送进计算单元。

所以低精度可以同时做到:

模型更小
↓
显存压力下降
↓
内存传输量下降
↓
GPU 等数据时间下降
↓
吞吐提升

五、为什么 KV Cache 也开始进入 FP4?

模型权重只是显存占用的一部分。

长上下文推理还有另一个大户:

KV Cache。

随着 Context 从:

  • 32K;
  • 128K;
  • 1M;

不断增长,KV Cache 会迅速扩大。

NVIDIA 已经提出 NVFP4 KV Cache。

官方测试中,NVFP4 KV Cache 相比 FP8 可以将缓存内存占用进一步降低约一半,并用于增加可支持的上下文长度和 Batch Size。

这意味着 4-bit 开始覆盖:

Weights
+
Activations
+
KV Cache

而不是只压缩模型文件。


六、FP4 会不会让模型变笨?

这是低精度最关键的问题。

答案是:

取决于量化方法和模型。

如果简单粗暴地把所有数据从 FP16 截成 4 bit,精度损失可能非常明显。

所以现在的低精度技术越来越强调:

  • Block Scaling;
  • Quantization-Aware Training;
  • Quantization-Aware Distillation;
  • Selective Precision;
  • Calibration。

核心目标是:

只在“不敏感”的地方降低精度。

在敏感模块继续保留 FP8、BF16 等格式。

因此真正的 FP4 并不是:

“全部变成 4 bit。”

而是一套:

精度调度策略。


七、这对云 GPU 平台意味着什么?

低精度会改变算力平台的一个基本逻辑。

过去:

一个模型至少需要多张 GPU。

未来经过原生低精度优化后,可能用更少 GPU 就能完成同样任务。

这意味着用户选卡时,不能只看:

  • GPU 显存;
  • FP16 算力。

还应该看:

  • 是否原生支持 FP8 / FP4;
  • 推理框架是否支持;
  • 模型有没有对应低精度 Checkpoint;
  • Kernel 是否优化;
  • 实际精度损失是多少。

同一张卡在不同 Precision 下,实际经济性可能完全不同。


八、结语:未来竞争的不只是“更多 FLOPS”

AI 芯片性能提升有两条路。

第一条:

增加更多计算单元。

第二条:

让每个数字变得更小。

FP32 → FP16 → FP8 → FP4,本质上就是第二条路线。

它让 AI 系统在同样的:

  • 晶体管;
  • HBM;
  • 带宽;
  • 电力;

条件下处理更多数据。

所以未来 AI 算力效率的提升,并不一定全部来自更大的 GPU。

还有一部分会来自:

更聪明地使用更少的 bit。

当 FP4 从部署量化进一步进入训练和 KV Cache 后,大模型正在真正进入一个“低精度原生时代”。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐