现有的去噪扩散模型并非传统意义上的“去噪”,它们不直接预测干净图像。相反,它学习的是如何预测所添加的噪声。

为此,MIT何恺明团队提出预测干净数据与预测含噪数据本质上是不同的,主张直接预测干净数据。研究团队提出JiT(Just image Transformers)方法,无需tokenizer、无需预训练、也无需额外的损失函数即可成为强大的生成模型。在ImageNet数据集上的实验表明,JiT在不同分辨率下均取得了具有竞争力的结果。在这些高分辨率设置下,预测高维带噪声数据的方法可能会彻底失败。该研究回归本源,为在原始自然数据上构建基于Transformer的扩散模型,探索了一种自洽的范式。

img

  • 论文标题:Back to Basics: Let Denoising Generative Models Denoise

01

方法

img

如上图所示,根据流形假设(Manifold Assumption),自然图像虽然存在于高维像素空间中(例如 256×256的彩色图片有196,608 维),但它们实际上只分布在其中的一个低维子空间上,这个子空间就是“流形”。干净图像x可被建模在流形之上,而噪声ϵ或流速度v(例如v = x - ϵ)本质上位于流形之外。训练神经网络预测干净图像(x-pred)与训练其预测噪声或含噪数据(即ϵ-pred/v-pred)具有本质区别。

最近两年,大家都可以看到AI的发展有多快,我国超10亿参数的大模型,在短短一年之内,已经超过了100个,现在还在不断的发掘中,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?

与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,整体AI领域2025年预计缺口1000万人,其中算法、工程应用类人才需求最为紧迫!

学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。【点击蓝字获取】

【2025最新】AI大模型全套学习籽料(可白嫖):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!

如表1所示,扩散模型可以在x(原始数据)、ϵ(噪声)或v(流速)空间中进行构建。空间的选择不仅决定了损失函数的定义域,也决定了网络的预测目标。重要的是,损失函数空间与网络输出空间不必相同,而如何选择会对模型性能产生决定性影响。

img

表1:在 x、v 或 ϵ 空间中定义损失函数与网络预测的所有可能组合。网络的直接输出以颜色高亮显示。对于任意非对角线项(即网络输出空间与损失空间不一致的情况),需对网络输出进行相应变换。

根据流形假设的观点,数据x倾向于分布在低维流形上,而噪声ϵ和流速v则位于流形之外。让网络直接预测干净数据x理应更具可操作性,研究团队通过一个玩具实验验证这一假设。

研究团队通过随机投影矩阵P将d维数据投射到 D 维(d<D)复杂空间里。研究团队训练了一个简单的生成模型(具有256维隐藏单元的5层ReLU MLP)在此D维空间内生成数据。

实验可视化结果是通过将 D 维生成样本使用矩阵 P 投影回 d 维空间得到的。实验研究了在d=2 ,D∈{2,8,16,512} 的情况,分别考察 x、ϵ 或 v 预测任务,所有实验均采用 v-loss。

img

如上图所示,当 D 增大时,只有 x-pred能够产生合理的结果。对于 ϵ-pred或 v-pred,模型在 D=16 时已表现不佳,而在 D=512 时则彻底失败——此时256维MLP处于欠完备状态。

值得注意的是,即使模型处于欠完备状态,x-pred依然表现良好。在此情况下,256维的MLP在 D=512 的高维空间中不可避免地会丢失信息。但由于真实数据本就存在于低维的d维空间,且理想输出隐式地具有d维特性,因此 x-pred仍能保持良好性能。

img

图3:JiT架构,直接作用于像素块(patches of pixels)并执行 x-pred的标准ViT。

基于上述分析,研究团队提出了JiT(Just Image Transformers)架构,无需复杂的Tokenizer、预训练或额外的损失函数。

如图3所示,考虑H×W×C维的图像数据(C=3)。所有的x、ϵ、v和zt共享相同的维度。给定一张图像,将其划分为大小为p×p的非重叠块,从而得到一个长度为img的序列。每个块是一个p×p×3维的向量。这个序列通过线性嵌入投影处理,添加位置嵌入,并通过一系列Transformer块进行映射。输出层是一个线性预测器,将每个token映射回一个p×p×3维的块。

按照标准做法,该架构依赖于时间t和给定的类别标签。研究者使用adaLN-Zero 进行条件化。概念上,这种架构相当于直接应用于像素块的Diffusion Transformer(DiT)。

例如,在256×256的图像上研究JiT/16(即patch大小p=16),在512×512图像上研究了JiT/32(p=32)。这些设置分别导致每个块的维度为768(16×16×3)和3072(32×32×3)。这样高维的patch,仅使用x-pred就能表现出惊人的良好性能。

02

评估

(1)仅集成先进组件的Transformer

通用 Transformer 的优势在于:当其架构与具体任务解耦时,可直接复用其他领域(如语言建模)中已验证有效的先进设计。正因如此,使用任务无关的 Transformer 来建模扩散过程具有天然优势。

研究团队并未引入任何任务定制模块,而是仅集成一系列通用且成熟的改进——包括 SwiGLU 激活函数、RMSNorm 归一化、RoPE 位置编码和 qk-norm 注意力归一化(均源自语言模型)。此外,在类别条件控制上,采用多上下文类标记(默认 32 个),而非 ViT 中的单个类 token。

下表展示了加入 RoPE和 qk-norm后最佳 FID 可达 5.44,说明这些通用组件对生成性能的累积提升效果,验证了“仅靠集成现有先进技术,即可构建高性能扩散模型”的设计理念。

img

(2)定性分析

img

图5:定性结果。使用JiT-H/32在ImageNet 512×512上生成的部分图片示例。

  • 高分辨率像素生成

JiT-B 模型在保持主干网络结构、参数量和计算开销几乎不变的前提下,仅通过调整输入/输出的 patch 嵌入维度,即可直接扩展到 512×512 和 1024×1024 的高分辨率像素级生成,并在这些分辨率下仍能实现具有竞争力的FID表现 。

这表明其架构能够有效处理极高维的 per-patch 表示,而无需依赖潜空间压缩或模型扩容,从而避免了传统像素级扩散模型的观测维度灾难

img

  • 可扩展性

如表6所示,即使不引入任何针对图像生成的专用设计,仅依靠通用 Transformer 架构,JiT 模型也能展现出显著的双向可扩展性:一方面,模型性能随参数量增大而持续提升;另一方面,在更高分辨率下,大模型不仅未出现性能退化,反而因任务难度增加而缓解了过拟合问题——对于最大的 JiT-G 模型,其在 512 分辨率下的 FID 甚至优于 256 分辨率的结果。

img

  • 先前方法的参考结果

作为参考,在表 7 和表 8 中与先前工作进行了对比,并标明了各方法所依赖的预训练组件。与现有像素级生成方法相比,JiT方法完全基于简洁、通用的 Transformer 架构,无需引入任务特定的设计。得益于高效的架构设计,模型在计算上十分友好——当分辨率翻倍时,计算开销并未如传统方法那样呈平方级增长(详见表 8 中的 FLOPs)。本文方法未引入额外的损失函数或预训练策略,此类方法有望带来进一步性能提升,留待未来研究。

img

img

03

总结

该研究重新审视了扩散模型的基础,有力地论证了直接预测干净数据比预测噪声或预测流速更本质且更有效。

该工作对于在原始数据上实现自洽的“Diffusion + Transformer”范式迈出了重要一步。这一范式不仅适用于计算机视觉,在其他涉及自然数据的领域(如蛋白质、分子或气象等)也具有重要价值,这些领域设计专用的tokenizer往往极为困难。JiT为构建更简洁、更通用的生成模型奠定了新的可能性。

最近两年,大家都可以看到AI的发展有多快,我国超10亿参数的大模型,在短短一年之内,已经超过了100个,现在还在不断的发掘中,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?

与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,整体AI领域2025年预计缺口1000万人,其中算法、工程应用类人才需求最为紧迫!

学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。【点击蓝字获取】

【2025最新】AI大模型全套学习籽料(可白嫖):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐