在这里插入图片描述

引言:生成模型的新范式

在深度学习领域,生成模型 (Generative Models) 一直是研究的热点。从早期的生成对抗网络 (GANs) 到变分自编码器 (VAEs),它们不断推动着图像、音频和文本生成技术的边界。近年来,扩散模型 (Diffusion Models, DMs) 凭借其卓越的生成质量和理论优雅性,迅速成为最主流的生成模型范式,尤其在图像生成领域取得了令人瞩目的成就,例如DALL-E 3和Stable Diffusion等。

然而,扩散模型的发展路径并非单一。在历史演进中,它形成了至少三种看似不同,实则同源的理论框架。为了系统性地梳理这些原理,来自Sony AI、OpenAI和Stanford等机构的研究人员撰写了一篇长达470页的专著——《扩散模型的原理:从起源到进阶》 (The Principles of Diffusion Models: From Origins to Advances) [1]。

本文将基于这篇专著的核心思想,为您解读扩散模型的三大视角及其背后的统一数学框架。
在这里插入图片描述

核心原理:前向与反向过程

扩散模型的核心思想非常直观:

  1. 前向过程 (Forward Corruption Process):这是一个固定的、马尔可夫链式的过程。它通过一系列小步骤,逐渐向原始数据 x 0 \mathbf{x}_0 x0 中添加高斯噪声,直到数据完全变成纯噪声 x T \mathbf{x}_T xT。这个过程是可控且易于分析的。
  2. 反向过程 (Reverse Process):这是模型需要学习的过程。它从纯噪声 x T \mathbf{x}_T xT 开始,通过逆转前向过程的每一步,逐步去除噪声,最终恢复出原始数据 x 0 \mathbf{x}_0 x0。这个反向过程就是生成新数据的过程。

专著指出,这两种过程通过定义一个连续的中间分布族联系起来,而模型的目标就是精确地学习这个反向过程的每一步。

三大视角:殊途同归的理论框架

为了形式化地描述和学习这个反向过程,研究人员发展出了三种互补的理论视角,它们从不同的数学基础出发,最终都指向了同一个目标。

视角核心思想经典模型代表关键数学工具
变分视角 (Variational Perspective)将扩散模型视为一个层次化的变分自编码器 (VAE),通过最大化证据下界 (ELBO) 来学习反向过程。DDPM (Denoising Diffusion Probabilistic Models)变分推断、ELBO
基于分数的视角 (Score-Based Perspective)将反向过程视为沿着数据分布的梯度方向进行去噪。模型学习的是数据分布的分数函数(即对数概率密度的梯度)。NCSN (Noise Conditional Score Networks)分数匹配 (Score Matching)、基于能量的模型 (EBMs)
基于流的视角 (Flow-Based Perspective)将生成过程视为一个连续的流,通过学习一个时间依赖的速度场(或向量场),将噪声平滑地输运到数据分布。Flow Matching归一化流 (Normalizing Flows)、连续时间流

统一框架:随机微分方程 (SDE)

这篇专著最核心的贡献之一,是展示了这三种视角最终都可以在一个统一的数学框架下得到解释和融合:随机微分方程 (Stochastic Differential Equations, SDEs)

SDE框架将离散的扩散过程推广到连续时间 t ∈ [ 0 , T ] t \in [0, T] t[0,T]。前向过程可以被描述为一个SDE,它将数据 x 0 \mathbf{x}_0 x0 演化为噪声 x T \mathbf{x}_T xT。根据Fokker-Planck方程,这个SDE的反向过程也可以被精确地写成另一个SDE。

SDE框架的优势在于:

  1. 统一性:它证明了DDPM和NCSN等模型实际上是同一个连续时间SDE在不同离散化方案下的特例。
  2. 灵活性:通过选择不同的SDE形式(如概率流ODE (Probability Flow ODE)),可以实现确定性的生成过程,这为快速采样模型蒸馏提供了理论基础。
  3. 可控性:SDE框架为引导 (Guidance)可控生成提供了清晰的数学工具,例如通过修改SDE中的漂移项来实现条件生成。

进阶应用:快速采样与可控生成

专著的后半部分深入探讨了如何将这些理论基础应用于实际的生成任务中,主要集中在两个关键挑战:

1. 快速采样 (Fast Sampling)

传统的扩散模型需要数百甚至数千步才能完成一次高质量的生成,速度较慢。专著详细介绍了多种加速技术:

  • Sophisticated Solvers (复杂求解器):使用更高级的数值求解器(如DPM-Solver、DDIM)来离散化SDE,从而在更少的步骤内获得高质量结果。
  • Distillation-Based Methods (基于蒸馏的方法):训练一个“学生”模型来模仿一个训练好的“教师”模型的生成轨迹,从而将生成步骤从数百步压缩到几十步甚至几步。
  • Learning Fast Generators from Scratch (从头学习快速生成器):例如一致性模型 (Consistency Models),它直接学习一个从噪声到数据的映射,确保沿任何轨迹的采样点都映射到相同的原始数据点,从而实现一步生成。

2. 可控生成 (Controllable Generation)

扩散模型强大的生成能力需要精确的控制。专著重点介绍了:

  • Classifier Guidance (分类器引导):使用一个额外的分类器来指导反向过程,使其生成的样本更符合特定的类别或属性。
  • Classifier-Free Guidance (无分类器引导):一种更流行的技术,通过同时训练条件和非条件扩散模型,利用它们的差异来增强条件生成的效果,实现了更高的生成质量和可控性。

总结与展望

《扩散模型的原理:从起源到进阶》是一部里程碑式的专著,它不仅为研究人员提供了一个统一、系统化的理论框架,也为希望深入理解扩散模型数学基础的读者提供了宝贵的资源。它将扩散模型的三大理论流派——变分、基于分数和基于流——巧妙地融合在SDE的旗帜下,并详细阐述了从DDPM到一致性模型等一系列关键进展。

对于希望在生成模型领域深耕的开发者和研究者来说,这篇专著无疑是一份不可多得的“扩散模型圣经”。


参考文献

[1] Lai, C.-H., Song, Y., Kim, D., Mitsufuji, Y., & Ermon, S. (2025). The Principles of Diffusion Models: From Origins to Advances. arXiv preprint arXiv:2510.21890. https://www.arxiv.org/pdf/2510.21890

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐