1.论文概述

本文是来自于CVPR2024的一篇关于扩散模型的经典论文!
论文地址:[2308.13712] Residual Denoising Diffusion Models
代码地址:GitHub - nachifur/RDDM: CVPR 2024: Residual Denoising Diffusion Models

以下我将从论文背景、贡献、摘要、方法以及实验部分等几个方面来介绍本篇工作。

1.1作者信息

Jiawei Liu1,2,3, Qiang Wang1,4, Huijie Fan1,2*, Yinong Wang5, Yandong Tang1,2, Liangqiong Qu5**Corresponding author

1State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人学国家重点实验室)

2Institutes for Robotics and Intelligent Manufacturing, Chinese Academy of Science(中国科学院机器人与智能制造研究所)

3University of Chinese Academy of Sciences

4Shenyang University

5The University of Hong Kong

1.2论文背景

传统的去噪扩散概率模型(DDPM)和其变体(如DDIM)主要被设计用于图像生成任务,通过逐步添加噪声并学习如何反向去噪,来从纯噪声中生成高质量图像。这类方法在生成图像方面表现卓越,但在图像恢复(如去噪、去阴影、增强、去雨等)任务中存在以下两个核心问题

1解释性差:原始的前向扩散过程完全忽略了已知的退化图像(输入),仅对目标图像进行加噪。在图像恢复中,已知的退化图像本应在生成过程中提供明确的方向性,但传统扩散模型无法解释该方向,仅依赖条件输入作为暗示。

2图像恢复中使用纯噪声作为起点的低效性:对于图像生成,起始点为纯噪声是合理的;但对于图像恢复任务(如从一个退化图像恢复原图),直接从纯噪声开始反向采样是一种不必要且低效的过程,因为退化图像已知。

1.3现有方法局限

现有的图像修复方法通常使用退化图像(如模糊或受损图片)作为条件输入,引导模型去恢复清晰图像。但它们的逆向生成过程仍从噪声开始,这显得多余,因为退化图像本身已经是一个起点。此外,传统扩散模型的前向过程不包含退化图像的信息,导致它的工作机制在图像修复任务中缺乏解释性,具体可总结为以下几个方面:

1.解释性差:传统扩散模型从纯噪声开始 forward diffusion,不包含退化图信息,forward 过程无法说明图像恢复逻辑;对于图像恢复来说,“已知退化图”却仍然从随机噪声反向生成,是非直观且低效的。

2.方向性引导缺失:传统模型无法明确表示“从退化图到目标图”的语义方向,仅用条件输入隐式引导,缺乏明确的物理意义。

3.多任务统一能力弱:传统扩散方法通常专注于单一任务,如图像生成或图像恢复,难以在一个统一模型中灵活适配不同任务需求(如高多样性 vs 高确定性)。

1.4核心贡献

本文重新定义了一个新的前向扩散过程,使残差和噪声能够同时扩散。在这个过程中,目标图像逐渐扩散为纯噪声图像(用于图像生成)或带噪声的输入图像(用于图像修复)。与以往的去噪扩散模型不同,这些模型使用一个系数调度来控制图像与噪声的混合比例,而本文的RDDM采用了两个独立的系数调度(部分路径独立),分别控制残差和噪声的扩散速度。这种独立扩散特性在逆向生成过程中也非常明显。例如,在测试时,即便在一定范围内调整系数调度,图像生成的结果也不会受到影响。此外,也可以先去除残差,再进行去噪(如图所示),依然能生成语义一致的图像。

RDDM 兼容现有的去噪扩散模型,如DDPMDDIM,因为我们的采样过程可以通过转换系数调度与这些模型一致。此外,RDDM 原生支持条件输入,使得只需使用L1损失和batch大小为1进行训练的网络也能与最先进的图像修复方法竞争。

1.5摘要

本文提出了一种新的残差去噪扩散模型(Residual Denoising Diffusion Models, RDDM),它通过将传统的单一去噪扩散过程解耦为残差扩散噪声扩散这两个过程,构建了一个双重扩散框架。这一框架将去噪型扩散模型从原本难以解释的图像修复任务扩展为一种统一且可解释的模型,用于图像生成和图像修复

具体来说,残差扩散表示从目标图像向退化图像的方向扩散,并在逆向生成过程中明确指导图像修复的过程。而噪声扩散则表示扩散过程中存在的随机扰动。残差部分优先处理“确定性”信息,而噪声部分则强调“多样性”,使得RDDM能够有效统一不同任务,例如图像生成(注重多样性)和图像修复(注重确定性)。

本文通过系数变换证明了此方法采样过程与DDPMDDIM方法是一致的,并提出了一种部分路径无关的生成过程,以更好地理解逆向过程。值得注意的是,本文的RDDM模型使得一个仅使用L1损失函数和Batch大小为1的通用UNet网络也能够在图像修复任务上达到与当前最先进方法相当的水平。

2.模型结构

2.1DDPM(扩散模型)

1前向过程(Forward Process):

        将噪声添加到清晰图像中

2逆向过程(Reverse Process):

        去除在前向过程中添加的噪声,然后生成清晰图像

2.2RDDM(残差扩散模型)

3.方法

3.1带扰动的定向残差扩散过程

3.2生成过程与训练目标

这一部分介绍了如何生成新图像训练模型以提高生成和修复图像的能力。将生成过程分为前向和反向过程,并给出了相应的方程。具体来说:

生成过程:在生成新图像时,需要对残差和噪声进行估计。使用训练的网络来预测这些值,并根据当前的图像状态I_{t},逐步生成新图像I_{t-1}

训练目标:为确保网络能够准确预测残差和噪声,本文定义了损失函数L_{res} L_{\varepsilon },以测量网络输出和实际残差、噪声之间的差异。损失函数的目标是最小化这些差异,从而提升生成图像的质量。

随机与确定性生成:本文引入超参数 η 来控制生成过程的随机性。如果设定为1,生成的结果将带有随机性;若设定为0,结果则为确定性输出,这在实际应用中是有用的。

例子:假设你希望从一张模糊的图片恢复出清晰的图像。你会通过网络不断调整预测的残差和噪声,直到生成的图像尽可能接近原始目标。而在生成全新图像时,你可能希望随机性较高,以便得到多样化的结果。

3.3采样方法选择策略

这一部分内容主要讲的是如何选择最合适的方法来生成或修复图像,就像在厨房中选择不同的烹饪方式。

生成过程:在生成图像时,我们知道当前的图像和输入的图像。通过公式,我们可以找出这些图像之间的细节(残差)和随机噪声。

这里提出三种采样方法:

4.实验

4.1选择最佳方法

采样方法分析。CelebA 64 × 64数据集的采样步骤为 10 步,ISTD数据集为 5 步,LOL数据集为 2 步,RainDrop数据集为 5 步。

通过实验发现,SM-Res 修复图像时效果较好,而 SM-N 生成图像时表现更佳。对于新的未知任务,我们建议在需要多样性时使用 SM-N,而在需要准确性时使用 SM-Res

本文设计了一种优化目标自动选择算法来判断使用 SM-Res 还是 SM-N。该算法使用超参数,根据任务需求逐渐从联合预测(SM-Res-N)过渡到单独预测(SM-Res SM-N)。此即插即用的策略仅需 1000 次训练迭代,并完全兼容现有的去噪扩散模型。

4.2图像生成

本文作者通过将一个预先训练好的 DDIM 模型转换为 RDDM 来生成图像。转换公式如下:

结果显示,在转换前后的图像质量几乎没有变化,证明了扩散系数转换后的有效性RDDMDDPM/DDIM的采样是一致的。下图展示了一些用 10 个步骤生成的人脸图像。

4.3图像修复

本文在多个图像修复任务上进行了广泛评估,包括去除阴影、增强低光、去雨和去模糊,使用了 5 个数据集。值得注意的是,本文的 RDDM 使用与DDPM相同的 UNet 结构,所有任务的训练批量大小为 1

相比之下,最先进的方法(SOTA)通常涉及复杂的网络架构,如多阶段、多分支、Transformer GAN,或复杂的损失函数,如色度、纹理相似度和边缘损失。下表和图显示我们的 RDDM SOTA 图像修复方法具有竞争力。本文将最初无法解释的 DDPM/DDIM 扩展为一个统一且可解释的扩散模型,既可以用于图像生成,也可以用于图像修复,这是通过引入残差实现的。然而,残差扩散过程表示从目标图像到条件输入图像的定向扩散,不涉及有关图像修复任务的先验信息,因此不受限于此。

除了图像生成和修复,RRDM还可以进行图像修补和图像翻译的任务,以验证 RDDM 有潜力成为一种统一且可解释的图像到图像分布转换方法。

作者并不打算通过调整所有超参数来在所有任务中实现最佳性能。当前的实验结果显示:RDDM 在系数转换后与 DDIM 在图像生成性能上保持一致。在使用仅具有 L1 损失、批量大小为 1、少于 5 个采样步骤的通用 UNet 的情况下,RDDM 在与最先进的图像修复方法竞争时表现良好。在图像修补和图像翻译的可视化结果上表现令人满意,这验证了 RDDM广泛应用潜力

4.4实验结论

图像生成:RDDM兼容DDPM/DDIM图像生成模型;

图像恢复:RDDM不超过5个采样步数下实现SOTA

适用图像补全和图像翻译,且不用额外条件编码

5.结论

本文提出了一种统一的双重扩散模型,称为残差去噪扩散模型Residual Denoising Diffusion ModelsRDDM),用于图像修复和图像生成。这是一个三项混合框架,超越了以往的仅包含两项混合的去噪扩散框架。我们通过系数调度转换展示了我们的采样过程与 DDPM DDIM 的一致性,并提出了一种部分路径独立的生成过程。本文在四种不同的图像修复任务上的实验结果表明,RDDM 在不超过五个采样步骤的情况下达到了最先进的性能。RDDM模型和框架有潜力提供一种统一的图像到图像分布转换的方法,并为多维扩散过程铺平道路。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐