基于条件扩散模型的图像压缩框架

文章信息

论文题目为《Lossy Image Compression with Conditional Diffusion Models》,文章来自NIPS2022,是第一篇将扩散模型引入到图像压缩领域的论文。该文章从基于深度学习的图像编码框架,受到扩散模型的启发,设计了一种新的图像编码框架,模型的性能可以调整到感兴趣的感知度量。并且实验表明,在多个数据集和图像质量评估指标中,本文的模型比基于gan的模型报告的FID分数更高,同时在几个失真指标上也比基于vae的模型具有竞争力。此外,使用参数化训练扩散可以在少数解码步骤中实现高质量的重建,这极大地影响了模型的实用性

摘要

本文概述了一个使用扩散生成模型的端到端优化有损图像压缩框架。该方法依赖于转换编码范式,其中图像被映射到熵编码的潜在空间,并从那里映射回数据空间进行重建。与基于vae的神经压缩相比,其中(平均)解码器是一个确定性神经网络,本文的解码器是一个条件扩散模型。因此,本文的方法引入了一个附加的“内容”潜变量,反向扩散过程以该变量为条件,并使用该变量存储有关图像的信息。在解码时合成表征扩散过程的剩余“纹理”变量。本文表明,该模型的性能可以调整到感兴趣的感知度量。本文涉及多个数据集和图像质量评估指标的广泛实验表明,本文的方法比基于gan的模型报告的FID分数更高,同时在几个失真指标上也比基于vae的模型具有竞争力。此外,使用X参数化训练扩散可以在少数解码步骤中实现高质量的重建,这极大地影响了模型的实用性。

贡献

(1)本文提出了一种新的基于变换编码的有损压缩方案。该方法使用编码器将图像映射到上下文潜在变量;然后将该潜在变量作为上下文输入扩散模型以重建数据。该方法可以修改以增强几个感兴趣的感知度量。
(2)本文从扩散模型隐式速率失真函数的变分上界推导出模型的损失函数。由此产生的失真项在捕获更丰富的解码分布方面与传统的vae不同。此外,它只需要几个去噪步骤就能实现高质量的重建。
(3)本文提供了大量的经验证据,证明在许多情况下,本文的方法的变体在感知质量方面优于基于gan的模型,例如FID。本文的基本模型也显示出与mse优化基线相当的率失真性能。

问题定义

在图像压缩的变换编码方法中,编码器使用参数分析变换g_a (x;φ_g)转化为潜在表示y,然后量化形成y ̂。因为y ̂是离散值,它可以使用熵编码技术,如算术编码(Rissanen和Langdon, 1981)进行无损压缩,并作为比特序列传输。另一方面,解码器从压缩信号中恢复y ̂,并对其进行反量化后再进行参数合成变换g_s (y ̂;θ_g)恢复重构图像x ̂。在本文中认为变换g_a和g_s是一般的参数化函数,如人工神经网络(ann),而不是传统压缩方法中的线性变换。然后,参数θ_g和φ_g封装了神经元的权重等。因此问题定义如下:


方法

5.1 模型概况
下图显示了本文提出的模型概况。编码器首先将图像转换为离散的“内容”潜变量z,离散的内容潜变量z包含有关图像的信息。解码后,该变量用于指导去噪扩散过程。从而完成图像重构。

编码过程如下:首先,将图像x编码为其潜在表示y = Evae(x)。然后,对y进行量化。最后,z是编码和存储或传输的熵。
在解码过程中,首先随机生成高斯噪声同时逆量化变换计算出y ̂= Q^(-1) (z,γ),然后y ̂作为高斯噪声去噪过程的上下文指导这个过程经过t个去噪步骤来恢复重构图像x。下面的算法给出了完整的编码/解码过程:

5.2 编码器
本文未明确指出编码器所采用的网络结构,它可以是全连接网络、全卷积网络等任何可以提取图像特征的网络。
5.3 解码器
本文解码器基于条件去噪过程进行解码,首先本文生成一组随机高斯噪声,经过t次去噪过程对图像进行还原,每一次去噪以上一次去噪结果作为输入,同时去噪次数t和上下文向量同时指导这个过程,去噪所涉及的网络采用经典的Unet结构。
5.4 超先验网络
本文使用联合上下文和层次熵模型将量化潜信号编码为比特流。这些模型在文献中得到了广泛的研究。本文选择Entroformer作为本文的熵模型,因为它在实验中产生了最好的性能。它由基于变压器的超先验和双向上下文模型组成,用于估计潜函数的分布P(z),并通过算术编码将其编码为比特流。
5.5 基于条件的扩散模型
本文的压缩方法的基础是一种新的潜在变量模型:扩散变分自编码器。该模型有一个用于编码图像内容的“语义”潜变量z和一组描述残差信息的“纹理”变量x1:N,解码器将遵循以z为条件的去噪过程。

实验

本文进行了大规模的压缩评估,涉及多个图像质量指标和测试数据集。除了测量传统失真分数的指标外,本文还考虑了可以反映感知质量的指标。虽然其中一些指标是固定的,但其他指标是从数据中学习的。
本文选择了16个图像质量评估指标,其中论文中介绍了8个最广泛使用的指标,具体来说,最近提出的几个学习指标比其他非学习方法更好地捕获感知属性/真实感;本文将这些度量表示为感知度量,将其他度量表示为失真度量。值得注意的是,在计算FID时,本文遵循Mentzer等人(2020)的方法,将图像分割成256×256分辨率的非重叠补丁。
下图说明了使用DIV2K数据集在比特率和图像质量之间的关系。本文使用X -预测模型只需要17步来解码图像,这比需要数百步才能达到相当性能的ϵ-prediction模型要高效得多。在图中,虚线表示基线模型,实线表示本文提出的CDC模型。所示的8个图显示了两种不同类型的度量,通过它们各自的框架颜色来区分。

本文提出的版本CDC(ρ=0)和CDC(ρ=0.9)在感知和扭曲指标上表现出质的差异。设ρ=0只能优化比特率和扩散损失之间的权衡;与ρ= 0.9相比,这在基于模型的失真指标(即PSNR除外)中具有更好的性能。下图定性地表明,与基于vae的编解码器相比,得到的解码图像显示的过度平滑伪影更少。相反,CDC(ρ=0.9)在感知指标上表现最好。通过改变ρ值,本文可以控制失真、感知质量和比特率之间的三方权衡。


Attention

欢迎关注微信公众号《当交通遇上机器学习》!如果你和我一样是轨道交通、道路交通、城市规划相关领域的,也可以加微信:Dr_JinleiZhang,备注“进群”,加入交通大数据交流群!希望我们共同进步!
更多推荐
所有评论(0)