视频扩散模型综述

paper是复旦大学发表在CSUR 2024的工作

paper title:A Survey on Video Diffusion Models

Code:链接

Abstract

近期,人工智能生成内容(AIGC)浪潮在计算机视觉领域取得了显著成功,其中扩散模型发挥了关键作用。由于其卓越的生成能力,扩散模型正逐渐取代基于GAN和自回归Transformer的方法,不仅在图像生成与编辑方面表现出色,在视频相关研究领域也展现了强大潜力。然而,现有综述主要集中于图像生成中的扩散模型,针对视频领域的应用综述仍较为稀缺,且缺少最新的系统性总结。为填补这一空白,本文对AIGC时代的视频扩散模型进行了全面综述。具体而言,我们首先简要介绍了扩散模型的基本原理及其发展历程。随后,针对视频领域中的扩散模型研究,进行系统梳理,并将相关工作划分为三个核心方向:视频生成、视频编辑和其他视频理解任务。我们对这三个方向的文献进行了详细回顾,并进一步细化分类,总结了各领域的实际贡献。最后,本文讨论了当前该领域研究所面临的主要挑战,并展望了未来的发展趋势。

1 Introduction

人工智能生成内容(AIGC)是当前计算机视觉与人工智能领域最重要的研究方向之一。AIGC不仅引发了广泛关注与学术研究,还在计算机图形学、艺术设计、医学影像等多个行业和应用领域产生了深远影响。在众多方法中,以扩散模型为代表的一系列方法展现出显著成功,迅速取代了基于生成对抗网络(GAN)和自回归Transformer的方法,成为图像生成领域的主流技术。凭借强大的可控性、逼真的生成质量和多样性,基于扩散模型的方法在包括图像编辑、密集预测等众多计算机视觉任务中蓬勃发展,同时也在视频合成和三维生成等多个领域取得了突出成果。作为最重要的媒介之一,视频已成为互联网上的核心内容。相比纯文本和静态图像,视频蕴含丰富的动态信息,能够为用户提供更加全面、沉浸的视觉体验。基于扩散模型的视频相关研究正逐渐受到关注。如图1所示,自2022年以来,视频扩散模型相关研究论文数量显著增长,主要可分为三个方向:视频生成、视频编辑和视频理解。

图1

图1. 视频扩散模型研究工作概览。(a) 相关研究工作的数量正在快速增长。(b) 视频生成与视频编辑是当前扩散模型应用最多的两个研究方向。

随着视频扩散模型的快速发展及其在多个任务中展现出优异性能,系统梳理和对比该领域的最新研究工作显得尤为重要。已有若干综述文章总结了AIGC时代的基础模型,包括扩散模型本身和多模态学习,同时也有针对文本生成图像、文本生成三维的综述。然而,这些综述往往仅对视频扩散模型作粗略介绍,或主要聚焦于图像生成模型。因此,本文旨在填补这一空白,全面综述扩散模型在视频领域的方法、实验设置、基准数据集及其他应用。

贡献:本综述系统梳理并总结了近期视频扩散模型相关文献,涵盖视频生成、视频编辑以及视频理解等多个方向。我们提炼出各类工作中的共性技术细节,覆盖该领域最具代表性的研究。同时,我们也介绍了视频扩散模型的背景知识与相关基础内容。此外,我们对视频生成中的基准数据集与实验设置进行了全面分析与对比。据我们所知,这是首篇专注于视频扩散模型的综述文章。值得强调的是,由于该领域发展迅速,本文可能无法囊括所有最新进展,因此我们鼓励研究者与我们联系,分享他们在该领域的新成果,以便在后续版本中补充讨论。

综述结构:第二节介绍背景知识,包括问题定义、数据集、评测指标及相关研究领域。第三节重点综述视频生成方向的方法。第四节详述视频编辑相关的代表性研究。第五节介绍扩散模型在视频理解中的应用。第六节总结当前研究面临的挑战与未来可能的发展方向,最后在第七节给出全文结论。

2 Preliminaries

本节首先介绍扩散模型的基础知识,其次回顾相关研究领域,最后介绍常用的数据集与评测指标。

图2

图2. 扩散模型概览。我们展示了DDPM、SGM和Score SDE的扩散与去噪过程。

2.1 Diffusion Model


扩散模型是一类概率生成模型,其核心思想是学习逆转一个逐步破坏训练数据结构的过程,已成为当前最先进的深度生成模型家族。它们在图像生成、图像超分辨率和图像编辑等多个具有挑战性的任务中打破了生成对抗网络(GAN)长期以来的主导地位。当前扩散模型的研究主要基于三种主流框架:去噪扩散概率模型(DDPM)、基于评分的生成模型(SGM)和随机微分方程(Score SDE)。这三种框架中的扩散与去噪过程已在图2中进行了总结与展示。

2.1.1 Denoising Diffusion Probabilistic Models (DDPMs).


去噪扩散概率模型(DDPM)包含两个马尔可夫链:一个前向过程将数据逐步扰动为噪声,另一个反向过程则将噪声还原为数据。前向过程的目标是将任意数据转化为一个简单的先验分布,而反向过程则通过学习转换核来逆转前向过程。新数据的生成过程包括:首先从先验分布中采样一个随机向量,然后通过反向马尔可夫链进行逐步采样。该采样过程的关键在于训练反向马尔可夫链,使其能够逼近前向马尔可夫链的真实时间反转过程。

形式上,给定一个数据分布 x 0 ∼ q ( x 0 ) x_0 \sim q(x_0) x0q(x0),前向马尔可夫过程会生成一系列随机变量 x 1 , x 2 , … , x T x_1, x_2, \ldots, x_T x1,x2,,xT,其转移核为 q ( x t ∣ x t − 1 ) q(x_t \mid x_{t-1}) q(xtxt1)。条件于 x 0 x_0 x0 的联合分布,记作 q ( x 1 , … , x T ∣ x 0 ) q(x_1, \ldots, x_T \mid x_0) q(x1,,xTx0),可以分解为:

q ( x 1 , … , x T ∣ x 0 ) = ∏ t = 1 T q ( x t ∣ x t − 1 ) . q(x_1, \ldots, x_T \mid x_0) = \prod_{t=1}^{T} q(x_t \mid x_{t-1}). q(x1,,xTx0)=t=1Tq(xtxt1).

通常,转移核被设计为:

q ( x t ∣ x t − 1 ) = N ( x t ; 1 − β t   x t − 1 , β t I ) , q(x_t \mid x_{t-1}) = \mathcal{N}(x_t; \sqrt{1 - \beta_t} \, x_{t-1}, \beta_t \mathbf{I}), q(xtxt1)=N(xt;1βt xt1,βtI),

其中 β t ∈ ( 0 , 1 ) \beta_t \in (0, 1) βt(0,1) 是在模型训练前选定的超参数。

反向马尔可夫链由先验分布 p ( x T ) = N ( x T ; 0 , I ) p(x_T) = \mathcal{N}(x_T; 0, \mathbf{I}) p(xT)=N(xT;0,I) 和一个可学习的转移核 p θ ( x t − 1 ∣ x t ) p_{\theta}(x_{t-1} \mid x_t) pθ(xt1xt) 参数化,其形式为:

p θ ( x t − 1 ∣ x t ) = N ( x t − 1 ; μ θ ( x t , t ) , Σ θ ( x t , t ) ) p_{\theta}(x_{t-1} \mid x_t) = \mathcal{N}(x_{t-1}; \mu_{\theta}(x_t, t), \Sigma_{\theta}(x_t, t)) pθ(xt1xt)=N(xt1;μθ(xt,t),Σθ(xt,t))

其中 θ \theta θ 表示模型参数,均值 μ θ ( x t , t ) \mu_{\theta}(x_t, t) μθ(xt,t) 和方差 Σ θ ( x t , t ) \Sigma_{\theta}(x_t, t) Σθ(xt,t) 由深度神经网络参数化。通过反向马尔可夫链,我们可以生成新的数据 x 0 x_0 x0,方法是首先从先验分布中采样噪声向量 x T ∼ p ( x T ) x_T \sim p(x_T) xTp(xT),然后通过可学习的转移核迭代采样 x t − 1 ∼ p θ ( x t − 1 ∣ x t ) x_{t-1} \sim p_{\theta}(x_{t-1} \mid x_t) xt1pθ(xt1xt),直到 t = 1 t=1 t=1

2.1.2 Score-Based Generative Models (SGMs).


基于评分的生成模型(SGM)的核心思想是通过不同强度的噪声对数据进行扰动,并通过训练一个单一的条件评分网络,同时估计所有噪声水平下的评分函数。生成样本时,通过将不同噪声水平下的评分函数串联,并结合基于评分的采样方法进行生成。在SGM框架中,训练过程与采样过程是完全解耦的。

与第2.1.1节中的符号类似,设 q ( x 0 ) q(x_0) q(x0)为数据分布, 0 < σ 1 < σ 2 < … < σ T 0 < \sigma_1 < \sigma_2 < \ldots < \sigma_T 0<σ1<σ2<<σT为一系列噪声水平。SGM的一个典型示例是通过高斯噪声分布 q ( x t ∣ x 0 ) = N ( x t ; x 0 , σ t 2 I ) q(x_t \mid x_0) = \mathcal{N}(x_t; x_0, \sigma_t^2 \mathbf{I}) q(xtx0)=N(xt;x0,σt2I)将数据点 x 0 x_0 x0扰动为 x t x_t xt,从而得到一系列带噪数据密度 q ( x 1 ) , q ( x 2 ) , … , q ( x T ) q(x_1), q(x_2), \ldots, q(x_T) q(x1),q(x2),,q(xT),其中 q ( x t ) : = ∫ q ( x t ) q ( x 0 ) d x 0 q(x_t) := \int q(x_t) q(x_0) dx_0 q(xt):=q(xt)q(x0)dx0
噪声条件评分网络(NCSN)是一个深度神经网络 s θ ( x , t ) s_{\theta}(x, t) sθ(x,t),用于估计评分函数 ∇ x t log ⁡ q ( x t ) \nabla_{x_t} \log q(x_t) xtlogq(xt)。我们可以直接使用评分匹配、去噪评分匹配和切片评分匹配等技术,从带噪数据中训练NCSN。

在样本生成过程中,SGM利用迭代方法,依次从 s θ ( x , T ) , s θ ( x , T − 1 ) , … , s θ ( x , 0 ) s_{\theta}(x, T), s_{\theta}(x, T-1), \ldots, s_{\theta}(x, 0) sθ(x,T),sθ(x,T1),,sθ(x,0)生成样本,常用的方法包括退火Langevin动力学(ALD)。

2.1.3 Stochastic Differential Equations (Score SDEs).


利用多种噪声尺度对数据进行扰动是上述方法成功的关键。Score SDE进一步将这一思想推广到无限多的噪声尺度。扩散过程可以通过以下随机微分方程(SDE)的解来建模:
d x = f ( x , t ) d t + g ( t ) d w dx = \mathbf{f}(x, t) dt + g(t) d\mathbf{w} dx=f(x,t)dt+g(t)dw

其中 f ( x , t ) \mathbf{f}(x, t) f(x,t) g ( t ) g(t) g(t)分别是SDE的扩散函数和漂移函数, w \mathbf{w} w是标准Wiener过程。

x ( T ) ∼ p T x(T) \sim p_T x(T)pT中采样,并反转过程,我们可以通过如下的时间反转SDE获得 x ( 0 ) ∼ p 0 x(0) \sim p_0 x(0)p0的样本:

d x = [ f ( x , t ) − g ( t ) 2 ∇ x log ⁡ q t ( x ) ] d t + g ( t ) d w ˉ dx = \left[ \mathbf{f}(x, t) - g(t)^2 \nabla_x \log q_t(x) \right] dt + g(t) d\bar{\mathbf{w}} dx=[f(x,t)g(t)2xlogqt(x)]dt+g(t)dwˉ

其中 w ˉ \bar{\mathbf{w}} wˉ是在时间反向流动下的标准Wiener过程。一旦已知所有 t t t下的边缘分布的评分函数 ∇ x log ⁡ p t ( x ) \nabla_x \log p_t(x) xlogpt(x),我们就可以根据上述方程推导出反向扩散过程,并通过模拟该过程从 p 0 p_0 p0中采样。

2.2 Related Tasks


视频扩散模型的应用涵盖了广泛的视频任务,包括视频生成、视频编辑以及多种视频理解任务。这些任务的方法具有一定共性,通常会将问题建模为扩散生成任务,或利用扩散模型强大的可控生成能力来完成下游任务。在本综述中,我们主要关注诸如文本生成视频(Text-to-Video, T2V)生成、无条件视频生成以及文本引导的视频编辑等任务。

• 文本生成视频(Text-to-Video Generation)的目标是根据文本描述自动生成对应的视频。这通常涉及理解文本中的场景、物体和动作,并将其转化为连贯的视频帧序列,从而生成在逻辑和视觉上都一致的视频内容。T2V具有广泛的应用前景,包括电影自动生成、动画制作、虚拟现实内容生成、教育演示视频生成等。

• 无条件视频生成(Unconditional Video Generation)是一种生成任务,其目标是在没有特定输入条件的情况下,从随机噪声或固定初始状态生成连续且视觉连贯的视频序列。不同于条件视频生成,无条件视频生成无需任何外部引导或先验信息。生成模型需要在缺乏明确输入的情况下,学习捕捉视频中的时间动态、动作和视觉一致性,从而生成真实且多样化的视频内容。这对于探索生成模型在无监督数据下学习视频内容的能力和展现多样性具有重要意义。

• 文本引导的视频编辑(Text-guided Video Editing)是一种利用文本描述来指导视频内容编辑的技术。在该任务中,输入为自然语言描述,指明希望对视频进行的修改或调整。系统会分析文本输入,提取相关信息,如物体、动作或场景,并据此指导视频编辑过程。文本引导的视频编辑提供了一种高效且直观的编辑方式,使编辑人员能够通过自然语言表达意图,降低繁琐的逐帧手工编辑需求。

2.3 Datasets and Metrics


2.3.1 Data.


表1

表1. 主要描述级视频数据集的对比。

视频理解任务的演变通常与视频数据集的发展紧密相关,视频生成任务同样如此。在视频生成的早期阶段,任务主要限于在低分辨率、小规模、特定领域的数据集上训练,生成效果相对单一。随着大规模视频-文本配对数据集的出现,诸如通用文本生成视频(T2V)等任务开始受到关注。因此,视频生成的数据集主要可分为描述级数据集和类别级数据集,后续将分别讨论。

• 描述级数据集(Caption-level Datasets)包含与文本描述配对的视频,为训练基于文本描述生成视频的模型提供了关键数据。我们在表1中列举了若干常用的描述级数据集,这些数据集在规模和领域上各不相同。早期的描述级视频数据集主要用于视频-文本检索任务,规模较小(少于12万条)且多集中在特定领域(如电影、动作、烹饪)。随着开放领域的WebVid-10M数据集的提出,文本生成视频(T2V)任务开始快速发展,研究者开始关注开放领域的T2V生成任务。

尽管WebVid-10M已成为T2V任务的主流基准数据集,但它仍存在分辨率低(360P)和水印内容等问题。随后,为了提升通用T2V任务中的视频分辨率与覆盖范围,Panda-70M、VideoFactory和InternVid相继提出更大规模(70M、130M和234M)、高分辨率(720P)的开放领域数据集。为了进一步收集多样化的视频数据集,VidRD在构建视频-文本数据集时结合了静态图像、长视频和短视频等多种来源。

• 类别级数据集(Category-level Datasets)包含按类别分组的视频,每个视频都有相应类别标签,通常用于无条件视频生成或类别条件视频生成任务。我们在表2中总结了常用的类别级视频数据集。值得注意的是,这些数据集中的部分也被用于其他任务。例如,UCF-101、Kinetics和Something-Something是典型的动作识别基准数据集。DAVIS最初用于视频目标分割任务,后来也成为视频编辑领域的常用基准数据集。

在这些数据集中,UCF-101应用最为广泛,常被用于无条件视频生成、基于类别的条件生成和视频预测等任务。该数据集收录了来自YouTube的视频样本,涵盖101个动作类别,包括体育运动、乐器演奏和人际互动等。类似地,Kinetics-400和Kinetics-600数据集规模更大、动作类别更复杂,应用范围与UCF-101相似。而Something-Something数据集则同时具有类别级和描述级标签,特别适合文本条件视频预测任务。

需要注意的是,这些原本用于动作识别的重要数据集普遍规模较小(少于5万条),且多具备单类别、单领域属性(如数字、驾驶场景、第一视角、机器人等),因此难以支持高质量视频生成。近年来,针对视频生成任务专门设计的数据集逐渐出现,通常具备高分辨率(1080P)或长时长等特性。例如,Long Video GAN提出的视频数据集包含66个视频,每段视频平均6504帧,帧率为30fps。Video LDM则收集了RDS数据集,包含683,060段真实驾驶视频,每段视频时长8秒、分辨率1080P。

表2

表2. 现有类别级视频生成与编辑数据集的对比。

2.3.2 Evaluation Metrics.


视频生成的评测指标通常可分为定量指标和定性指标。对于定性评测,已有多项工作采用人工主观评估的方法,其中评估者通常会观看两段或多段由不同竞争模型生成的视频,并进行对比。评估者一般基于视频的真实性、自然连贯性以及与文本描述的一致性(T2V任务)进行投票式评估。然而,人工评测不仅成本高昂,而且存在难以全面反映模型能力的风险。因此,接下来我们将重点讨论图像层面和视频层面的定量评测标准。

• 图像层面指标(Image-level Metrics) 视频由一系列图像帧组成,因此图像层面的评测指标能够在一定程度上反映生成视频帧的质量。
常用的图像层面评测指标包括Fréchet Inception Distance(FID)、峰值信噪比(PSNR)、结构相似性指数(SSIM)以及CLIPSIM。
FID通过比较生成视频帧与真实视频帧的统计特征,评估生成视频的质量。具体而言,该指标先对图像进行归一化预处理,然后利用InceptionV3网络提取真实与生成视频的特征,接着计算特征的均值和协方差矩阵,并据此计算FID分数。
SSIM和PSNR属于像素级指标。SSIM主要评估原图与生成图在亮度、对比度和结构特征方面的相似性,PSNR则衡量峰值信号与均方误差(MSE)之间的比值。这两项指标通常用于评估重建图像帧的质量,常应用于超分辨率与图像修复等任务。CLIPSIM是一种用于衡量图像与文本相关性的指标,基于CLIP模型提取图像与文本特征后计算二者的相似度,该指标常用于文本条件视频生成或编辑任务。

• 视频层面指标(Video-level Metrics) 虽然图像层面指标能够评估单帧视频图像的质量,但它们忽略了视频的时间一致性。而视频层面指标能够更全面地评估视频生成质量。
Fréchet Video Distance(FVD)是基于FID的视频质量评测指标。不同于图像指标使用Inception网络提取单帧特征,FVD利用在Kinetics数据集上预训练的I3D网络从视频片段中提取特征,然后计算均值和协方差矩阵以获得FVD分数。
Kernel Video Distance(KVD)同样基于I3D特征,但区别在于其采用基于核方法的最大均值差异(MMD)来评估生成视频的质量。
Video Inception Score(Video IS)则通过3D卷积网络(C3D)提取特征,计算生成视频的Inception得分,常用于UCF-101数据集的评测。高质量视频通常具有较低的条件概率熵,而多样性则通过所有视频的边缘分布熵的高低进行衡量。
帧一致性CLIP分数(Frame Consistency CLIP Score)常用于视频编辑任务中,用于衡量编辑后视频的时间一致性。该指标通过获取所有视频帧的CLIP图像特征,并计算所有帧对之间的余弦相似度平均值来得出。

3 Video Generation

本节我们将视频生成任务划分为四类,并对每一类进行详细综述:文本生成视频(T2V)生成(第3.1节)、其他条件下的视频生成(第3.2节)、无条件视频生成(第3.3节)以及视频补全(第3.4节)。最后,我们将在第3.5节总结各类方法的实验设置与评测指标,并对不同模型进行全面对比。视频生成任务的分类细节展示于图3中。

3.1 Video Generation with Text Condition


最新研究表明,生成式人工智能与自然语言之间的交互具有极其重要的意义。尽管文本生成图像任务已取得显著进展,文本生成视频(T2V)方法的发展仍处于早期阶段。在本节中,我们将分别介绍基于训练的方法和无需训练的T2V方法。

图3

图3. 视频生成任务分类。视频生成的关键方面包括通用文本生成视频(T2V)生成、特定领域生成、条件控制生成以及视频补全。

3.1.1 Training-based T2V Diffusion Methods.


在前文讨论中,我们简要回顾了一些不依赖扩散模型的T2V方法。接下来,我们将重点介绍当前在T2V任务中最具影响力的扩散模型应用。

• 早期T2V探索
在众多研究中,VDM是首个专门为视频生成设计的视频扩散模型。它将传统图像扩散的U-Net架构扩展为3D U-Net,并采用图像与视频联合训练。其条件采样技术能够生成更高质量、持续时间更长的视频。作为首个基于扩散模型的T2V探索,VDM也适用于无条件生成和视频预测等任务。

与VDM需要配对视频-文本数据集不同,Make-A-Video提出了一种新范式,利用配对图像-文本数据学习视觉-文本关联,并从无监督视频数据中捕捉视频运动信息。这种创新方法降低了对数据收集的依赖,能够生成多样且真实的视频。同时,通过多重超分辨模型和插帧网络,它实现了更高分辨率和帧率的视频生成。

• 时序建模探索
早期方法主要在像素层面应用扩散模型,而MagicVideo率先在潜空间中引入了潜在扩散模型(LDM)用于T2V生成。通过在低维潜空间中使用扩散模型,显著降低了计算复杂度,加快了生成速度。其提出的逐帧轻量适配器对齐了图像与视频的分布,使引入的定向注意力机制更好地建模时序关系,确保视频一致性。

同时,LVDM也采用LDM作为基础,使用层次化框架对潜空间建模。通过掩码采样技术,模型能够生成更长的视频。其还引入了条件潜扰动与无条件引导等技术,缓解自回归生成过程中的性能下降。该训练方案同样适用于视频预测任务,甚至能够生成包含数千帧的长视频。

VideoFactory提出了交换式交叉注意力机制,促进时空模块间的交互,提升了时序关系建模能力。此外,其基于自建的HD-VG-130M数据集训练,能够生成分辨率达1376×768的高分辨率视频。

ModelScope在LDM基础上融合了时空卷积与注意力机制,用于T2V任务。该方法采用混合训练策略,结合了LAION和WebVid数据集,并作为开源基线方法发布。

此前方法多依赖1D卷积或时序注意力来建模时序关系,Latent-Shift则专注于轻量时序建模,受TSM启发,通过在卷积块中在相邻帧之间交换通道以建模时序关系,同时保留原T2I能力。

• 多阶段T2V方法
Imagen Video基于Imagen模型扩展至视频生成,构建了由七个子模型组成的级联视频扩散模型,包括基础视频生成、三阶段空间超分辨率和三阶段时序超分辨率。该三阶段训练流程采用了分类器自由引导、条件增强和v参数化等T2I技术,并通过渐进蒸馏技术加速采样过程,从而高效生成高分辨率视频。

同时,Video LDM构建了三阶段T2V网络,包括关键帧生成、视频插帧与空间超分模块。其在空间层引入了时序注意力层和3D卷积层,用于生成关键帧。随后,通过掩码采样法训练插帧模型,将短视频扩展至更高帧率。最后,通过视频超分模型提升分辨率。

LAVIE也采用三级级联视频扩散模型,依次为基础T2V、时序插帧和视频超分阶段。该方法验证了图像与视频联合微调在生成高质量、富有创意视频方面的有效性。

Show-1融合了像素级和潜空间扩散模型,框架共包含四个阶段:关键帧生成、插帧、低分辨率像素级超分以及潜空间超分。像素级阶段确保文本对齐,潜空间阶段以低成本提升分辨率。

• 噪声先验探索
大多数方法在扩散过程中独立去噪每一帧,而VideoFusion则考虑了帧间内容冗余与时序相关性。具体而言,该方法将扩散过程分解为共享基础噪声和沿时序轴的残差噪声,由两个联合训练的网络共同实现。这种噪声分解机制有助于保证运动一致性,但可能会限制生成多样性。研究还表明,使用T2I模型作为骨干能加快T2V模型的收敛速度,但长时序文本的理解仍有挑战。

PYoCo指出,直接将图像噪声先验扩展到视频会导致T2V任务效果不佳。为此,作者设计了视频专用噪声先验,并在eDiff-I模型基础上微调,提出的噪声先验通过为不同帧采样相关噪声,显著提升T2V性能。

FlexiFilm引入时序调节器与重采样策略,以保持多模态条件与生成视频的一致性,这些策略提升了视频与条件间的一致性,并解决了过曝问题,最长可生成30秒视频。

VidRD提出的“重用与扩散”框架通过重复利用原潜表示并沿用前次扩散过程,迭代生成更多帧,从而实现长视频生成。

• 高效训练
ED-T2V基于LDM,冻结大量参数以降低训练成本,并引入身份注意力和时序交叉注意力以确保时序一致性。该方法在降低训练成本的同时保持了T2V生成性能。

SimDA提出参数高效的T2V训练方法,保持T2I模型参数不变,仅引入轻量的空间适配器传递视觉信息,并使用时序适配器建模低维特征中的时序关系。提出的潜移注意力机制有助于维持视频一致性,其轻量架构不仅加速推理,还适用于视频编辑任务。

为减少3D U-Net的计算资源消耗,GridDiff提出利用2D U-Net进行视频生成,将视频视为网格图像,从而便于将图像生成与编辑技术扩展至视频领域。

• 个性化视频生成
个性化视频生成主要关注根据特定角色或风格生成视频,满足个性化需求。AnimateDiff借鉴LoRA和Dreambooth在个性化T2I中的成功,致力于将其扩展至视频动画生成。该方法旨在训练可适配多样个性化视频的模型,避免反复在视频数据集上训练,具体做法是在T2I基础上加入运动模块学习运动动态,推理时替换个性化T2I权重以实现个性化视频生成。

• 图像条件T2V方法
为解决T2V生成视频中的闪烁与伪影问题,DSDN提出双流扩散模型,分别建模视频内容与运动,从而保持内容与运动的一致性。通过将生成过程解耦为内容与运动两个部分,该方法可生成更平滑的视频。

VideoGen首先使用T2I模型生成图像作为参考,指导视频生成。随后引入高效的级联潜扩散模块,利用基于光流的时序上采样增强时序分辨率。

此外,MicroCinema、PixelDance与EMU-VIDEO均采用图像条件T2V框架,利用外观条件网络或潜空间条件拼接将图像控制条件注入T2V生成过程。参考图像有助于提升视觉保真度、减少伪影,使模型能更专注于学习视频动态。

SVD验证了视频扩散模型的数据扩展能力,收集并标注了数亿条视频-文本数据,并发布了Image2Video视频生成模型,后续多项研究均在该模型基础上展开。

• 复杂动态建模
文本生成视频(T2V)任务在建模复杂动态方面面临挑战,尤其是在动作连贯性方面容易出现断裂。为此,Dysen-VDM提出将文本信息转换为动态场景图的方法。该方法借助大语言模型(LLM)识别输入文本中的关键动作,并按时间顺序排列,同时为场景补充相关的描述性细节。此外,模型利用LLM的上下文学习能力,具备强大的时空建模能力,在复杂动作合成任务中展现出显著优势。

VideoDirGPT同样利用LLM对视频内容生成进行规划。对于给定文本输入,模型通过GPT-4扩展为视频计划,包括场景描述、实体及其布局以及实体在背景中的分布。随后,模型根据这些明确的布局控制生成对应视频,在复杂动态视频生成中的布局与运动控制方面表现出色。

• 特定领域T2V生成
Video-Adapter提出了一种新设定,将预训练的通用T2V模型迁移至特定领域T2V任务。该方法通过将特定领域视频分布分解为预训练噪声与少量训练组件,显著降低了迁移训练的成本,并在Ego4D与Bridge Data场景中的T2V生成任务中验证了有效性。

NUWA-XL采用粗到细的生成范式,支持并行视频生成。其首先利用全局扩散生成关键帧,然后通过局部扩散模型在两帧之间插帧,从而能够生成长达3376帧的长视频,树立了动画生成的基准。该方法专注于卡通视频生成,能生成数分钟的卡通视频。

Text2Performer针对以人为中心的视频,将其分解为外观与动作表示。该方法首先在自然人体视频上进行无监督训练,利用VQVAE潜空间解耦外观与姿态表示,随后使用连续VQdiffuser对连续姿态嵌入进行采样,最后在时空域内对姿态嵌入施加运动感知掩码策略,以增强时序相关性。

• 基于Transformer的T2V生成
Sora的出现极大提升了视频扩散模型的热度,其基于Diffusion Transformer架构,在视频稳定性与一致性方面取得了显著突破。W.A.L.T探索了基于Transformer的视频扩散模型,使用因果编码器将图像与视频压缩至统一空间,以实现扩散模型的联合训练。此外,该方法采用窗口注意力机制,兼顾空间与时空生成建模,同时利用级联超分网络生成高分辨率、稳定的视频。

CMD提出了一种视频扩散模型,将内容与运动分离,首先训练自编码器将视频编码为内容帧与运动潜变量,然后利用Diffusion Transformer架构生成运动向量,从而以较低计算成本生成高分辨率视频。

Snap Video对EDM扩散框架进行改进,用于生成高分辨率视频,将图像视为高帧率视频,以避免图像与视频的模态不匹配。该方法用Transformer架构替代U-Net架构,并将模型规模扩展至数十亿参数,展现出竞争力的生成效果。

GenTron将Diffusion Transformer从类别条件扩展至文本条件,并在条件机制上进行了详尽的实证探索。除此之外,该方法提出运动自由引导策略,用于调节生成视频中的运动信息权重。

图4

图4. 条件视频生成结果:(a) 姿态引导 [156],(b) 深度引导 [264],© 运动引导 [27],(d) 文本引导 [176, 266],(e) 音频引导 [101] 和 (f) 多模态引导 [246]。

3.1.2 Training-free T2V Diffusion Methods.


此前的方法均为基于训练的T2V方法,通常依赖于大规模数据集,如WebVid或其他视频数据集。

一些最新研究致力于通过开发无需训练的T2V方法来降低高昂的训练成本,接下来将进行介绍。

Text2Video-Zero利用预训练的T2I模型Stable Diffusion进行视频生成。为了保持不同帧之间的一致性,该方法在每一帧与第一帧之间引入交叉注意力机制。此外,它通过修改潜编码的采样方式增强运动动态特征。该方法还能结合诸如ControlNet和Instruct-Pix2Pix等条件生成与编辑技术,实现可控视频生成。

DirecT2V和Free-Bloom则引入大语言模型(LLM),基于用户的抽象文本提示生成逐帧描述。LLM导演器将用户输入分解为逐帧描述,以引导视频生成。为保持帧间连贯性,DirecT2V提出了一种新颖的数值映射与双Softmax滤波方法,Free-Bloom则提出了一系列逆过程增强策略,包括联合噪声采样、步长感知注意力迁移和双路径插值。实验表明,这些改进提升了零样本视频生成能力。

针对复杂的时空提示,LVD首先利用LLM生成动态场景布局,再基于这些布局调整扩散模型中的注意力图,实现无需训练的视频生成,从而能够生成复杂的动态视频。

DiffSynth提出了一种迭代潜空间去闪烁框架以及视频去闪烁算法,以减少视频中的闪烁现象,从而生成更连贯的视频。该方法适用于视频风格化和3D渲染等多个领域。

TI2V-Zero提出了一种无需微调的方法,将图像条件控制约束引入T2V生成过程,实现更可控的视频生成。该方法采用“重复-滑动”策略以及DDPM逆推技术,将初始帧作为控制条件注入视频生成过程,有效支持长视频生成。

3.2 Video Generation with other Conditions


前述方法大多涉及文本生成视频任务。本小节将重点介绍基于其他模态(如姿态、音频和深度)条件的视频生成方法。图4展示了条件控制下的视频生成示例。

3.2.1 Pose-guided Video Generation.


Follow Your Pose提出了一种基于姿态和文本控制的视频生成模型。该方法采用两阶段训练策略,分别利用图像-姿态对和无标注视频进行训练。在第一阶段,通过微调T2I模型,使其能够基于图像和姿态对进行姿态控制生成;在第二阶段,利用无标注视频引入时序模块,学习时序建模能力。该两阶段训练方法赋予模型姿态控制与时序建模的能力。

Dreampose构建了双路径CLIP-VAE图像编码器和适配模块,用以替代LDM中的原CLIP文本编码器作为条件组件。给定单张人像图像与姿态序列,该方法能够基于姿态信息生成对应的人体姿态视频。

Dancing Avatar专注于合成舞蹈视频。该方法采用T2I模型以自回归方式生成视频中的每一帧。为了保证视频整体一致性,提出了帧对齐模块,并结合ChatGPT的文本能力,增强相邻帧之间的连贯性。此外,该方法利用OpenPose ControlNet实现高质量人体姿态视频生成。

Disco针对全新的人体舞蹈指代生成任务,结合ControlNet进行背景控制、Grounded-SAM进行前景提取以及OpenPose进行姿态骨架提取。其利用大规模图像数据集进行人体属性预训练,为人体视频生成任务奠定了坚实基础。

Animate Anyone与MagicAnimate利用角色图像作为参考帧,并设计姿态编码器,将序列姿态信息注入图像到视频生成过程,使角色能够按照预定义姿态进行舞蹈动作。两者在仅需小规模训练集的情况下展现出强大的零样本生成能力,其工业应用也充分证明了视频扩散模型的巨大潜力。

PoseAnimate提出了一种零样本的图像到视频角色动画生成框架。该方法引入姿态感知控制模块进行姿态控制,双一致性注意力模块保障时序一致性,以及掩码引导解耦模块(MGDM)提升细节特征感知。通过这些模块,模型展现了零样本姿态动画生成能力。

3.2.2 Motion-guided Video Generation.


MCDiff是首个将运动作为控制条件用于视频合成的方法。该方法输入视频的第一帧以及一段笔划运动序列。首先,利用流补全模型根据稀疏笔划运动控制预测稠密视频运动。随后,模型基于稠密运动图采用自回归方式预测后续帧,从而生成完整视频。

DragNUWA同时引入文本、图像和轨迹信息,从语义、空间和时间维度对视频内容进行细粒度控制。为了解决此前工作中缺乏开放域轨迹控制的问题,作者提出了轨迹采样器(TS),以实现对任意轨迹的开放域控制,同时设计了多尺度融合模块(MF)以在不同粒度上控制轨迹,以及自适应训练策略(AT)以生成沿轨迹一致性的视频。

MotionCtrl提出了两个控制模块,分别用于摄像机运动和物体运动控制。该方法还提出了针对这两类运动的数据集构建方法,并验证了所训练的控制模块能够有效集成到多种视频扩散基础模型中,以提升运动控制能力。

3.2.3 Sound-guided Video Generation.


AADiff提出了结合音频与文本作为条件的视频生成方法。该方法首先分别使用专用编码器对文本与音频进行编码,然后计算文本与音频嵌入之间的相似度,选取相似度最高的文本标记。接着,采用prompt2prompt策略对视频帧进行编辑,从而实现无需额外训练的音频同步视频生成。

Generative Disco专为音乐可视化的文本生成视频任务设计。该系统采用的流程包括大语言模型和文本生成图像模型的组合,以实现音乐可视化视频生成。

TPoS结合了具有可变时间语义和幅度的音频输入,在LDM基础上扩展了音频模态在生成模型中的应用。通过客观评测与用户研究,该方法在广泛使用的音频生成视频基准任务中展现出优越性能。

EMO提出了一种用于人脸说话生成的音频到视频框架,先通过音频编码器提取音频特征,再通过音频注意力机制将其注入扩散模型,从而无需3D人脸信息即可生成高度逼真且富有表现力的动画视频。

3.2.4 Image-guided Video Generation.


LaMD首先训练自编码器以分离视频中的运动信息,随后训练基于扩散的运动生成器生成视频运动。通过这种方法,模型在给定首帧的情况下,能够在运动引导下生成高感知质量的视频。

LFDM利用条件图像和文本实现以人为中心的视频生成。首先训练潜流自编码器以重建视频,在中间步骤中还可使用流预测器预测流动运动。随后,在第二阶段,扩散模型在图像、流动和文本提示的条件下进行训练,以生成连贯的视频。

Generative Dynamics提出了一种在图像空间中建模场景动态的方法。该方法从真实视频序列中提取自然运动的运动轨迹,并针对单张图像,通过频率协调扩散采样过程,预测每个像素在傅里叶域中的长期运动表示,该表示可转化为覆盖整个视频的稠密运动轨迹。结合图像渲染模块,该方法能够将静态图像转换为无缝循环的动态视频,使用户能够与图像中的物体进行真实交互。

3.2.5 Brain-guided Video Generation.


MinD-Video是首个基于连续fMRI数据探索视频生成的工作。该方法首先通过对比学习将MRI数据与图像和文本对齐,随后使用训练好的MRI编码器替代CLIP文本编码器,作为条件输入。此外,方法还设计了时序注意力模块以建模序列动态特征。最终,该模型能够重建具有精确语义、动作和场景动态的视频,其生成效果超越了真实数据,树立了该领域的新基准。

3.2.6 Depth-guided Video Generation.


Make-Your-Video提出了一种新颖的基于文本和深度条件的视频生成方法。该方法在训练过程中利用MiDas提取深度信息,将其作为条件因素引入模型。此外,该方法还引入因果注意力掩码,以促进长视频的合成。与现有最先进方法的对比实验表明,该方法在可控文本生成视频任务中表现优越,具备更好的定量与定性性能。

Animate-A-Story提出了一种创新的视频生成方法,将生成过程划分为两个阶段。第一阶段为运动结构检索,通过给定文本提示从大型视频数据库中检索最相关的视频,并利用离线深度估计算法提取这些视频的深度图,以作为运动引导。第二阶段为结构引导的文本生成视频,通过训练视频生成模型,在深度图提取的运动结构引导下合成视频。该两阶段方法能够根据定制化文本描述生成个性化视频。

3.2.7 Multi-modal guided Video Generation.


VideoComposer专注于基于多模态条件的视频生成,涵盖文本、空间和时间条件。该方法提出了时空条件编码器,能够灵活组合多种条件,包括草图、掩码、深度和运动向量等。通过融合多模态控制,VideoComposer在视频质量和细节表现方面均实现了显著提升。

MM-Diffusion是首个联合音频-视频生成的工作。该方法设计了双支路架构,分别用于视频生成和音频生成。为了保证两条支路输出的一致性,提出了基于随机平移的注意力模块以建立两者间的关联。除了具备无条件音视频生成能力外,MM-Diffusion还表现出较强的视频转音频生成能力。

MovieFactory致力于将扩散模型应用于电影风格视频生成。该方法借助ChatGPT细化用户输入文本,生成完整的电影脚本序列,并设计了音频检索系统,为视频提供配音,从而实现多模态音视频内容的生成。

CoDi提出了一种新型生成模型,能够基于不同输入模态,生成语言、图像、视频或音频等多种输出模态的任意组合。该方法通过构建共享多模态空间,统一输入与输出空间,使得任意模态组合的生成成为可能。

NExT-GPT提出了一个端到端、任意模态对任意模态的大模型系统。该方法集成了大语言模型、模态适配器与多种扩散解码器,支持任意组合的文本、图像、视频和音频输入,并生成相应输出。

VITRON基于大语言模型骨干,融合了图像与视频编码器,增强了模型的多任务泛化能力,能够在同一框架下处理多种任务。特别是在图像生成视频与文本生成视频任务中,该方法均取得了良好效果,展现出大语言模型与视频扩散模型结合的巨大潜力。

3.3 Unconditional Video Generation


本节将深入探讨无条件视频生成。该任务旨在无需额外条件的情况下,生成特定领域的视频。相关研究的核心关注点主要集中在视频表示设计与扩散模型网络架构设计。

• 基于U-Net的生成
作为最早的无条件视频扩散模型之一,同时也是重要的基线方法,VIDM采用双流架构:内容生成流用于生成视频帧内容,运动流用于定义视频运动。通过融合这两个流,模型能够生成一致性良好的视频。此外,作者引入了Positional Group Normalization(PosGN)以提升视频连贯性,并结合隐式运动条件(IMC)与PosGN,探索长视频生成中的一致性问题。

PVDM借鉴LDM的思想,首先训练自编码器将像素映射到低维潜空间,然后在潜空间中应用扩散去噪生成模型合成视频。该方法在降低训练与推理成本的同时,依然能够保持良好的生成质量。

GD-VDM首先生成深度图视频,优先生成场景与布局,暂时忽略细节与纹理。随后,利用生成的深度图作为条件信号,进一步生成视频的细节内容。该方法在细节生成方面表现优越,尤其适用于复杂驾驶场景的视频生成任务。

LEO在生成过程中通过一系列光流图表示运动,从而在本质上实现运动与外观的分离。该方法结合基于光流的图像动画器与潜在运动扩散模型,实现了人体视频生成。图像动画器学习从光流图到运动编码的重建,潜在运动扩散模型则捕捉运动先验以获取运动编码。两者协同作用,有效建模人体视频的相关性。此外,该方法还能扩展至无限长度的人体视频合成与内容保持的视频编辑任务。

• 基于Transformer的生成
受DiT在图像生成中成功应用的启发,VDT与Latte旨在将扩散Transformer扩展至视频生成任务。两者探索了多种时空注意力机制与条件注入模块,同时验证了视频扩散Transformer的可扩展性。

• 基于Mamba的生成
Matten提出了一种结合Mamba与注意力机制的视频扩散模型架构,探索了多种基于Mamba与注意力机制的时空建模变体,验证了Mamba在视频扩散模型中的适用性。DiM则研究了纯Mamba结构的图像与视频扩散模型,证明其具备良好的可扩展性,能够在较低计算成本下生成高质量视频。

3.4 Video Completion


视频补全是视频生成领域中的核心任务之一。在接下来的章节中,我们将分别阐述视频增强与修复以及视频预测的不同方面。

3.4.1 Video Enhancement and Restoration.


CaDM提出了一种新颖的神经增强视频流传输范式,旨在在大幅降低视频传输码率的同时,相较现有方法显著提升视频恢复能力。

该方法主要通过同时降低视频流中的帧分辨率与色彩位深,提升编码器的压缩效率。此外,CaDM通过在去噪扩散恢复过程中引入对编码器设定的分辨率与色彩条件的感知,赋予解码器更强的增强能力。

LDMVFI是首个应用条件潜扩散模型的视频帧插值(VFI)方法。该方法引入了多项创新,包括专用于VFI的自编码网络、高效的自注意力模块以及基于可变形核的帧合成技术,以提升插值性能。

VIDM利用预训练的LDM模型进行视频修补。该方法通过提供掩码,对第一人称视角视频进行修补,利用LDM的图像修复能力生成修补视频。

AVID首先通过设计运动模块与结构引导,实现固定长度视频的修补。随后,借助带有中间帧注意力引导机制的时序多重扩散采样流程,将修补能力扩展至任意长度的视频。

3.4.2 Video Prediction.


Seer专注于文本引导的视频预测任务,采用潜扩散模型(LDM)作为基础架构。该方法通过在自回归框架中引入时空注意力机制,并设计帧序列文本分解模块,有效迁移T2I模型的知识先验至视频预测领域,在多个基准数据集上实现了显著性能提升。

FDM针对长视频预测任务提出了新颖的层次化采样方案,并发布了新的CARLA数据集。相较于自回归方法,该方法不仅更高效,且生成效果更优。

MCVD采用概率条件评分去噪扩散模型,兼具无条件生成与插值功能。其引入的掩码策略能够屏蔽过去或未来所有帧,从而实现对过去或未来帧的预测。此外,该方法还采用自回归方式,以块状生成可变长度视频。

LGC-VD提出了一种局部-全局上下文引导的视频扩散模型,以覆盖多样的感知条件。该方法采用两阶段训练策略,将预测误差视为数据增强的一部分,有效缓解预测误差,并显著提升长视频预测任务中的稳定性。

RVD采用扩散模型,将卷积循环神经网络的上下文向量作为条件生成残差,并将该残差加至确定性下一帧预测中。实验表明,相较于直接预测未来帧,残差预测更为有效。

RaMViD利用3D卷积将图像扩散模型扩展至视频任务,提出新颖的条件训练技术,并通过掩码条件扩展至视频预测、视频修补与视频超分等多种补全任务。

AID首次提出将通用视频扩散模型迁移至特定领域视频预测任务。其提出DQFormer架构,在视频生成过程中注入初始帧、用户指令和多模态大模型的规划预测。此外,该方法还利用轻量适配器高效迁移SVD至机器人与第一视角视频生成任务。

3.5 Benchmark Results


本节将系统性地比较不同视频生成方法在零样本与微调设置下的表现。对于每种设置,我们首先介绍其常用数据集。随后,说明各数据集中使用的详细评测指标。最后,呈现各方法的综合性能对比。

3.5.1 Zero-shot T2V Generation.


表3

• 数据集。通用T2V方法(如Make-A-Video与VideoLDM)通常在MSRVTT和UCF-101数据集上进行零样本评测。MSRVTT是一个视频检索数据集,每段视频片段配有约20条自然语言描述。通常在测试集中选取2990段视频的文本描述作为提示词,生成对应视频。UCF-101是一个动作识别数据集,包含101个动作类别。在T2V模型中,通常基于类别名称或手工设置的提示词生成对应视频。

• 评测指标。在零样本评测中,常用FVD与FID指标对MSRVTT数据集上的视频质量进行评估,CLIPSIM用于衡量文本与视频的对齐度。对于UCF-101数据集,典型评测指标包括Inception Score、FVD与FID,用于评估生成视频及其帧的质量。

• 结果对比。在表3中,我们展示了当前主流通用T2V方法在MSRVTT与UCF-101上的零样本性能,同时列出了模型参数量、训练数据、额外依赖以及生成分辨率等信息。可以观察到,依赖ChatGPT或其他输入条件的方法相较其他方法表现出显著优势,且利用额外数据通常能够进一步提升性能。

3.5.2 Finetuned Video Generation.


表4

表4. UCF-101、Taichi-HD与Time-lapse数据集上的微调视频生成结果。表中报告了16帧视频片段的FVD、IS与KVD评测指标,同时列出了每项评测结果对应的视频帧分辨率。

• 数据集。微调视频生成方法指在特定数据集上微调后进行视频生成,通常包括无条件视频生成和类别条件视频生成。该类方法主要集中在三个常用数据集:UCF-101、Taichi-HD与Time-lapse。UCF-101聚焦于人体运动,Taichi-HD主要包含太极拳视频,Time-lapse则以天空延时视频为主。此外,还有其他基准数据集,但我们选择这三个作为对比,因为它们使用最广泛。

• 评测指标。在微调视频生成任务的评测中,UCF-101常用指标包括Inception Score(IS)与Fréchet Video Distance(FVD)。Time-lapse与Taichi-HD数据集则通常使用FVD与Kernel Video Distance(KVD)作为评测指标。

• 结果对比。在表4中,我们展示了当前主流方法在这些基准数据集上微调后的性能表现,同时提供了方法类型、生成分辨率以及额外依赖等详细信息。可以明显看到,基于扩散模型的方法相比传统的GAN与自回归Transformer方法具有显著优势。此外,当方法结合大规模预训练或类别条件时,生成性能通常进一步提升。

4 Video Editing

随着扩散模型的发展,视频编辑领域的研究数量呈现指数级增长。许多研究达成共识,视频编辑任务应满足以下三个标准:(1) 保真度:每一帧内容应与原视频对应帧保持一致;(2) 对齐度:输出视频应与输入控制信息对齐;(3) 质量:生成视频应具备良好的时序一致性与高画质。虽然预训练的图像扩散模型可通过逐帧处理方式用于视频编辑,但缺乏跨帧的语义一致性,使得逐帧编辑难以应用于视频场景,从而使视频编辑成为一项具有挑战性的任务。在本节中,我们将视频编辑分为三类:文本引导视频编辑(第4.1节)、模态引导视频编辑(第4.2节)与特定领域视频编辑(第4.3节)。视频编辑任务的分类详情如图5所示。

图5

图5. 视频编辑任务分类。视频编辑的关键方面包括通用文本引导视频编辑、模态引导视频编辑与特定领域视频编辑。

4.1 Text-guided Video Editing


在文本引导视频编辑中,用户输入一段视频和文本提示,文本描述了期望编辑后视频的属性。然而,相较于图像编辑,文本引导视频编辑面临帧一致性与时序建模的新挑战。总体而言,文本引导视频编辑主要有两种方法:(1) 在大规模文本-视频对数据集上训练T2V扩散模型;(2) 基于预训练T2I扩散模型进行视频编辑。由于大规模文本-视频数据集难以获取,且T2V模型训练成本高昂,第二种方法受到更多关注。为了捕捉视频中的运动信息,各类方法在T2I模型中引入了时序模块。然而,将T2I模型扩展至视频编辑的方法通常面临两个核心问题:一是时序不一致,表现为视频在帧间存在明显闪烁;二是语义不符,即生成视频未能根据文本提示进行准确修改。已有多项研究从不同角度对这些问题进行探索与解决。

4.1.1 Training-based Methods.


基于训练的方法指在大规模视频-文本数据集上进行训练,从而使模型具备通用视频编辑能力。

GEN-1提出了一种结构与内容感知模型,能够全面控制时序一致性、内容一致性与结构一致性。该方法在预训练T2I模型中引入时序层,并在图像与视频上联合训练,从而实现对时序一致性的实时控制。

Dreamix提出了两项创新:首先从原视频的低分辨率版本开始生成,其次在原视频上微调模型。此外,方法还提出结合全时序注意力与时序注意力遮罩的混合微调策略,以增强运动可编辑性。

TCVE设计了一个空间-时序建模单元,用于连接时序U-Net与预训练T2I U-Net,有效捕捉输入视频的时序连贯性。

Control-A-Video基于预训练T2I扩散模型,融合了时空自注意力模块与可训练的时序层,同时提出首帧条件策略,使其可通过自回归方式生成任意长度视频。

MagicEdit将内容、结构与运动的学习过程在不同框架中分离,兼顾高保真度与时序一致性。

MagicProp通过分离外观编辑与运动传播提升视频编辑效果。该方法先对参考帧进行编辑,然后基于前一帧、目标深度与参考外观,利用扩散模型生成每一帧。

与此前方法将光流作为硬约束不同,FlowVid考虑了光流估计中的潜在不准确性,因此在时序光流条件之外,引入深度图作为额外空间条件,从而实现一致性与灵活性兼具的视频编辑。

4.1.2 Training-free Methods.


无需训练的方法指利用预训练的T2I或T2V模型,在零样本条件下适配视频编辑任务。与基于训练的方法相比,无需训练的方法无需高昂的训练成本,但也存在一些潜在缺陷:首先,零样本编辑的视频可能出现时空扭曲和不一致问题;此外,部分使用T2V模型的方法仍可能产生较高的推理或预处理开销。以下简要梳理针对这些问题的技术手段。

TokenFlow通过在扩散特征空间中强制保持一致性,实现视频编辑中的时序一致性。具体而言,该方法采样关键帧,联合编辑这些帧,并基于原视频特征中的对应关系,将特征传播至其他帧,从而显式维持一致性及细粒度共享特征表示。

VidEdit结合基于atlas的方法与预训练T2I模型,不仅实现高时序一致性,还提供视频内容外观的对象级控制。该方法将视频解构为分层神经atlas,形成语义统一的内容表示,然后在atlas空间中利用预训练图像扩散模型进行零样本编辑,同时编码时序外观与空间位置,保持结构一致性。

Rerender-A-Video通过层次化跨帧约束保障时序一致性。该方法使用光流施加稠密的跨帧约束,利用上一帧作为低层次参考,第一帧作为锚点,确保风格、形状、纹理和颜色的一致性。

针对atlas学习与每视频微调成本高的问题,FateZero在逆向过程的每个阶段存储完整的注意力图,保留丰富的运动与结构信息,同时引入时空模块以增强视觉一致性。

Vid2Vid-Zero利用null-text inversion模块对齐文本与视频,结合空间正则化模块保证视频保真度,并通过跨帧建模模块提升时序一致性。类似FateZero,该方法也引入时空注意力模块。

Pix2Video首先利用预训练的结构引导T2I模型对锚帧进行文本编辑,确保生成图像忠于编辑提示。随后通过自注意力特征注入,将编辑效果逐帧向未来传播,保持时序一致性。

InFusion包含两个关键模块。首先,在去噪过程中集成解码器层残差块特征与注意力特征,展现零样本编辑能力;其次,通过交叉注意力图中的掩码提取,融合已编辑与未编辑概念的注意力,确保一致性。

ControlVideo直接继承ControlNet权重,扩展自注意力机制以实现完整的跨帧交互,从而提升视频编辑质量与一致性。为处理长视频编辑,该方法引入层次化采样器,将长视频划分为短片段,并通过关键帧对条件保持全局一致性。

EVE提出两种策略以增强时序一致性:一是利用深度图引导以定位空间布局与运动轨迹,二是引入帧对齐注意力机制,强制模型同时关注前后帧。

MeDM利用显式光流编码视频帧间像素对应关系,确保时序一致性。该方法还通过光流引导的时序对应关系,迭代对齐视频中的噪声像素,进一步稳定视频效果。

Gen-L-Video针对长视频编辑问题,将长视频视为多个重叠的短视频片段。通过引入时序协同去噪(Temporal Co-Denoising)方法,该方法能够将现有短视频编辑模型扩展至处理上百帧的视频,同时保持时序一致性。

FLATTEN将光流融入扩散模型的注意力机制中。其提出的光流引导注意力机制(Flow-guided Attention)使得不同帧中的图像块能够在相同光流路径下对齐,从而实现跨帧的互相关注,显著提升视频编辑中的一致性。

4.1.3 One-shot-tuned Methods.


单视频微调方法指对预训练T2I模型进行微调,仅使用单个视频实例即可生成具有相似运动或内容的视频。虽然这类方法需要额外的训练开销,但相比无需训练的方法,其编辑灵活性更高。

SinFusion首创基于扩散的一次性微调方法,仅需少量帧即可从单个输入视频中学习运动,其骨干网络为全卷积DDPM,支持任意尺寸图像的生成。

SAVE通过微调参数空间的谱偏移,学习输入视频中的运动概念与内容信息,同时提出谱偏移正则化器以限制参数变动范围。

Edit-A-Video包含两个阶段:第一阶段将预训练T2I模型扩展为T2V模型,并使用单个<文本,视频>对进行微调,第二阶段执行常规扩散与去噪过程。针对编辑视频中的背景不一致问题,作者提出稀疏因果混合方法,自动生成掩码以近似编辑区域。

Tune-A-Video引入稀疏时空注意力机制,仅关注首帧和前几帧,同时采用高效微调策略,仅更新注意力块中的投影矩阵。此外,该方法在推理时利用输入视频中的结构引导,以缓解运动一致性不足的问题。

Video-P2P不同于传统T2I模型,其将模型改造为文本到集合(T2S)模型,通过用帧注意力替代自注意力,使模型能生成一组语义一致的图像。进一步,提出解耦引导策略,以提升对提示词变化的鲁棒性。

ControlVideo2主要关注扩散模型和ControlNet中的注意力模块改进。其将原始空间自注意力转换为关键帧注意力,使所有帧对齐至选定关键帧,同时引入时序注意力模块,以保持一致性。

Shape-aware TLVE基于T2I模型,通过传播输入帧与编辑关键帧之间的形变场至所有帧,有效处理形状变化。

EI2提出两项关键创新:一是位移约束时序注意力模块(STAM),限制时序注意力模块中新引入的参数,有效解决语义不一致问题;二是细粗粒度帧注意力模块(FFAM),沿空间维度采样以利用时间维度信息,提升时序一致性。结合这些技术,构建了T2V扩散模型。

StableVideo在T2I模型基础上设计帧间传播机制与聚合网络,通过从关键帧生成编辑atlas,实现时空一致性。

4.2 Other Modality-guided Video Editing


前述方法大多专注于文本引导的视频编辑任务。本小节将重点介绍由其他模态(如指令和音频)引导的视频编辑方法。

4.2.1 Instruct-guided Video Editing.


指令引导的视频编辑旨在基于输入视频与指令生成编辑视频。由于缺乏视频-指令数据集,InstructVid2Vid利用ChatGPT、BLIP与Tune-A-Video联合生成输入视频、指令与编辑视频三元组,成本相对较低。在训练过程中,该方法提出帧差损失(Frame Difference Loss),引导模型生成时序一致的视频帧。CSD首先使用Stein变分梯度下降(SVGD),让多个样本共享扩散模型中提取的知识,以实现跨样本一致性。随后,方法将协作得分蒸馏(CSD)与Instruct-Pix2Pix结合,实现基于指令的多图像一致性编辑。VIDiff基于多模态指令引导的编辑扩散模型,统一了视频编辑、视频重着色、视频目标分割和低级别任务,展示了视频扩散模型的巨大潜力,以及将统一架构应用于多任务场景的可行性。Fairy通过采样锚帧,将锚帧中提取的特征传播至与其相似的帧,从而在不同帧组间实现并行处理。该方法不仅通过共享全局特征保证时序一致性,还有效降低了内存需求。

4.2.2 Sound-guided Video Editing.


音频引导的视频编辑旨在使目标区域的视觉变化与音频保持一致。为实现这一目标,Soundini提出局部音频引导与光流引导的扩散采样机制。具体而言,音频编码器将音频潜在表示与图像潜在表示在语义上对齐,从而实现音画一致性。基于扩散模型,SDVE引入特征拼接机制以保持时序一致性,同时在残差层中持续输入频谱特征嵌入与噪声信号,使网络在推理过程中受语音条件引导。

4.2.3 Motion-guided Video Editing.


受视频编码过程启发,VideoControlNet结合扩散模型与ControlNet。该方法将首帧设为I帧,其余帧划分为图像组(GoP),每个GoP的最后一帧设为P帧,其余为B帧。对于输入视频,模型首先利用扩散模型与ControlNet生成I帧,随后通过运动引导P帧生成模块(MgPG)结合光流信息生成P帧,最后基于参考的I/P帧与运动信息插值生成B帧,从而避免频繁调用耗时的扩散模型。MotionEditor采用双分支架构(重建分支与编辑分支),结合ControlNet,通过强制时序运动对应关系,实现高保真编辑与时序一致性。

4.2.4 Multi-Modal Video Editing.


Make-A-Protagonist提出了一种多模态条件视频编辑框架,专注于更换视频主角。该方法利用BLIP-2进行视频字幕生成,结合CLIP视觉模型与DALLE-2 Prior编码视觉与文本线索,同时采用ControlNet确保视频一致性。在推理阶段,方法通过掩码引导的去噪采样技术融合各模块,实现无需标注的视频编辑。

CCEdit将视频结构与外观解耦,实现可控且富有创意的视频编辑。该方法利用ControlNet保持视频结构,同时通过文本提示、个性化模型权重与自定义中心帧编辑视频外观。

DreamVideo将个性化视频编辑任务分为两个阶段:主体学习与运动学习。其利用轻量适配器通过纹理反演捕捉给定主体的外观,并使用另一适配器建模目标运动模式,从而降低优化复杂度,并实现更灵活的个性化定制。

4.3 Domain-specific Video Editing


本小节将简要概述若干针对特定领域的视频编辑技术。首先在第4.3.1节介绍视频重着色与视频风格迁移方法,随后在第4.3.2节介绍专为人体相关视频设计的视频编辑方法。

4.3.1 Recolor & Restyle.


• Recolor
视频上色旨在为灰度帧推断真实且一致的色彩,需平衡时序一致性、空间一致性、语义一致性、色彩丰富性与色彩真实性。ColorDiffuser基于预训练T2I模型,提出颜色传播注意力机制,替代传统光流方法,并引入交替采样策略以捕捉相邻帧之间的时空关系。

• Restyle
Style-A-Video设计了一种组合控制方式:文本用于风格引导,视频帧用于内容引导,注意力图用于细节引导。该方法具备零样本能力,无需针对每个视频进行额外训练或微调。

Diffutoon通过将卡通渲染任务分解为四个子任务:风格化、一致性增强、结构引导与上色,完成卡通化视频生成。方法使用Stable Diffusion进行风格化处理,ControlNet则用于基于轮廓的生成与视频上色。

4.3.2 Human Video Editing.


Diffusion Video Autoencoders提出了一种视频扩散自编码器,从输入视频中提取时间不变特征(身份)与每帧的时间变化特征(运动与背景),并进一步操控该时间不变特征以实现目标属性编辑,从而兼具时序一致性与高效计算能力。

InstructVideo2Avatar针对说话人头视频,输入视频与编辑指令,输出编辑后的3D神经头像视频。该方法联合使用图像编辑方法InstructPix2Pix、视频风格化方法EbSynth与逼真的3D神经头像生成方法INSTA。

TGDM采用零样本CLIP引导模型,实现灵活的情感控制,并提出基于多条件扩散模型的流程,以同时实现复杂的纹理与身份迁移。

5 Video Understanding

图6

除了在视频生成与视频编辑等生成任务中的应用,扩散模型也被探索用于视频理解任务,如视频时序分割、视频异常检测、文本-视频检索等。本节将对这些应用进行介绍。视频理解任务的分类详情如图6所示。

• 时序动作检测与分割
受DiffusionDet启发,DiffTAD将扩散模型应用于时序动作检测任务,通过扩散长视频中的真实提议区间并学习去噪过程,利用DETR架构中的时间定位查询模块,实现了在ActivityNet与THUMOS基准数据集上的SOTA表现。

DiffAct针对时序动作分割任务,采用类似思路,基于输入视频特征,迭代地从随机噪声中生成动作片段。该方法在GTEA、50Salads与Breakfast等常用数据集上验证了有效性。

• 视频异常检测
Diff-VAD与CMR专注于无监督视频异常检测,利用扩散模型的重建能力识别异常视频,因为高重建误差通常意味着异常。两项方法在两个大规模基准数据集上均显著优于传统方法。

MoCoDAD聚焦于基于骨架的视频异常检测,扩散模型生成多样且合理的未来动作,通过统计未来模式,若生成动作与真实未来趋势偏离则判定异常。

• 文本-视频检索
DiffusionRet将检索问题建模为联合分布生成过程,从噪声中生成(candidate, query)对,并联合使用生成损失与对比损失,融合生成与判别优势,在开放领域检索中展现出强泛化能力。

MomentDiff与DiffusionVMR将视频时刻检索问题转化为时间区间去噪任务,通过学习将随机位置映射回实际区间,有效提升基于文本的视频片段定位精度。

• 视频字幕生成
RSFD关注视频字幕生成中的长尾问题,提出频率扩散语义增强方法,通过持续识别低频词语的语言表示,提升模型对低频语义的理解能力,增强字幕生成质量。

• 视频目标分割
Pix2Seq-D将全景分割重新定义为离散数据生成问题,基于模拟比特的扩散模型生成全景掩码,同时融合前帧预测,实现自动学习目标实例跟踪与视频目标分割。

• 视频姿态估计
DiffPose将视频人体姿态估计建模为条件热图生成任务,利用时空特征学习模块聚合多帧特征,并通过多尺度特征交互机制提升关键点表示质量。

• 音频-视频分离
DAVIS使用生成式扩散模型解决音频-视觉声源分离任务,从高斯噪声中生成分离幅度谱,条件输入为音频混合信号与视觉内容。

• 动作识别
DDA利用扩散式数据增强生成高质量、多样化的人体动作序列,有效提升动作识别模型的自然性与多样性表现。

GenRec探索利用视频扩散模型的时空先验进行识别任务,将预训练SVD作为骨干网络,在生成模型基础上添加分类头,实现生成与分类双重功能,实验表明两者可互补。

• 视频配乐生成
LORIS专注于生成与视觉节奏线索同步的音乐配乐,采用潜在条件扩散概率模型进行波形合成,并引入上下文感知条件编码器处理时序信息,支持长时长、高节奏一致性的配乐生成,适用于多种运动场景。

• 视频流程规划
PDPP基于扩散模型表示整个中间动作序列分布,将流程规划转化为采样问题,利用扩散式U-Net模型在初末状态条件引导下精确生成中间动作序列,提升动作序列学习与采样质量。

6 Challenges and Future Trends

图7

图7. 挑战与未来趋势。(a) 高质量视频-文本数据集匮乏;(b) 物理真实感不足;© 长视频一致性失效;(d) 缺乏可靠评测与基准。

尽管基于扩散的方法在视频生成、编辑与理解领域取得了显著进展,但仍存在诸多值得进一步探索的问题。本节总结了当前主要挑战与潜在未来趋势,并在图7中展示了相关定性结果,以直观呈现当前局限性与未来方向。

• 大规模视频-文本数据集的构建
文本生成图像(T2I)的突破,很大程度上得益于数十亿高质量(文本,图像)对数据集的支撑。然而,目前T2V任务常用数据集规模较小,构建同等规模的视频数据集面临诸多困难。例如,WebVid数据集仅包含1000万样本,且分辨率低(360P),水印问题严重,视觉质量有限。

尽管已有多项研究尝试扩大数据规模与提升质量,但数据集规模、标注精度与视频质量仍需进一步提升。SVD与Sora的成功表明扩展数据集的有效性,但由于其采用私有数据集,高质量开源数据集对于视频生成研究仍十分关键。

• 物理真实感与长视频生成
即使是最先进的视频扩散生成模型(如Sora),在复杂场景下仍存在物理真实感不足的问题,例如椅子刚性结构的错误模拟、物体物理交互不自然等。此外,大多数现有视频生成模型生成的视频时长仍不足10秒。常用的自回归方法虽然可扩展视频长度,但易产生误差累积,导致后续帧质量下降;多阶段粗到细方法则复杂且耗时。

未来研究应致力于提升视频生成中的物理真实性复杂场景模拟能力,以及长视频生成中的一致性与稳定性

• 高效训练与推理
T2V模型的训练成本极高,部分任务需耗费数百块GPU。尽管已有方法尝试降低训练成本,但大规模数据与高时序复杂度仍是核心瓶颈。Sora的兴起进一步凸显了从零开始训练视频生成模型的高昂开销。未来亟需研究视频表示压缩时空高效建模训练推理加速等方向。

• 基准与评测方法
现有开放域视频生成的评测基准与指标仍较有限。T2V任务缺少真实参考视频,现有指标如FVD与IS主要衡量生成视频与真实视频的分布差异,难以全面评估生成视频的质量。目前仍高度依赖人工AB测试与主观评分,费时且存在主观性偏差。

未来可探索更针对性的视频生成评测基准与指标,以全面反映视频生成质量。

• 更强可控性的视频编辑
伴随视频生成的发展,视频编辑任务也不断演进。尽管现有视频编辑方法在风格迁移等任务中取得了可观成果,但在物体替换等复杂任务中仍常出现时序不一致问题。大部分方法依赖详细文本描述,导致可控性与泛化能力受限。同时,多目标编辑、运动编辑与长视频编辑仍存在明显瓶颈。

随着视频生成基础模型的发展,未来趋势将朝向具备更强可控性、泛化性与多模态能力的视频生成与编辑模型。

7 Conclusion

本综述深入探讨了AIGC(AI生成内容)时代下视频扩散模型的最新进展。据我们所知,这是该领域的首篇系统性综述。文中全面介绍了扩散过程的基本原理、主流基准数据集及常用评测指标。在此基础上,我们系统性梳理并评述了100余篇关于视频生成、视频编辑与视频理解的相关研究工作,并根据技术视角与研究目标对其进行了细致分类。此外,在实验部分,我们详细描述了各类方法的实验设置,并在多个基准数据集上进行了公平、严谨的对比分析。最后,我们总结并提出了未来视频扩散模型领域的若干关键研究方向。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐