开源时间:2025年4月19日
论文地址:https://arxiv.org/pdf/2503.20314
项目地址:https://github.com/Wan-Video/Wan2.1
在这里插入图片描述
当前wan2.1的论文涉及部分比较多,故此本博文仅Wan-video模型设计相关部分进行解读,后续会完成其他模块的解读。
第一篇文章为:wan2.1 论文精读一 | 导论与数据处理

第二篇文章为:wan2.1 论文精读二 | 模型设计与加速

Wan于主流扩散变换器范式构建,通过一系列创新实现生成能力的显著提升,包括我们自主研发的空间-时间变分自编码器(VAE)\可扩展预训练策略、大规模数据整合以及自动化评估指标。这些创新共同提升了模型的性能与通用性。具体而言,Wan具备四大核心优势:

  • 性能领先:Wan的14B(140亿)参数模型 基于包含数十亿图像和视频的海量数据集训练,完美诠释了scale law。
  • 功能全面:Wan提供1.3B和14B两种版本,均支持480p分辨率,分别满足不同场景的效率与效果需求。其支持图像转视频、指令引导视频编辑、个人视频生成等下游应用,最多可处理八项任务。值得一提的是,Wan是首个能生成中英文图文的模型,极大提升了其实际应用价值。
  • 消费级能效表现1.3B模型展现出卓越的资源利用效率,仅需8.19GB显存即可运行,兼容各类消费级GPU。其性能表现远超同类开源大模型,在文本转视频领域展现出显著优势。
  • 开源理念Wan系列全系列源代码及所有模型.

本博文一共介绍了wan2.1模型在图生视频(含首尾帧、视频续写)、视频编辑(VACE架构)、文生图、个性化视频(参考id生成视频,类vace架构)、摄像机运动控制、实时视频生成(世界模型)、音频生成领域的应用。

关于图生视频领域,主要基于时序条件图像编码、mask控制。具体是将条件图像 I与沿时间轴填充零的帧连接起来,这些引导帧通过 Wan- VAE 压缩为条件潜在 zc,最终chanel为c引入了一个二进制掩码 M ,其中 1 表示保留的帧,0 表示要生成的帧。最终实现基于mask 0,1标识位控制首尾帧、视频续写、首帧生视频等任务。对于数据集选择,针对每一个任务有不同的标准。

关于视频编辑,技术介绍没有VACE论文详细,具体可以参考论文阅读:VACE: All-in-One Video Creation and Editing_vace论文-CSDN博客  。主要是描述视频条件单元(VCU=[T;F;M]),T 是一个文本提示、F 是上下文视频帧序列(参考帧或首尾帧)、M是掩码序列。最后描述数据的构造过程。

关于文生图,只是描述wan模型具备这个能力,但训练数据集比视频数据集大近十倍,没有指标对比。预见能力在正常水准。

关于个性化视频,即参考人物生成视频。应该是基于vace架构实现,主要是介绍数据生成过程。其中三个关键点。1、若视频中某帧检测到多张人脸,或超过10%的帧数未检测到人脸,则该视频将被舍弃;2、计算连续帧间的ArcFace相似度,剔除相似度较低的视频;3、通过人脸特征点检测辅助训练时的画布对齐。最后说明可以使用Instant-ID提升人脸多样性。

关于相机运动控制,修改了网络结果,支持对VGG-SFM输出的相机规矩进行编码,最终控制生成视频的机位控制;

关于实时视频生成,先是提到流式生成架构(固定window,实时入队与出队),然后基于LCM方法进行步数蒸馏,最后进行模型int8量化。最终在单个4090 GPU上也能实现8帧/秒的实时性能,没有提到分辨率,预计为480p;

最后提到了视频配乐,要求输入音频+视频,最终生成与视频动作节奏精准匹配的音频,在效果上时超过了MMAudio。这里的技术点在于,针对音频数据跳过了mel频谱图(cnn提取特征),设计了针对音频数据的1d-vae。

1、图生视频

图像到视频(I2V)生成任务的核心目标,是根据文本提示从静态输入图像中合成动态视频序列。该方法通过将输出锚定在特定初始帧,显著提升了视频生成的可控性,因此在学界引发广泛关注。现有方法如I2VGen-XL(张等人,2023c)、SVD(布拉特曼等人,2023)和CogVideo(杨等人,2025b),通过将条件潜在表示与噪声潜在表示进行通道级拼接,将T2V框架拓展至I2V领域。基于这一范式,我们的Wan-I2V模型采用了类似策略,充分利用基础T2V模型中嵌入的强先验知识,实现了高质量的I2V生成。

1.1 模型设计

条件图像 I与沿时间轴填充零的帧连接起来,这些引导帧通过 Wan- VAE 压缩为条件潜在 zc,最终chanel为c。此外,引入了一个二进制掩码 M ,其中 1 表示保留的帧,0 表示要生成的帧。掩码 M 的空间尺寸与条件潜在 zc一致,最终chanel为s。噪声潜在 zt、条件潜在 zc 和重新排列的掩码 m 沿通道轴连接,然后通过 Wan 的 DiT 模型。由于 I2V DiT 模型的输入通道数比 T2V 更多(即 2 × c+s 比 c),我们使用了一个额外的投影层,该层初始化为零值。此外,还利用 CLIP(Radford 等,2021)的图像编码器从条件图像中提取特征表示,并通过三层多层感知机(MLP)投影提取的特征,该感知机作为全局上下文发挥作用。生成的全局上下文随后通过解耦交叉注意力注入到 DiT 模型中。

在实际应用中,图18所示的上述方法可扩展应用于其他可控生成任务,例如首尾帧转换和视频续写。掩码机制不仅明确界定了输入条件,还具体指定了需要生成的帧。为优化掩码策略的效能,将图像到视频生成、视频续写、首尾帧转换及随机帧插值等多任务整合到统一框架中。具体而言,我们为I2V模型采用了以下训练范式:

在联合训练阶段,对掩膜引导模型进行统一的预训练,涵盖这些多样化任务。该阶段有助于模型根据输入内容辨别哪些位置应保留、哪些应生成。随后,在微调阶段,我们专注于优化模型在每个单独任务上的性能。

1.2 数据集

联合训练阶段,采用与T2V任务相同的训练数据集。该阶段旨在为模型奠定基础能力,使其能够基于参考图像生成动态内容。

微调阶段,针对每个任务的独特特性精心设计了任务专用数据集。

图生视频数据集  早期实验发现,当训练数据中的首帧画面与视频内容存在显著差异时,模型难以掌握稳定的图像驱动视频生成能力。因此,训练数据中首帧与视频内容的差异越小,对模型训练越有利。因此,基于SigLIP特征计算首帧与视频内容的差异值:具体而言,通过计算首帧特征与后续帧特征均值之间的余弦相似度,最终仅保留相似度超过预设阈值的视频片段。

视频续写数据集  同样地,研究结果也表明,基于时间一致性视频的训练可显著提升视频延续任务的表现为量化视频初始段与末段(即前1.5秒与后3.5秒)之间的一致性,我们计算了其各自SigLIP特征的余弦相似度,随后利用计算所得的相似度评分对所需训练数据集进行筛选与选择。

首尾帧过渡数据集  与I2V任务更强调image过渡任务中初始帧与最终帧之间的平滑过渡。但,我们在训练数据集中增加了首尾帧间存在显著过渡的数据样本比例

1.3 评估

I2V模型的训练过程包含首帧末帧转换和视频续写两个阶段。在初始预训练阶段,我们沿用了与T2V任务相同的数据集。由于该阶段涉及的帧数略多,我们特意省略了图像编码器分支,这是为了确保文本输入与视觉输出保持高度一致性,从而让模型能精准捕捉文本语义的微妙差异。当预训练阶段完成并趋于稳定后,模型已展现出生成图像、视频续写等多项能力。这充分证明了预训练过程在构建空间与时间理解能力方面具有显著优势。

实验表明,仅依赖帧级信息不足以在特定任务中实现最优性能,例如图像到视频生成、视频续写以及首尾帧转换。这一发现表明,虽然预训练模型为基于帧的视频生成提供了基础框架,但其缺乏必要的上下文和语义深度,无法完全捕捉动态视频序列的时间一致性,尤其是在条件帧数量极为有限的情况下。为解决这一局限,在 SFT 阶段,引入了图像编码器,通过解耦交叉注意力机制提取图像特征,为模型提供全局上下文信息以增强其能力。基于480p和720p分辨率的两个预训练检查点进行了实验,涵盖图像到视频生成、视频续写和首尾帧转换任务的训练。与T2V模型的人类评估类似,对标了最先进的技术来评估I2V模型,重点关注视觉质量、运动质量及匹配度等关键方面。表7所示结果表明,我们的模型在所有评估维度上均表现优异。图19和图20展示了I2V模型的额外可视化结果,清晰地展示了其在将图像动画为高质量视频方面的卓越性能。

2、视频编辑

文本到图像和文本到视频生成的基础预训练模型,为下游任务和应用的扩展提供了有力支持,包括图像重绘、视频编辑、可控生成、帧参考生成、高效生成以及ID参考视频合成。为提升任务灵活性并减少部署多个模型带来的开销,研究者们日益关注开发统一模型架构,例如ACE和OmniGen。这些统一架构旨在将多样化任务整合到单一图像模型中,从而在保持易用性的同时,促进各类应用工作流的创建。在视频领域,时空维度的协同变换表明,利用统一模型可为视频创作释放无限可能。

在我们之前的工作中 VACE(2025),介绍了一个统一的框架,用于可控的视频生成和编辑,解决了诸如参考到视频生成、视频到视频编辑以及掩码视频到视频编辑等任务。基于Wan的预训练模型,将多种模态,包括图像和视频用于编辑、参考和掩码,整合到视频条件单元(VCU)中,以支持多样化的输入格式。 VACE 采用了一种解耦策略,使模型能够识别哪些方面应该保留,哪些方面应该修改。

本研究通过明确区分编辑任务与参考任务中的视觉模态信息,提出了两种训练模式。第一种模式以VCU视频数据为输入,对整个Wan模型进行全参数微调训练。第二种模式采用可插拔的上下文适配器结构,通过Res-Tuning(2023)方式实现:无需调整基础模型权重即可支持可控任务与编辑任务,同时提升整体模型规模。依托Wan强大的视频生成能力,该创新框架在定量与定性评估中均展现出显著优势。该框架支持基础任务的组合扩展,例如实现长视频重渲染等场景。因此,该框架为视频合成提供了灵活高效的解决方案,为用户驱动的视频内容创作与编辑开辟了新路径。

2.1 模型设计

视频条件单元(VCU)在 VACE 中被提出,它作为一个输入范例,将不同的输入条件统一为文本输入、帧序列和掩码序列。它可被形式化表示如下

其中 T 是一个文本提示,而 F 是上下文视频帧序列 {u1,u2 ,...,un} ,M是掩码序列 {m1,m2 ,...,mn}。这里,u 在 RGB 空间中,归一化到 [−1,1]m 是二进制的,其中 “1” 和 “0” 分别表示编辑或不编辑的位置F 和 M 在空间尺寸 h × w 和时间尺寸 n 上都对齐。在这种范式下,我们采用之前描述的 Wan- VAE 将输入视频帧和掩码信息转换为上下文标记。如图 21 (a) 所示,这些上下文标记随后与噪声视频标记结合,以微调 Wan 模型。此外,我们提出了一种上下文适配器调优策略,允许上下文标记通过上下文块并重新整合到原始 DiT 块中。这种方法促进了上下文信息的无缝集成,增强了模型处理多样化编辑和生成任务的能力,而无需改变基础模型的权重。

在token化之前,像素级别的上下文帧和掩码使用概念解耦策略进行预处理,然后编码到潜在空间中。如图21(b)所示,概念解耦策略明确地将不同模态和分布的数据基于掩码分离为两个形状相同的帧序列:Fc = F × M 和 Fk = F ×(1 − M),其中 Fc 指的是包含所有待修改像素的反应帧,而 Fk 表示保留所有待保存像素的非活动帧,称为非活动帧。这种机制确保了任务定义的清晰,并保证了模型在不同任务中的收敛性。Fc 和 Fk 由 Wan- VAE 处理并映射到 X 的同一潜在空间中,保持其时空一致性。

为避免任何图像和视频的混合,参考图像由Wan- VAE 编码器单独编码,并沿时间维度拼接回,而相应部分需要在解码过程中被移除。M直接进行重塑和插值处理。随后,Fc、Fk和M被映射到潜在空间,并与X在形状上进行时空对齐,形成n′×h′×w′的结构。

2.2 数据集与实施

数据构造

       要构建一体化模型,必须提升数据构建的多样性和复杂性。在可控视频生成与编辑任务中,输入模态需扩展至目标视频、源视频、局部掩膜、参考图像等更多类型。为实现各类任务高效快速的数据采集,需在进行实例级分析与理解时保持视频质量,具体操作步骤如下

  • 首先对视频数据进行镜头切分,并基于分辨率、美学评分和运动幅度进行初步筛选
  • 随后使用RAM对首帧进行标注,并通过Grounding DINO进行检测处理,实现对目标区域过小或过大的视频进行二次筛选
  • 最后采用SAM2(Ravi等,2025)的传播操作进行视频分割,以获取全视频范围内的实例级信息。基于分割结果,我们通过计算有效帧率(按掩膜区域阈值)对实例进行时间维度的进一步筛选。不同任务的构建需根据其特定特征进行定制化设计。

实施细节

        基于Wan-T2V-14B预训练的可控编辑模型进行优化,使其支持高达720p的分辨率。具体有以下三个步骤:

  1. 初期阶段,我们重点开展基础任务,如图像修复和扩展功能,以完善预训练的文本转视频模型。该阶段引入遮罩技术,同时提升模型在空间和时间维度上的上下文生成能力。
  2. 随后,我们逐步扩展任务范围,从单输入参考帧过渡到多输入参考帧,并从单一任务扩展到复合任务。
  3. 最后,通过使用更高品质的数据和更长的视频序列进行微调,进一步提升模型的整体表现

2.3 评估

在图22和图23中,展示了Wan单模型在不同任务中的表现结果。显然,该模型在视频质量和时间一致性方面达到了高水平的性能。

此外,我们还展示了通过结合不同生成能力所实现的新应用,如图24(a)所示。我们的模型在这些任务中表现优异,显示出巨大的能力扩展潜力。 VACE 提出的统一可控生成和编辑框架同样适用于图像生成和编辑,如图24(b)所示。

3、文生图应用

Wan模型通过图像与视频数据集的联合训练,不仅具备先进的视频生成能力,更展现出卓越的图像合成性能。这种双模态训练策略实现了跨模态知识迁移,构建出一个高度灵活的框架,在两个领域均取得显著成效。实际应用中,wan模型使用比视频数据集大近十倍的图像数据集进行训练,使图像与视频生成任务产生协同增效。这种大规模训练方案在图像合成的多个维度都取得了优异表现。如图25所示,Wan能够生成涵盖艺术类文字图像、写实肖像、创意设计及专业级产品摄影等多样化类别的高保真图像。

4、个性化视频

个性化视频技术致力于生成与用户提供的参考内容保持一致性的视频。本节将先进个性化技术融入视频生成流程,实现了业界领先的性能表现。后续讨论将全面阐述我们的方法论,涵盖模型架构、个性化数据及实验验证等核心要素。

4.1 模型设计

视频个性化背后的核心技术主要解决两个挑战:

  1. 获取高保真度的个性化身份信息
  2. 将这些身份特征无缝整合到视频生成流程中

从Wan-T2V基础模型出发,首先获取个性化身份信息。现有的视频个性化方法通常依赖于身份提取器(如ArcFace,2019)或多功能视觉提取器(如CLIP,2021)来获取身份信息。尽管这些方法取得了显著进展,但其性能受限于特征提取器的局限性。例如,身份提取器主要关注面部识别特征,但可能无法捕捉其他关键视觉线索,如疤痕或贴纸。此外,它们容易受到低分辨率面部、光照变化和部分遮挡(如眼镜、面具或头发)的影响。另一方面,多功能视觉提取器并未专门针对面部领域设计,往往侧重于粗粒度的语义信息。因此,我们选择不依赖任何特征提取器以避免信息丢失,我们的生成过程直接基于输入面部图像在Wan- VAE 的潜在空间中进行条件化

在视频生成过程中,个性化身份信息的注入方式多种多样。实验表明,交叉注意力机制更适合与身份提取器生成的密集表征进行交互,而自注意力机制则更适用于同一潜在空间的数据建模。图26展示了我们基于自注意力范式的视频个性化方法设计。

具体而言,在潜在空间中,我们首先利用分割后的面部图像对给定视频进行前缀扩展,生成K帧附加帧。这些面部图像通过视频配对中的面部检测与分割技术提取,同时保留了面部关键特征点。

  1. 先将人脸图像与视频帧尺寸相同的黑色画布进行对齐
  2. 接着,沿着扩展视频的通道维度,我们将前K帧的人脸图像与全1掩膜进行拼接,剩余帧则使用全0掩膜拼接空白图像(与vace的参考帧一致)。这些拼接后的信号作为条件输入。
  3. 最后,以通道维度的条件信号为依据,对时间扩展后的视频进行扩散处理,实现图像修复效果。

需要说明的是,我们的Wan-T2V模型未作其他调整。

训练阶段会随机丢弃扩展视频中K帧的人脸图像,以便生成0到K个参考人脸视频。推理阶段则从扩展视频的纯噪声状态出发,将用户提供的人脸图像(不超过K帧)沿通道维度拼接到扩展帧中,并将对应掩膜设为全1。该方法旨在重建前K帧的人脸图像,并在后续帧中合成保留用户身份特征的个性化视频。

4.2 数据集

通过精心筛选和自动数据合成技术,从T2V基础模型的训练数据集中整理出个性化数据集。

  1. 首先使用内部人工分类器过滤约1亿个视频,并以每秒1帧的频率进行人脸检测。若视频中某帧检测到多张人脸,或超过10%的帧数未检测到人脸,则该视频将被舍弃。
  2. 随后计算连续帧间的ArcFace相似度,剔除相似度较低的视频。接着进行人脸分割以去除干扰背景,并通过人脸特征点检测辅助训练时的画布对齐
  3. 需要说明的是,我们不会过滤小面积人脸,因为这类视频通常包含全身人物图像。最终构建出约1000万条个性化视频,平均每条视频包含5个分割人脸。

我们还采用自动数据合成技术来提升面部多样性。具体来说,我们从上述视频中随机选取O(1)M个个性化视频,并采用Instant-ID(王等人,2024b)为每个视频合成多样化的人脸。特别值得一提的是,我们构建了一个包含100多个提示词的文本模板库,涵盖动漫、线条艺术、电影、Minecraft等风格。每次从该模板中随机选取一个提示词,并结合其他视频中估算的人体姿态作为Instant-ID的输入。我们进一步通过ArcFace相似度算法对生成的人脸进行评估,过滤掉相似度较低的样本。最终,我们共收集了约O(1)M个包含合成人脸的视频,这极大提升了个性化数据集在风格、姿态、光照和遮挡等方面的多样性。

4.3 评估

我们在图27中展示了视频个性化结果,左侧为输入身份信息,右侧为合成的个性化视频。

所有测试图像均从Pexels1数据库中随机选取。我们还在未见过的评估集上对模型进行测试,并通过以每秒1帧的采样率从视频中提取人脸,测量输入人脸与输出个性化视频之间的ArcFace相似度。最终相似度分数取这些采样人脸的平均值。表8展示了相应结果,其中我们的方法在视频个性化性能上展现出与其它主流商业及闭源中文竞争对手相媲美的表现。

5、摄像机运动可控性

摄像机运动控制模块通过利用摄像机轨迹,精确匹配视频的运动与视角。具体而言,我们为每一帧使用外参参数[R,t] ∈ R 3×4和内参参数Kf ∈ R 3×3。如图28所示,我们的方法包含两个主要组件以有效注入摄像机运动条件:摄像机姿态编码器和摄像机姿态适配器。

相机姿态编码器 首先,对于视频帧中的每个像素,我们使用Plucker坐标将给定的外在和内在参数转换为一系列精细的位置P ∈ R( 6×F ×H×W)。为了调整视频潜在特征的压缩分辨率,我们在Pytorch中应用PixelUnshuffle操作(Paszke等人,2019),以降低P的空间分辨率同时增加通道数。最后,我们使用与DiT块数量对齐的一系列卷积模块对输出进行编码,以提取多级相机运动特征。

相机姿态适配器 为了将相机运动特征整合到视频潜在特征中,我们采用了一个自适应归一化层。具体来说,我们通过两个零初始化的卷积层将输入的相机运动特征序列转换为缩放因子 γi 和平移参数 βi 。然后, γi 和 βi 通过一个简单的线性投影公式fi =(γi + 1)* fi−1 + βi 融入每个DiT块,其中fi表示第i层的视频潜在特征。

关于训练数据 我们利用一种先进的相机姿态估计算法VGGSfM(Wang等人,2024a)从具有显著相机运动的训练视频中提取相机轨迹。该过程产生了大约1000个视频片段。我们在文本到视频生成框架内使用Adam优化器训练我们的模块。图29展示了在相机运动引导下生成的视频的各种示例结果。

6、实时视频生成

当前视频生成方法往往需要消耗大量计算资源,即便是制作短视频片段也需耗费相当时间。依赖高端硬件的系统依然运行缓慢,生成短短几秒视频往往需要数分钟。

此外,现有方法的低速特性使其难以适应需要实时反馈的动态场景。在直播或游戏等场景中,用户对系统即时渲染合成场景和角色的需求日益增长。任何高质量视频生成的延迟都可能导致用户体验不佳,削弱沉浸感和互动性。通过聚焦实时生成技术,wan团队致力于提升视频生成技术的性能与适用性,拓展其在快节奏互动环境中的潜力。图30和31展示了实时长视频流生成的典型案例。

6.1 方法

为构建实时生成流程,我们基于Wan模型的预训练版本进行开发。这一设计选择具有双重优势:首先,从经过充分训练的模型出发,可显著加速收敛过程并提升训练稳定性,因其已具备强大的初始状态;其次,预训练模型已捕获了关于运动模式与连续时间动态特征的宝贵知识。因此,我们采用预训练的Wan模型作为实时流程的基础。

预训练的Wan模型专为生成固定时长视频片段(通常5至10秒)而设计。若要将其升级为能够生成无预设时长(甚至无限时长)连续视频流的实时流媒体模型,则需进行两项关键改进

  • 流式处理管道适配。用流式生成机制替代了静态生成流程——传统流程需要一次性生成固定长度的视频帧序列,而流式机制则采用增量生成方式。在此架构下,视频帧会通过去噪队列处理:每当队列中最旧的帧被生成并移出时,新帧就会被添加到队列末尾,从而实现无长度限制的持续生成。
  • 实时加速优化。除了支持流式传输,还优化了生成速度以满足实时性能需求,即处理管道必须快速生成新帧,确保与实时播放需求同步。

6.2 流式视频生成

传统扩散变换器(DiT)(Peebles & Xie,2023)模型在生成超过数秒时长的视频时存在局限性,即便采用显著的空间和通过变分自编码器(VAEs)实现的时间压缩(Kingma,2013)。这一局限性主要源于注意力机制在处理长时间序列时对计算和内存的高需求。为解决这一难题,我们提出Streamer这一创新方法,通过滑动时间窗口高效管理时间依赖性,从而支持以流式方式生成长时长甚至无限时长的视频

Shift window denoise process models.  Streamer的核心创新在于其 假设时间依赖性被限制在有限的时间窗口内。通过将注意力计算聚焦于该窗口,Streamer在保持视频连续性的同时显著降低了计算开销。具体而言,Streamer以队列形式处理视频标记,并通过多次窗口内去噪处理。 经过固定次数的去噪处理后,系统会将噪声水平最低的最左侧标记从队列中取出并缓存,同时 在最右侧位置插入带有高斯噪声的新标记。这种滑动机制既能保证窗口长度恒定,又能实现连续视频帧的生成。
Training and inference.  流生成器是基于预训练的扩散模型(DiT)进行微调的。训练过程中会采样2w个视频token,其中w代表滑动窗口的大小(通常设置为w=T,即扩散求解器的步数)。前w个标记仅用于模型预热,不参与损失计算。损失计算仅针对最后的w个标记,确保模型能学习在窗口内生成连贯的视频帧。推理时采用相同的预热策略:前w个标记被舍弃,生成的视频从第(w+1)个标记开始。
Ensuring continuity during training and inference.   为确保连续窗口间的平滑过渡,系统会以0噪声水平将缓存标记重新引入标记队列。这使得 先前生成的标记能够参与后续窗口的去噪过程,从而保证生成视频的时间一致性与连贯性。Streamer通过将DiT模型适配流媒体应用,实现了视频生成领域的重大突破。其滑动时间窗口技术突破了传统DiT模型的局限,既能高效生成无限时长视频,又可保持高质量与时间连贯性。该方法为实时视频生成和长篇内容创作开辟了新可能。我们总结其优势如下:
  1. 无限时长视频生成:通过滑动窗口机制,Streamer可生成任意时长视频,且无需承担过高的计算成本;
  2. 高效注意力计算:将注意力计算限制在限定时间窗口内,可降低内存和处理需求;
  3. 无缝连续性:通过缓存和重新引入标记,确保窗口间平滑过渡,长期保持视频质量。

6.3 一致性模型蒸馏

在成功将DiT模型扩展到Streamer以实现无限长度视频生成后,接下来的关键步骤是解决模拟世界实时渲染的挑战。虽然Streamer通过高效管理滑动窗口内的时序依赖关系,能够生成长视频甚至无限长度视频,但扩散过程的计算需求仍是实时应用的瓶颈。为解决这一问题,我们提出了一种创新的Streamer与一致性模型的集成方案——这是一种加速基于扩散的生成过程的前沿方法。具体而言,我们利用了潜在一致性模型(LCM,Luo等人,2023)及其视频版本(VideoLCM,Wang等人,2023c),该模型将原始扩散过程和无类别引导提炼为高效的四步一致性模型。这种提炼过程显著减少了高质量生成所需的采样步骤数量,同时保持了Streamer固有的时序连贯性和流式传输能力。

LCM与Streamer的集成设计保留了去噪窗口机制,确保滑动时间窗口能持续有效处理数据依赖关系。在训练过程中,我们优化了这一组合框架以平衡效率与质量,最终实现推理速度提升10-20倍,使模型达到8-16帧/秒的渲染速率。这种性能的显著提升使系统适用于实时应用场景,例如交互式模拟、实时视频合成以及虚拟环境中的动态内容生成。通过结合Streamer的优势——其生成具有时间连贯性的无限长度视频的能力——与LCM的扩散过程加速优势,我们成功弥合了高质量视频生成与实时响应之间的鸿沟。这一突破不仅提升了扩散模型在流媒体应用中的实用性,更为沉浸式、交互式和实时媒体创作开辟了新可能。

Quantization for running in customer-level devices.

虽然生成速度已提升至实时水平,但由于计算和内存需求较高,即使对于像 NVIDIA 4090这样的高端GPU,在消费级设备上部署模型仍然具有挑战性。为解决这一问题,我们引入了量化技术以优化模型的高效部署。具体而言,我们采用了两种不同的量化策略:对于注意力层和线性头使用int8量化(torchao维护者和贡献者,2024年),而对于整体模型则使用TensorRT量化(NVIDIA ,2023年)int8量化方法通过将权重和激活值转换为8位整数,显著降低了内存消耗,同时保持了整体生成质量。然而,这种方法在生成速度上的加速效果有限,因为它主要关注内存效率而非计算优化。另一方面,TensorRT量化提供了一个更全面的解决方案,能够大幅加速生成速度。该技术使模型即使在单个4090 GPU上也能实现8帧/秒的实时性能,使其适用于消费级设备。不过,TensorRT量化会引入适度的网络误差,即使启用其内置的错误检查机制也能观察到。这种误差表现为输出质量的轻微偏差,例如生成视频中的微小瑕疵或不一致。在某些情况下,这种量化方式还可能导致可测量的不稳定性,例如画面闪烁或时间不连贯现象。尽管存在这些权衡,但int8与TensorRT量化技术的结合为优化模型提供了平衡方案,使其适用于实时消费级部署场景。这种方案在确保生成质量达标的同时,兼顾了效率与实用性。通过精准调整量化参数并利用TensorRT的错误检测功能,我们最大限度地缓解了这些问题,从而在消费级硬件上实现了稳定高效的运行表现。

7、音频生成

研究音频生成的核心目标是为视频片段生成同步音轨,该框架采用视频到音频(V2A)生成技术生成的音轨包含环境音和背景音乐,明确排除语音或人声元素。与文本到音频模型(Liu等,2023b;2024c)不同,视频到音频模型生成的环境音必须与视频画面内容保持时间同步,而背景音乐应当精准传达视频的情感基调与场景氛围,这符合自然预期。此外,为增强用户对音效设计的掌控,我们的框架整合了视频与文字提示功能,用户可自主选择屏幕内或屏幕外的音效,并灵活定义背景音乐的风格与表现力。

7.1 模型设计

与视频生成框架一致,我们的视频到音频模型也采用了基于流匹配(Lipman等,2022)的扩散变换器(DiT)(Peebles & Xie,2023),以建模音频域中的去噪扩散过程。我们V2A模型的详细流程如图32所示。

音频自编码器。传统的音频压缩方法包括将原始波形转换为梅尔频谱图,然后使用基于图像的变分自编码器将其编码为H× W × C的潜在特征,如(Liu等,2023b;2024c)所示。然而,在扩散变换器骨干的背景下,这些潜在特征必须被分割成块并重塑为大小为(H · W)× C的张量。这种分割和重塑过程可能会破坏与相应视频内容的时间对齐,这对同步提出了重大挑战。考虑到这一限制,我们训练了一个直接作用于原始波形的压缩模型。我们的1D- VAE 生成大小为T× C的潜在特征,其中T表示沿时间轴的序列长度,保留了准确同步所需的关键时间信息

视频和文本编码器。为了实现合成音频和视觉序列之间帧级同步,我们通过多模态特征融合建立时间一致性。我们的架构首先采用CLIP Radford等人(2021)提出的模型进行逐帧视觉嵌入提取,随后通过特征复制实现时间速率自适应调整,以匹配音频特征的采样率(参考Polyak等人方法)。同步的视觉与声学特征经由线性投影层进行维度转换,使其与DiT模型的潜在空间对齐,继而通过元素级求和实现多模态融合。为实现跨语言理解,我们采用预训练的umT5模型(Chung等人,2023)作为文本编码器,充分利用其通过冻结参数实现的跨语言表征能力。

Data  V2A模型的训练数据源自视频生成数据集,经过严格筛选流程处理。我们系统性地剔除了缺乏音轨或包含语音/人声音乐的视频,最终获得约1000小时的精炼数据集。为增强多模态表征,我们采用全面的字幕生成策略:在密集的视频描述基础上,结合Qwen2-audio(Chu等,2024)生成的音频专属字幕。这些音频字幕被划分为环境音效和音乐作品两大类,其中音乐作品通过风格、节奏、旋律和乐器编配进行特征描述。最终的结构化字幕整合了三个核心要素:(1)密集视频描述,(2)环境音效特征,(3)背景音乐分析,为训练提供统一的多模态表征。

实施细节  V2A架构能够生成最高时长为12秒、采样率为44.1kHz的高保真立体声。该模型通过专用编码器处理多模态输入:umT5- XXL 生成4096维的文本嵌入,而CLIP则提取每帧1024维的视觉嵌入。音频和视频特征在DiT主干网络中被投影到一个统一的1536维潜在空间。为了实现时间对齐,我们对输入视频进行降采样,确保12秒片段精确生成48帧,从而保证视觉和音频模态之间的帧级同步。系统以256长度的潜在序列进行批量处理。为了增强模型仅从视觉线索生成音频的能力,我们在训练过程中实施了随机掩码策略,即以预设概率选择性地省略环境音和音乐字幕。这种条件机制迫使模型在保持灵活性的同时,建立视觉内容与相应音频模式之间的稳健跨模态关联,同时在可用时利用文本描述。

7.2 评估

在图33中对音频生成进行了定性评估,将本方法与近期发布的开源方案MMAudio(Cheng等人,2024)进行了对比。这项对比分析意义重大,因为MMAudio是我们方法最接近且最具竞争力的基准模型,在音频生成任务中展现出令人瞩目的性能。视频由我们的文本转视频模型生成,时长为5秒。如对比结果所示,我们的V2A模型在音频生成的多个关键方面表现更优。具体而言,该模型展现出更强的长期一致性,尤其在“倒咖啡”场景(图33第一案例)中尤为明显。在第二个“打字”案例中,我们的方法生成的音频输出比MMAudio产生的噪点更少。此外,我们的方法在节奏性声音模式合成方面表现突出,如“走路”、“拳击”和“咔哒”三个案例(图33最后三个案例)所示,其音频生成更自然连贯。局限性方面,本方法在生成人类语音(包括但不限于笑声、哭声和说话声)时存在局限,这主要归因于数据准备过程——我们有意将语音相关数据排除在训练数据集之外。MMAudio模型能够生成随机语音样声音的能力源于其训练语料库中保留的语音相关数据。在我们未来的工作中,计划整合语音生成能力以解决这一局限性。

8、局限性与结论

Limitation  
本研究推出的Wan视频生成模型作为基础架构,在多项基准测试中取得显著突破。特别是 在运动幅度(如体育、舞蹈)和指令跟随能力方面表现突出。但该模型仍存在若干局限性,需通过改进才能充分发挥其潜力。
  • 首先,对于包含大规模运动场景的细节保留仍是本方法面临的挑战,这也是视频生成领域普遍存在的问题。要提升大规模运动视频的保真度仍需持续投入。
  • 其次,大型模型的计算成本依然高昂。当前在单块高端GPU上运行140亿参数模型的推理耗时约30分钟,若不进行额外优化仍显吃力。要让视频生成成为普及型AI工具,必须进一步提升效率和扩展性。
  • 最后,领域专业知识储备仍显不足。作为基础模型,我们致力于增强Wan的通用能力,但在教育、医疗等特定领域应用时,其表现可能仍显不足。
为此,我们计划通过开源最新模型,推动跨领域社区协作开发,以突破这一局限。

Conclusion
在本报告中,我们公开发布了Wan,这是我们最新的视频模型,它为视频生成设定了新的基准。我们全面概述了Wan- VAE 和DiT模型的架构设计,包括对其训练方法、数据整理流程、评估方法及实证结果的详细见解。此外,我们细致分析了数据预处理流程以及为优化模型训练而实施的战略调整。这种整体方法旨在推动视频生成领域的进步。我们还广泛研究了下游应用,如图像到视频生成、视频编辑和个人化视频生成,以展示Wan在不同场景下的多功能性和实用性。除了开源14B模型外,我们还探讨了利用较小规模模型进行高效视频生成的可行性。值得注意的是,我们的1.3B模型不仅与大型模型相比具有竞争力,而且能够在消费级GPU上实现无缝推理,显著提高了内容创作者的可访问性和实用性。展望未来,我们计划专注于扩展数据和模型架构,以应对视频生成中最紧迫的挑战。我们持续的努力旨在为研究社区提供更强大、更通用的视频创作工具,促进创新并推动这一快速发展的领域更广泛的应用。
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐