NeurIPS‘2025高分论文!当扩散模型遇上Transformer,效率直线飙升!
NeurIPS'2025上,字节跳动与加州大学联合团队提出的解耦扩散Transformer(DDT),为扩散模型与Transformer融合研究提供新范式,成功解决传统架构在高维数据生成中“语义-细节耦合失衡”“训练收敛效率低”的痛点,成多模态生成领域重点研究方向。
从科研角度看,扩散模型的连续数据生成能力适配图像、音频等研究场景,但全局特征建模弱;Transformer虽能捕捉长程依赖,却易导致生成结果细节模糊。而DDT的双分支解耦架构,在ImageNet-1K 256×256图像生成任务中,不仅将FID值降至1.31,还通过动态注意力权重分配解决了多模态数据生成中语义偏移问题,为跨模态生成研究提供新思路。
想深耕该领域的科研人,可重点探索解耦架构在医学影像生成中的适配性、小样本场景下的扩散-Transformer协同优化,这些方向既有学术创新性,又能对接实际科研需求;我整理了10篇相关的前沿论文,顶会/顶刊论文+部分官方代码打包免费送,工种号 沃的顶会 感兴趣的同学扫码回复 “扩散trans” 领取。
Vchitect-2.0:Parallel Transformer for Scaling Up Video Diffusion Models
文章解析
论文提出了一种名为Vchitect-2.0的并行Transformer架构,旨在解决大规模文本到视频生成中的时间一致性、计算效率和可扩展性问题。通过引入多模态扩散块、高效训练框架以及高质量数据集,该方法在视频质量和训练效率上超越现有技术,并为高保真视频生成提供了基础。
创新点
设计了多模态扩散块以确保文本描述与生成视频帧之间的一致性,并保持时间连贯性。
提出了基于混合并行主义和内存优化技术的高效训练框架,支持长视频序列的分布式训练。
构建了高质量的大规模训练数据集Vchitect T2V DataVerse,提升模型训练和泛化能力。
研究方法
通过多模态扩散块建模动态交互和平滑过渡,确保时间和空间一致性。
结合数据并行和序列并行技术,使用重计算和卸载等方法优化内存消耗。
创建包含严格注释和美学评估的百万级高质量数据集,支持复杂任务的训练。
研究结论
Vchitect-2.0在多个基准测试中表现优于现有方法,特别是在时间连贯性和计算效率方面。
混合并行框架显著提高了训练可扩展性,降低了内存开销。
高质量数据集和创新架构为未来视频生成研究奠定了坚实基础。

UDHF2-Net:Uncertainty -diffusion -model -based High -Frequency Transformer Network for Remotely Sensed Imagery Interpretation
文章解析
论文提出了一种新的网络UDHF2-Net,针对遥感影像解译中的语义分割和变化检测问题,解决了空间分布模式的平稳与非平稳共存、边缘不确定性以及几何配准误差导致的误检问题。通过引入高频频域连接范式(SHCP)、基于掩码和地理知识的不确定性扩散模块(MUDM)以及频域半伪孪生网络结构,显著提高了语义分割和变化检测的精度。
创新点
提出了空间平稳与非平稳高频连接范式(SHCP),增强边缘提取精度。
设计了基于掩码和地理知识的不确定性扩散模块(MUDM),逐步去除模拟光谱噪声,提升边缘提取和变化检测准确性。
首次提出频域半伪孪生UDHF2-Net,平衡变化检测任务中的精度与复杂度。
研究方法
通过HRFormer启发,用高频流代替高分辨率流以持续保留高频信息。
采用自监督学习策略MUDM减少几何配准误差带来的边缘误检问题。
构建频域半伪孪生网络结构以应对变化检测任务的复杂性。
研究结论
在语义分割实验中,UDHF2-Net在ISPRS Potsdam、Vaihingen和LoveDA数据集上分别达到92.00%、87.31%和55.27%的最佳mIoU值。
在变化检测实验中,半伪孪生UDHF2-Net在WB-CD、LEVIR-CD和SYSU-CD数据集上分别达到93.12%、90.47%和78.13%的最佳IoU值。
消融实验验证了UDHF2-Net各模块的有效性,显著提升了任务精度。

更多推荐
所有评论(0)