为什么扩散模型不直接生成高分辨率图像
·
大图生成”)的工作,都是先通过 Encoder 变换到 Latent 空间进行的(即 LDM,Latent Diffusion Model ),直接在原始 Pixel 空间训练的扩散模型,大多数分辨率都不超过 64x64,而恰好,LDM 通过 AutoEncoder 变换后的 Latent,大小通常也不超过 64x64。
扩散模型是不是对于高分辨率生成存在固有困难?能否在 Pixel 空间直接生成高分辨率图像?
论文《Simple diffusion: End-to-end diffusion for high resolution images》通过“信噪比”分析了大图生成的困难,并以此来优化 noise schdule,同时提出只需在最低分辨率 feature 上对架构进行 scale up、多尺度 Loss 等技巧来保证训练效率和效果,这些改动使得原论文成功在 Pixel 空间上训练了分辨率高达 1024*1024 的图像扩散模型。Ref
更多推荐
所有评论(0)