CV-扩散模型经典论文解读|InstanceDiffusion: Instance-level Control for Image Generation实例扩散:图像生成的实例级控制
·
论文标题
InstanceDiffusion: Instance-level Control for Image Generation
实例扩散:图像生成的实例级控制
论文链接
InstanceDiffusion: Instance-level Control for Image Generation论文下载
论文作者
Xudong Wang, Trevor Darrell, Sai Saketh Rambhatla, Rohit Girdhar, Ishan Misra
内容简介
本文介绍了一种名为InstanceDiffusion的图像生成模型,该模型能够在文本到图像的扩散模型中实现精确的实例级控制。InstanceDiffusion支持对每个实例进行自由形式的语言条件描述,并允许灵活地指定实例位置,如单点、涂鸦、边界框或复杂的实例分割掩码等。
该模型通过三个主要改进来实现精确的实例级控制:UniFusion块、ScaleU块和多实例采样器。InstanceDiffusion在各种位置条件下均显著优于现有的专门模型,并在COCO数据集上取得了显著的性能提升。

关键点
1.实例级控制
- InstanceDiffusion能够在图像生成过程中对每个实例进行精确的控制,包括位置和属性(如颜色、纹理等)。
- 支持多种位置输入形式,如边界框、掩码、单点和涂鸦,增强了模型的灵活性和适用性.

2.模型架构改进
- UniFusion块:将不同形式的实例级条件融合到同一特征空间中,并将其注入到视觉令牌中,从而实现实例级条件的图像生成.
- ScaleU块:通过重新校准UNet中的主特征和低频成分,提高了模型对指定布局条件的精确度.
- 多实例采样器:在推理过程中减少多个实例条件之间的信息泄露,提高了生成图像的质量和保真度.

3.性能提升
- 在COCO数据集上,InstanceDiffusion在边界框输入条件下比之前的最佳模型提高了20.4%的APbox 50,在掩码输入条件下提高了25.4%的IoU.
- 通过引入新的评估指标和基准,InstanceDiffusion在点和涂鸦输入条件下也表现出色,为未来的研究提供了新的基线.

4.应用与扩展
- InstanceDiffusion支持迭代图像生成,允许用户在保持先前生成对象和全局场景一致性的同时,选择性地插入新对象或修改现有对象.
- 该模型还可以应用于图像编辑、替换、移动和调整大小等任务,展示了其在图像生成领域的广泛应用潜力.

CV-diffusion models必读论文合集:
希望这些论文能帮到你!如果觉得有用,记得点赞关注哦~ 后续还会更新更多论文合集!!
论文代码
项目页面:InstanceDiffusion: Instance-level Control for Image Generation
更多推荐
所有评论(0)