论文标题

InstanceDiffusion: Instance-level Control for Image Generation

实例扩散:图像生成的实例级控制

论文链接

InstanceDiffusion: Instance-level Control for Image Generation论文下载

论文作者

Xudong Wang, Trevor Darrell, Sai Saketh Rambhatla, Rohit Girdhar, Ishan Misra

内容简介

本文介绍了一种名为InstanceDiffusion的图像生成模型,该模型能够在文本到图像的扩散模型中实现精确的实例级控制。InstanceDiffusion支持对每个实例进行自由形式的语言条件描述,并允许灵活地指定实例位置,如单点、涂鸦、边界框或复杂的实例分割掩码等。

该模型通过三个主要改进来实现精确的实例级控制:UniFusion块、ScaleU块和多实例采样器。InstanceDiffusion在各种位置条件下均显著优于现有的专门模型,并在COCO数据集上取得了显著的性能提升。

关键点

1.实例级控制

  • InstanceDiffusion能够在图像生成过程中对每个实例进行精确的控制,包括位置和属性(如颜色、纹理等)。
  • 支持多种位置输入形式,如边界框、掩码、单点和涂鸦,增强了模型的灵活性和适用性.

2.模型架构改进

  • UniFusion块:将不同形式的实例级条件融合到同一特征空间中,并将其注入到视觉令牌中,从而实现实例级条件的图像生成.
  • ScaleU块:通过重新校准UNet中的主特征和低频成分,提高了模型对指定布局条件的精确度.
  • 多实例采样器:在推理过程中减少多个实例条件之间的信息泄露,提高了生成图像的质量和保真度.

3.性能提升

  • 在COCO数据集上,InstanceDiffusion在边界框输入条件下比之前的最佳模型提高了20.4%的APbox 50,在掩码输入条件下提高了25.4%的IoU.
  • 通过引入新的评估指标和基准,InstanceDiffusion在点和涂鸦输入条件下也表现出色,为未来的研究提供了新的基线.

4.应用与扩展

  • InstanceDiffusion支持迭代图像生成,允许用户在保持先前生成对象和全局场景一致性的同时,选择性地插入新对象或修改现有对象.
  • 该模型还可以应用于图像编辑、替换、移动和调整大小等任务,展示了其在图像生成领域的广泛应用潜力.

CV-diffusion models必读论文合集:

CV-扩散模型必读论文合集

希望这些论文能帮到你!如果觉得有用,记得点赞关注哦~ 后续还会更新更多论文合集!!

论文代码

项目页面:InstanceDiffusion: Instance-level Control for Image Generation

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐