[论文解读] MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
MosaicFusion 提出了一种无需训练、无需标签监督的方法,利用预训练的文本到图像扩散模型生成高质量的合成图像和实例掩码,用于大规模词汇量实例分割。通过在单个扩散过程中将图像画布划分为多个区域,并为每个区域分别基于不同的文本提示进行条件生成,该方法利用跨层和时间步长的聚合交叉注意力图,通过阈值化和边缘感知精炼生成精确的实例掩码,在 LVIS 基准测试中显著提升了罕见类别和新类别上的性能。
We present MosaicFusion, a simple yet effective diffusion-based data augmentation approach for large vocabulary instance segmentation. Our method is training-free and does not rely on any label supervision. Two key designs enable us to employ an off-the-shelf text-to-image diffusion model as a useful dataset generator for object instances and mask annotations. First, we divide an image canvas into several regions and perform a single round of diffusion process to generate multiple instances simultaneously, conditioning on different text prompts. Second, we obtain corresponding instance masks by aggregating cross-attention maps associated with object prompts across layers and diffusion time steps, followed by simple thresholding and edge-aware refinement processing. Without bells and whistles, our MosaicFusion can produce a significant amount of synthetic labeled data for both rare and novel categories. Experimental results on the challenging LVIS long-tailed and open-vocabulary benchmarks demonstrate that MosaicFusion can significantly improve the performance of existing instance segmentation models, especially for rare and novel categories. Code: https://github.com/Jiahao000/MosaicFusion.
研究动机与目标
- 解决大规模词汇量实例分割中数据稀缺的问题,特别是针对罕见和新类别。
- 克服现有数据增强方法需要训练或标签监督的局限性。
- 利用预训练的文本到图像扩散模型,同时生成多样化、高质量的图像和对应的实例掩码。
- 实现无需微调的下游实例分割模型数据增强,且无需修改主干网络架构。
- 提升模型在长尾分布和开放词汇量实例分割基准上的泛化能力和性能。
提出的方法
- 将图像画布划分为多个区域,以实现在单张图像中同时生成多个对象。
- 在所有区域上运行单一扩散过程,为每个区域分别基于不同的文本提示进行条件生成,以生成多样化、逼真的对象实例。
- 提取每个对象对应文本提示在所有 Transformer 层和扩散时间步长上的交叉注意力图。
- 通过在层和时间步长上取平均,聚合这些注意力图,生成高质量、空间一致的掩码候选。
- 对聚合后的注意力图应用阈值化和边缘感知精炼(如双边求解器),以生成精确的实例掩码。
- 将生成的图像-掩码对用作合成训练数据,以微调或预训练现有的实例分割模型。
实验结果
研究问题
- RQ1能否利用预训练的文本到图像扩散模型,在无需额外训练或监督的情况下,生成多样化、多对象且掩码准确的图像?
- RQ2在层和时间步长上聚合交叉注意力图在生成高质量掩码预测方面的有效性如何?
- RQ3通过 MosaicFusion 生成的合成数据在长尾分布和开放词汇量设置下,对罕见和新类别实例分割性能的提升程度如何?
- RQ4该方法在不同主干网络架构和实例分割模型上是否具备泛化能力?
- RQ5每张图像生成的对象数量对合成数据集的质量和实用性有何影响?
主要发现
- MosaicFusion 在多个基线模型(包括 Mask R-CNN、Box-Supervised CenterNet2 和 F-VLM)上显著提升了罕见类别(AP_r)和新类别(AP_novel)的掩码平均精度(AP)。
- 该方法在无需任何模型微调或额外监督的情况下,显著提升了 LVIS 长尾分布和开放词汇量基准上的性能。
- 在层和时间步长上聚合交叉注意力图,相比使用单个注意力图,能生成更高质量的掩码预测,最佳结果出现在扩散过程的最后阶段和最高分辨率的特征层。
- MosaicFusion 生成的合成数据集可实现最先进的性能提升,尤其在低资源类别上表现突出,证明了该方法在数据稀缺场景下的有效性。
- 该方法与多种下游实例分割模型兼容,无论使用何种主干网络架构,均能保持一致的性能增益。
- 尽管存在领域差距,生成的合成图像和掩码在真实感和多样性方面已足够优秀,可作为有效的训练数据,其在长尾泛化能力上优于传统的增强技术(如 Copy-Paste)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。