[论文解读] DiffusionSeg: Adapting Diffusion Towards Unsupervised Object Discovery
DiffusionSeg 提出了一种新颖的生成-利用框架,将预训练的扩散模型适配于无监督对象发现任务,通过无需训练的 AttentionCut 生成合成的图像-掩码对,并利用扩散反演提取判别性特征。该方法在六个基准测试中达到最先进性能,证明了基于扩散模型的预训练在像素级任务中的优越性。
Learning from a large corpus of data, pre-trained models have achieved impressive progress nowadays. As popular generative pre-training, diffusion models capture both low-level visual knowledge and high-level semantic relations. In this paper, we propose to exploit such knowledgeable diffusion models for mainstream discriminative tasks, i.e., unsupervised object discovery: saliency segmentation and object localization. However, the challenges exist as there is one structural difference between generative and discriminative models, which limits the direct use. Besides, the lack of explicitly labeled data significantly limits performance in unsupervised settings. To tackle these issues, we introduce DiffusionSeg, one novel synthesis-exploitation framework containing two-stage strategies. To alleviate data insufficiency, we synthesize abundant images, and propose a novel training-free AttentionCut to obtain masks in the first synthesis stage. In the second exploitation stage, to bridge the structural gap, we use the inversion technique, to map the given image back to diffusion features. These features can be directly used by downstream architectures. Extensive experiments and ablation studies demonstrate the superiority of adapting diffusion for unsupervised object discovery.
研究动机与目标
- 探索预训练扩散模型(通常用于生成任务)在无监督对象发现等判别性像素级任务中的潜力。
- 解决生成式扩散模型与判别性下游任务(如显著性分割和目标定位)之间的结构不匹配问题。
- 通过合成高质量图像-掩码对,克服无监督设置中标签数据有限的挑战。
- 通过反演实现扩散特征的直接使用,弥合生成式与判别式架构之间的鸿沟。
- 证明基于扩散模型的预训练在密集预测任务中可超越判别式预训练方法(如 CLIP、DINO)
提出的方法
- 提出两阶段框架:生成(数据生成)与利用(特征利用)。
- 引入 AttentionCut —— 一种无需训练的方法,通过在图像生成过程中利用扩散模型的交叉注意力与自注意力图生成掩码。
- 使用文本到图像扩散模型,结合随机噪声与类别标签,合成具有精确掩码的真实感图像。
- 采用扩散反演将真实图像映射回潜在扩散特征空间,实现确定性特征提取。
- 将反演后的扩散特征作为轻量解码器的通用表示,用于下游分割任务。
- 在合成数据上训练单一分割解码器,统一不同任务中对扩散预训练的使用。
实验结果
研究问题
- RQ1预训练的扩散模型(在生成任务中表现出色)能否有效适配于无监督判别性任务(如对象发现)?
- RQ2如何弥合生成式扩散模型与判别式对象发现模型在结构与分布上的差异?
- RQ3通过注意力掩码生成的合成数据,在低资源无监督设置下能在多大程度上提升性能?
- RQ4扩散特征中隐含的知识(尤其是反演后)是否优于显式预训练的判别式特征(如 CLIP、DINO)在密集预测任务中的表现?
- RQ5当类别先验(用于 AttentionCut)缺失或受损时,该方法的鲁棒性如何?
主要发现
- DiffusionSeg 在六个标准基准上达到最先进性能:ECSSD、DUTS、DUT-OMRON(分割任务),以及 VOC07、VOC12、COCO20K(检测任务)。
- 在 ECSSD 上,该方法实现 92.4% 的准确率与 71.0% 的 IoU,优于 CLIP(92.0% 准确率,72.8% IoU)与 DINO(86.9% 准确率,70.1% IoU)。
- 当合成数据规模扩展至 50k 样本时,DiffusionSeg 在 ECSSD 上实现 95.2% 准确率与 79.0% IoU,显著优于基线模型。
- 消融研究显示,AttentionCut 同时结合语义一致性和空间连贯性时性能最佳(ECSSD 上准确率 92.4%,IoU 71.0%),优于 K-means 与 DenseCRF 等方法。
- 通过反演提取的扩散特征表现优于判别式特征:在 DUTS-TE 上,DiffusionSeg 实现 93.3% 准确率与 63.7% IoU,超越 CLIP(92.4% 准确率,56.3% IoU)。
- 即使在无 CLIP 可分类先验的情况下,该方法仍保持鲁棒性,DiffusionSeg(无先验)在 DUT-OMRON 上实现 92.9% 准确率与 62.8% IoU,表明其泛化能力超越标签依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。