[论文解读] Unsupervised Object Localization: Observing the Background to Discover Objects
本文提出 FOUND,一种新颖的无监督目标定位方法,其反向思维:先利用自监督视觉Transformer特征检测背景,再将目标识别为背景的补集。通过仅在由稀疏注意力图生成的粗略背景掩码上训练单个 $1\times1$ 卷积层,该方法仅用 2 个训练周期和 80 FPS 的推理速度,就在无监督显著性检测、目标发现和语义分割检索任务上达到最先进性能。
Recent advances in self-supervised visual representation learning have paved the way for unsupervised methods tackling tasks such as object discovery and instance segmentation. However, discovering objects in an image with no supervision is a very hard task; what are the desired objects, when to separate them into parts, how many are there, and of what classes? The answers to these questions depend on the tasks and datasets of evaluation. In this work, we take a different approach and propose to look for the background instead. This way, the salient objects emerge as a by-product without any strong assumption on what an object should be. We propose FOUND, a simple model made of a single $conv1 imes1$ initialized with coarse background masks extracted from self-supervised patch-based representations. After fast training and refining these seed masks, the model reaches state-of-the-art results on unsupervised saliency detection and object discovery benchmarks. Moreover, we show that our approach yields good results in the unsupervised semantic segmentation retrieval task. The code to reproduce our results is available at https://github.com/valeoai/FOUND.
研究动机与目标
- 解决无监督目标定位中对目标尺寸、数量或类别缺乏强假设的挑战。
- 通过将背景检测作为目标发现的代理,减少对复杂、重型模型或大量训练的依赖。
- 利用自监督视觉Transformer表征,无须人工标注即可提取有意义的背景掩码。
- 在极低计算成本下,实现在无监督显著性检测、目标发现和语义分割检索任务上的最先进性能。
提出的方法
- 使用自监督视觉Transformer(如DINO或MAE)提取图像块级特征和注意力图。
- 通过选择被Transformer自注意力机制关注最少的图像块,识别背景块。
- 应用基于稀疏性的重加权方案,降低注意力图中的噪声,提升背景块选择的可靠性。
- 通过聚合与选定低关注度块相似的图像块,构建粗略背景掩码。
- 将粗略背景掩码的补集作为伪真值,用于训练单个 $1\times1$ 卷积层以实现精细化。
- 在训练过程中采用带边缘保持的双边滤波器进行自标签化处理,以提升掩码质量与泛化能力。
实验结果
研究问题
- RQ1背景检测能否作为无监督学习中直接进行目标发现的更鲁棒、更少假设的替代方案?
- RQ2注意力图的稀疏性在无监督条件下能否有效识别可靠的背景块?
- RQ3仅含770个可学习参数的极简模型能否在无监督目标定位任务中超越更大、更复杂的架构?
- RQ4粗略背景掩码的补集在无需后处理的情况下,能在多大程度上实现准确的目标定位?
- RQ5所提方法在无监督显著性检测、目标发现和语义分割检索等多样化基准上是否具备良好的泛化能力?
主要发现
- FOUND在DUTS-TR基准上实现了无监督显著性检测的最先进结果,多设置评估下最大 $F_{\beta}$ 达0.935,IoU达0.813。
- 在单设置模式下,ECSSD数据集上准确率达到90.9%,IoU达0.717,优于先前方法且无需后处理。
- 仅在DUTS-TR上训练2个周期,性能即与需训练12–60k次迭代的方法相当,展现出极高的训练效率。
- 在训练中引入双边求解器(通过 $\zeta()_{t}$)使IoU提升1.7个百分点,后处理进一步提升0.6个百分点。
- 推理速度达80 FPS,显著快于竞争方法如SelfMask(36M参数,12个周期)和FreeSOLO(65M参数,60k次迭代)。
- 视觉对比显示,与FreeSOLO和SelfMask相比,FOUND生成的掩码更准确、更少过分割,尤其在含多个目标的复杂场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。