[论文解读] Unsupervised Semantic Segmentation by Contrasting Object Mask Proposals
本文提出一种两阶段无监督语义分割框架,利用无监督显著性检测生成物体掩码提议,随后将其作为对比学习目标中的中级先验,以学习具有判别性的像素嵌入。该方法在完全无监督设置下的 PASCAL VOC 数据集上达到最先进性能,使用过聚类时平均 IoU 达到 53.6%,且在迁移至 COCO 和 DAVIS 数据集时表现出良好的泛化能力。
Being able to learn dense semantic representations of images without supervision is an important problem in computer vision. However, despite its significance, this problem remains rather unexplored, with a few exceptions that considered unsupervised semantic segmentation on small-scale datasets with a narrow visual domain. In this paper, we make a first attempt to tackle the problem on datasets that have been traditionally utilized for the supervised case. To achieve this, we introduce a two-step framework that adopts a predetermined mid-level prior in a contrastive optimization objective to learn pixel embeddings. This marks a large deviation from existing works that relied on proxy tasks or end-to-end clustering. Additionally, we argue about the importance of having a prior that contains information about objects, or their parts, and discuss several possibilities to obtain such a prior in an unsupervised manner. Experimental evaluation shows that our method comes with key advantages over existing works. First, the learned pixel embeddings can be directly clustered in semantic groups using K-Means on PASCAL. Under the fully unsupervised setting, there is no precedent in solving the semantic segmentation task on such a challenging benchmark. Second, our representations can improve over strong baselines when transferred to new datasets, e.g. COCO and DAVIS. The code is available.
研究动机与目标
- 解决在大规模、多样化基准(如 PASCAL VOC)上缺乏完全无监督语义分割方法的问题。
- 克服基于实例判别自监督学习的局限性,后者在像素级别无法有效区分语义类别。
- 引入一种中级视觉先验——由无监督显著性生成的物体掩码提议——以指导像素嵌入的对比学习。
- 实现在无需任何人工标注掩码的情况下,直接对学习到的嵌入进行聚类以形成语义组。
- 在半监督或微调设置下,证明所学习表征在下游数据集(如 COCO 和 DAVIS)上的可迁移性。
提出的方法
- 首先,使用无监督显著性估计器生成物体掩码提议,作为包含物体级信息的中级先验。
- 其次,应用一种对比学习目标,将同一掩码提议内的像素嵌入拉近,同时将不同物体的像素嵌入推远。
- 采用 ResNet-50 主干网络并结合空洞卷积提取特征,权重初始化使用 ImageNet 或 MoCo 预训练权重。
- 应用对比损失,将正样本对定义为属于同一掩码提议的像素,负样本对则为来自不同提议的像素。
- 对最终的像素嵌入执行 K-Means 聚类,将聚类结果上采样至原始分辨率,并通过匈牙利算法与真实类别进行匹配。
- 在半监督微调中,在主干网络之上添加线性分类头,按层调整学习率,并使用多项式衰减调度器。
实验结果
研究问题
- RQ1是否能够通过将物体掩码提议作为中级先验的对比学习框架,在无需任何人工标注分割掩码的情况下,学习到对语义类别具有判别性的像素嵌入?
- RQ2与低级先验(如边缘或边界)相比,使用物体级先验在无监督语义表征学习中的表现如何?
- RQ3在完全无监督设置下,所学习的像素嵌入是否可直接聚类为 PASCAL VOC 这类挑战性基准中的有意义语义组?
- RQ4当所学习的表征被迁移或微调时,其在 COCO 和 DAVIS 等其他数据集上的泛化能力如何?
- RQ5在 PASCAL VOC 等类别不平衡、结构复杂的数据集中,对嵌入进行过聚类是否能提升语义对齐性和性能?
主要发现
- 所提方法在使用过聚类(200 个预测聚类)时,于 PASCAL VOC 上达到 53.6% 的平均 IoU,显著优于先前的无监督方法。
- 当使用 500 个预测聚类、监督显著性生成掩码提议并采用 MoCo 预训练时,方法达到 57.0% 的平均 IoU。
- 该方法在 PASCAL VOC 上实现了完全无监督语义分割的新 SOTA,此前该任务尚无先例。
- 所学习的表征在 COCO 和 DAVIS 上具有良好的迁移能力,当使用少量标注进行微调时,性能优于强基线方法。
- 过聚类可提升性能,平均 IoU 从 200 个聚类时的 45.0% 提升至 500 个聚类时的 57.0%,表明局部嵌入邻域内包含语义一致的组。
- 定性结果表明,所学习的嵌入能捕捉语义上有意义的结构,其与真实类别的对齐程度优于实例判别或 SWAV 基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。