Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Semantic Segmentation with Self-supervised Object-centric Representations

Andrii Zadaianchuk, Matthaeus Kleindessner|arXiv (Cornell University)|Jul 11, 2022
Advanced Image and Video Retrieval Techniques被引用 16
一句话总结

该论文提出 COMUS,一种自监督的无监督语义分割方法,利用 DINO 提取的以物体为中心的表征以及无监督显著性检测,生成伪掩码以训练分割网络。该方法在 PASCAL VOC 上达到最先进性能(50.0 mIoU),并在全量 81 类 MS COCO 数据集上首次报告无监督结果,平均 mIoU 达到 19.6,成功发现 34 个类别 IoU 超过 20%。

ABSTRACT

In this paper, we show that recent advances in self-supervised feature learning enable unsupervised object discovery and semantic segmentation with a performance that matches the state of the field on supervised semantic segmentation 10 years ago. We propose a methodology based on unsupervised saliency masks and self-supervised feature clustering to kickstart object discovery followed by training a semantic segmentation network on pseudo-labels to bootstrap the system on images with multiple objects. We present results on PASCAL VOC that go far beyond the current state of the art (50.0 mIoU), and we report for the first time results on MS COCO for the whole set of 81 classes: our method discovers 34 categories with more than $20\%$ IoU, while obtaining an average IoU of 19.6 for all 81 categories.

研究动机与目标

  • 开发一种无需人工标注类别、简单但强大的无监督语义分割基线方法。
  • 利用自监督表征实现多物体图像中对象类别的无监督发现与精确定位。
  • 将无监督语义分割扩展至大规模数据集(如包含全部 81 个类别的 MS COCO),此前该设定尚未被探索。
  • 证明无监督方法可达到十年前监督方法的性能水平。
  • 通过消融实验识别流程中的关键组件与瓶颈,为未来改进提供依据。

提出的方法

  • 利用 DINO(一种自监督视觉 Transformer)从 ImageNet 中提取无标签的高质量、以物体为中心的特征。
  • 应用无监督显著性检测器(DeepUSPS 或 BASNet)定位前景物体并提取区域提议。
  • 在显著性区域内的 DINO 特征上应用谱聚类,以发现对象类别并生成伪掩码。
  • 过滤不确定的聚类以提升掩码质量并减少伪标签中的噪声。
  • 使用数据增强进行自训练,在生成的伪掩码上训练 DeepLabv3 语义分割网络。
  • 在 PASCAL VOC 和 MS COCO 上进行迭代自训练,以优化预测并提升分割质量。

实验结果

研究问题

  • RQ1自监督的以物体为中心的表征是否能实现无需任何人工标注的强无监督语义分割?
  • RQ2无监督显著性检测与特征聚类的结合在复杂多物体场景中的对象发现中效果如何?
  • RQ3在包含 81 个类别的 MS COCO 数据集上,基于伪掩码的自训练循环能在多大程度上提升分割性能?
  • RQ4该流程中的关键组件是什么?性能的主要瓶颈在哪里?
  • RQ5无监督分割方法是否能达到十年前监督方法的性能水平?

主要发现

  • COMUS 在 PASCAL VOC 上达到 50.0 mIoU,与十年前监督语义分割方法的性能相当。
  • 首次在完整 81 类 MS COCO 数据集上报告无监督语义分割结果,平均 mIoU 达到 19.6。
  • 该方法在 MS COCO 上成功发现 34 个类别,IoU 超过 20%,证明了其在多物体、多类别发现方面的有效性。
  • 消融实验表明,无监督显著性检测与 DINO 特征上的谱聚类对初始掩码质量与类别发现至关重要。
  • 自训练显著提升性能,PASCAL VOC 上两次迭代与 MS COCO 上一次迭代均带来一致的性能增益。
  • 计算成本主要来自 DINO 预训练(8 张 GPU 上耗时 3 天),但推理与下游训练效率较高,完整自训练过程在 4 张 T4 GPU 上耗时约 1 小时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。