Skip to main content
QUICK REVIEW

[论文解读] Deep Spectral Methods: A Surprisingly Strong Baseline for Unsupervised Semantic Segmentation and Localization

Luke Melas-Kyriazi, Christian Rupprecht|arXiv (Cornell University)|May 16, 2022
Advanced Neural Network Applications被引用 6
一句话总结

该论文提出了一种简单但强大的谱方法,利用自监督深度特征的拉普拉斯矩阵特征向量,实现了最先进的无监督语义分割与目标定位。通过将图像块视为图中的节点,并在亲和矩阵上应用谱聚类,该方法在无需任何标注数据的情况下,将复杂场景分解为语义上有意义的区域,在PASCAL VOC和MS-COCO上优于以往仅使用深度学习的方法。

ABSTRACT

Unsupervised localization and segmentation are long-standing computer vision challenges that involve decomposing an image into semantically-meaningful segments without any labeled data. These tasks are particularly interesting in an unsupervised setting due to the difficulty and cost of obtaining dense image annotations, but existing unsupervised approaches struggle with complex scenes containing multiple objects. Differently from existing methods, which are purely based on deep learning, we take inspiration from traditional spectral segmentation methods by reframing image decomposition as a graph partitioning problem. Specifically, we examine the eigenvectors of the Laplacian of a feature affinity matrix from self-supervised networks. We find that these eigenvectors already decompose an image into meaningful segments, and can be readily used to localize objects in a scene. Furthermore, by clustering the features associated with these segments across a dataset, we can obtain well-delineated, nameable regions, i.e. semantic segmentations. Experiments on complex datasets (Pascal VOC, MS-COCO) demonstrate that our simple spectral method outperforms the state-of-the-art in unsupervised localization and segmentation by a significant margin. Furthermore, our method can be readily used for a variety of complex image editing tasks, such as background removal and compositing.

研究动机与目标

  • 解决在复杂场景中无任何人工标注数据的情况下,实现无监督语义分割与目标定位的挑战。
  • 探究当与现代自监督深度特征结合时,传统谱图方法是否能作为无监督视觉任务的惊人强基线。
  • 实现单张图像中多个语义区域的发现,克服以往方法仅限于单目标检测的局限性。
  • 将该方法扩展至软图像分解(抠图)任务,以支持实际图像编辑应用。

提出的方法

  • 使用自监督特征提取器(如DINO ViT)和颜色相似性,在图像块上构建加权图。
  • 从图的邻接矩阵和度矩阵构建拉普拉斯矩阵,以建模图像的局部与全局结构。
  • 计算拉普拉斯矩阵的特征向量,其中最小的非零特征向量对应于场景中最显著的对象。
  • 对特征向量进行阈值处理,生成初始二值掩码或分割结果,用于目标定位。
  • 利用特征向量对数据集中所有图像区域进行聚类,以分配一致的语义(伪)标签。
  • 通过伪标签数据进行自训练,以优化分割预测并提升性能。

实验结果

研究问题

  • RQ1当与自监督深度特征结合时,谱图方法是否能在无监督语义分割任务中超越现代仅使用深度学习的方法?
  • RQ2深度特征亲和图的特征分解是否能自然地生成语义上有意义的图像区域,而无需额外训练或监督?
  • RQ3该方法是否能有效分割单张复杂图像中的多个不同语义对象,而克服以往方法仅限于每张图像识别一个对象的限制?
  • RQ4该框架在多大程度上可被适配用于软图像抠图任务及实际图像编辑应用?

主要发现

  • 所提方法在无监督语义分割与目标定位任务上达到最先进性能,在PASCAL VOC 2012和MS-COCO上超越MaskContrast及其他SOTA方法。
  • 该方法成功在单张图像中分割出多个不同的语义对象(如一只狗和一只猫),而MaskContrast无法区分多个类别。
  • 使用DINO ViT-B特征,该方法在PASCAL VOC 2012上达到43.6%的mIoU,显著优于此前SOTA的40.2%。
  • 结合自监督特征的谱方法在图像抠图任务中表现出良好泛化能力,生成语义一致的软掩码,适用于前景提取与图像合成。
  • 即使未经微调,该方法在复杂场景中仍表现稳健,证明了谱归纳偏置在无监督设定下的有效性。
  • 该方法在全分辨率下对单张图像进行计算是可行的,支持图像编辑与合成的实际应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。