[论文解读] Self-Supervised Learning of Object Parts for Semantic Segmentation
本文提出 Leopart,一种自监督方法,通过视觉变换器(ViT)空间标记的密集聚类来学习物体部件,以提升语义分割性能。通过利用 ViT 注意力机制和一种新颖的掩蔽任务,Leopart 在 Pascal VOC、COCO-Thing 和 COCO-Stuff 基准上实现了最先进性能,其在可迁移表征学习和完全无监督分割方面均超越了以往的自监督与有监督方法。
Progress in self-supervised learning has brought strong general image representation learning methods. Yet so far, it has mostly focused on image-level learning. In turn, tasks such as unsupervised image segmentation have not benefited from this trend as they require spatially-diverse representations. However, learning dense representations is challenging, as in the unsupervised context it is not clear how to guide the model to learn representations that correspond to various potential object categories. In this paper, we argue that self-supervised learning of object parts is a solution to this issue. Object parts are generalizable: they are a priori independent of an object definition, but can be grouped to form objects a posteriori. To this end, we leverage the recently proposed Vision Transformer's capability of attending to objects and combine it with a spatially dense clustering task for fine-tuning the spatial tokens. Our method surpasses the state-of-the-art on three semantic segmentation benchmarks by 17%-3%, showing that our representations are versatile under various object definitions. Finally, we extend this to fully unsupervised segmentation - which refrains completely from using label information even at test-time - and demonstrate that a simple method for automatically merging discovered object parts based on community detection yields substantial gains.
研究动机与目标
- 为解决语义分割中有效自监督密集表征学习的不足,特别是在无监督或弱监督设置下。
- 通过学习可泛化的物体部件,克服预定义物体定义的脆弱性,使部件可事后组合为物体。
- 通过学习语义结构化、空间判别性标记嵌入,改进基于 ViT 的自监督模型,且无需依赖人工标注。
- 通过在聚类共现网络上应用社区检测,自动合并学习到的物体部件,实现完全无监督语义分割。
提出的方法
- 利用经过 DINO 预训练的视觉变换器(ViT)从图像块中提取空间标记。
- 引入一种密集聚类掩蔽任务,基于特征相似性对空间标记进行分组,促使模型学习语义上有意义的物体部件。
- 采用对比聚类方法并结合动量编码器,以稳定训练并提升不同图像块之间的特征判别能力。
- 在聚类共现网络上应用社区检测,自动将学习到的物体部件合并为连贯的物体分割区域,实现完全无监督设置下的分割。
- 采用两阶段推理流程:第一阶段为基于聚类的前景提取(CBFE),利用注意力图和聚类掩码;第二阶段为在前景标记上使用 K-Means 进行过聚类。
- 构建一个聚类共现网络,其中节点代表学习到的聚类,边代表空间共现关系,从而支持社区检测以形成更高层级的类物体分割。

实验结果
研究问题
- RQ1通过密集聚类进行自监督物体部件学习,能否提升基于 ViT 的密集表征质量,以用于语义分割?
- RQ2将物体部件作为可泛化的中间表征,是否在下游语义分割任务中优于直接的自监督预训练?
- RQ3能否仅使用学习到的物体部件和社区检测构建完全无监督的分割流程,且在推理阶段完全不依赖人工标注?
- RQ4在不同物体定义和数据集上,该方法与有监督及半监督基线相比,在可迁移性和性能方面表现如何?
主要发现
- Leopart 在 DINO 自监督 ViT 的基础上,将前景提取的 Jaccard 距离提升 9%,边界 F1 分数提升 9%,优于专门的无监督显著性估计方法。
- 在 Pascal VOC、COCO-Thing 和 COCO-Stuff 基准上,Leopart 实现了最先进性能,mIoU 相较于以往自监督与有监督方法提升 3% 至 17%。
- CBFE(基于聚类的前景提取)与社区检测(CD)的结合,使完全无监督分割性能相比以往无监督方法提升超过 6%。
- 社区检测成功识别出语义一致的物体部件,如将自行车轮和汽车轮分别识别为独立聚类,并将语义相似的部件(如人脸与头发)归入同一社区。
- 该方法证明,通过自监督学习到的物体部件可依据不同定义动态重组为物体,展现出在不同粒度基准下的高度灵活性。
- 尽管 ViT 在物体定位方面表现强劲,但若不通过所提出的密集聚类损失进行微调,其无法学习到具有判别性的空间嵌入用于分割。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。