[论文解读] SegDiscover: Visual Concept Discovery via Unsupervised Semantic Segmentation
SegDiscover 提出了一种无监督的视觉概念发现框架,通过将任务重新定义为无监督语义分割,利用自监督特征学习和神经网络优化,在无需人工标注的情况下,从复杂场景中发现一致的、多概念的图像区域。该方法在 Cityscapes 和 COCO-Stuff 数据集上达到最先进性能,优于以往的无监督方法,并通过不同预训练编码器揭示了可解释的、基于概念的解释。
Visual concept discovery has long been deemed important to improve interpretability of neural networks, because a bank of semantically meaningful concepts would provide us with a starting point for building machine learning models that exhibit intelligible reasoning process. Previous methods have disadvantages: either they rely on labelled support sets that incorporate human biases for objects that are "useful," or they fail to identify multiple concepts that occur within a single image. We reframe the concept discovery task as an unsupervised semantic segmentation problem, and present SegDiscover, a novel framework that discovers semantically meaningful visual concepts from imagery datasets with complex scenes without supervision. Our method contains three important pieces: generating concept primitives from raw images, discovering concepts by clustering in the latent space of a self-supervised pretrained encoder, and concept refinement via neural network smoothing. Experimental results provide evidence that our method can discover multiple concepts within a single image and outperforms state-of-the-art unsupervised methods on complex datasets such as Cityscapes and COCO-Stuff. Our method can be further used as a neural network explanation tool by comparing results obtained by different encoders.
研究动机与目标
- 解决在复杂自然图像中无人工标注监督下发现语义上有意义的视觉概念的挑战。
- 克服以往方法依赖标注支持集或仅关注显著前景对象所带来的偏差。
- 实现在单张图像中同时发现多个一致的概念,包括背景和上下文元素。
- 通过从神经网络激活中生成基于概念的解释,为可解释机器学习提供基础。
- 证明自监督编码器可产生优于监督编码器的视觉概念发现效果,原因在于减少了标注偏差。
提出的方法
- 通过无监督图像分割生成概念原型,从原始图像中提取补丁级或超像素级区域。
- 在自监督预训练卷积编码器的潜在空间中对这些原型进行聚类,以发现视觉概念。
- 通过神经网络训练过程对发现的概念进行优化,将聚类标签映射回图像,并学习预测伪分割标签。
- 使用多种自监督编码器(MoCo、SwAV、DeepCluster-V2)和一个监督的 ImageNet 编码器,比较概念发现性能与可解释性。
- 在潜在空间聚类步骤中采用 K=100 的过聚类策略,以提升分割质量并减少过拟合。
- 通过 Cityscapes 和 COCO-Stuff 上的 mIoU、wIoU 和 pAcc 进行结果验证,并对不同编码器的特征图进行定性分析。
实验结果
研究问题
- RQ1是否可以在无需任何人工标注监督的情况下,从复杂的真实世界场景中发现视觉概念?
- RQ2框架能否在同一张图像中同时识别出多个不同的概念,包括背景和上下文元素?
- RQ3预训练编码器的选择(自监督 vs. 监督)如何影响发现的视觉概念的质量与可解释性?
- RQ4所发现的概念能否作为基础,通过基于概念的显著性图解释神经网络行为?
- RQ5在优化过程中引入全局上下文信息是否能提升发现概念的一致性与准确性?
主要发现
- SegDiscover 在 Cityscapes 和 COCO-Stuff 数据集上实现了无监督语义分割的最先进性能,分别使用 SwAV 和 DeepCluster-V2 编码器获得 13.62 和 14.34 的 mIoU。
- 使用自监督编码器(尤其是 DeepCluster-V2)的性能优于使用监督的 ImageNet 分类器,pAcc 提升超过 4 个百分点。
- 该方法成功在单张图像中发现多个一致的视觉概念,包括非显著和背景元素,如墙壁、天花板和远处的植物。
- 使用 DeepCluster-V2 的 SegDiscover 在 COCO-Stuff 上优于当前最先进方法(PiCIE),展现出更优的泛化能力和概念一致性。
- 定性分析表明,不同编码器生成的特征图存在差异——例如,MoCo 倾向于生成更小的分割区域,而 SwAV 有时会将建筑物部分误分类为“地面”——表明编码器具有依赖于自身的归纳偏差。
- 该框架支持基于概念的神经网络解释:不同编码器会突出显示不同的关注区域,揭示其学习表征中的结构差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。