[论文解读] Causal Unsupervised Semantic Segmentation
CAUSE 提出了一种因果无监督语义分割框架,通过使用概念聚类手册作为中介,实现按概念的自监督学习,通过显式建模聚类粒度来实现最先进性能,采用前门调整方法。该方法在无需任何像素级标注的情况下,实现了对人部、车辆等细粒度概念的分割,性能优于以往的无监督方法。
Unsupervised semantic segmentation aims to achieve high-quality semantic grouping without human-labeled annotations. With the advent of self-supervised pre-training, various frameworks utilize the pre-trained features to train prediction heads for unsupervised dense prediction. However, a significant challenge in this unsupervised setup is determining the appropriate level of clustering required for segmenting concepts. To address it, we propose a novel framework, CAusal Unsupervised Semantic sEgmentation (CAUSE), which leverages insights from causal inference. Specifically, we bridge intervention-oriented approach (i.e., frontdoor adjustment) to define suitable two-step tasks for unsupervised prediction. The first step involves constructing a concept clusterbook as a mediator, which represents possible concept prototypes at different levels of granularity in a discretized form. Then, the mediator establishes an explicit link to the subsequent concept-wise self-supervised learning for pixel-level grouping. Through extensive experiments and analyses on various datasets, we corroborate the effectiveness of CAUSE and achieve state-of-the-art performance in unsupervised semantic segmentation.
研究动机与目标
- 为解决无监督语义分割中的聚类目标不明确问题,即在缺乏监督的情况下,难以明确聚类目标及其方式。
- 通过在多层抽象层次上显式建模概念原型,提升分割的粒度。
- 利用因果推断(特别是前门调整)来解耦无监督像素级分组中的混淆因素。
- 通过使用离散化中介阻断未观测混淆因子的后门路径,实现按概念的自监督学习。
- 在无需任何人工标注分割掩码的情况下,在 COCO-Stuff 和 Cityscapes 上实现最先进性能。
提出的方法
- 构建一个概念聚类手册 M,作为跨多粒度层次的概念原型的离散化中介,作为预训练特征 T 与语义组 Y 之间的因果中介。
- 应用前门调整,通过将 M 作为因果估计的充分统计量,阻断来自未观测混淆因子 U 的后门路径。
- 使用按概念对比学习训练分割头,其中正样本对通过 M 的离散化索引定义,负样本对从其他概念中采样。
- 采用两阶段训练流程:首先通过聚类算法(如层次聚类、谱聚类、K-means++)学习概念聚类手册 M;其次使用松弛化的正负样本采样方式训练分割头。
- 集成全连接条件随机场(CRF)和概念库,以优化预测结果并提升定位精度,尤其在细粒度类别上表现更优。
- 控制超参数如正样本松弛 φ⁺ 和负样本松弛 φ⁻,以优化对比学习性能。
实验结果
研究问题
- RQ1在无监督条件下,如何定义无监督语义分割中合适的聚类粒度?
- RQ2能否利用因果推断(特别是前门调整)来结构化无监督像素级分组,从而提升分割粒度?
- RQ3与端到端聚类相比,构建离散化概念聚类手册作为中介是否能提升无监督语义分割的质量?
- RQ4不同聚类方法和聚类数量如何影响 CAUSE 框架中概念聚类手册的性能?
- RQ5CAUSE 在不同自监督预训练方法和数据集类别上的泛化能力如何?
主要发现
- CAUSE 在 COCO-Stuff 和 Cityscapes 上均实现了最先进性能,使用 ViT-B/8 时在 COCO-Stuff 上达到 41.9% mIoU 和 74.9% pAcc,优于以往无监督方法。
- 消融实验表明,概念库与 CRF 的结合使 mIoU 相比基线提升 4.5%,凸显其在优化预测中的关键作用。
- 使用层次聚类并设置聚类手册中 2048 个概念时,性能接近饱和,表明在此之后收益递减。
- 当正样本松弛 φ⁺ 设为 0.4、负样本松弛 φ⁻ 设为 0.55 时,对比学习性能达到最优,偏离此值则 mIoU 显著下降。
- CAUSE 在 COCO-171(171 个类别)上保持强劲性能,达到 28.0% mIoU 和 90.8% pAcc,表明其对类别复杂度增加具有鲁棒性。
- 可视化对比显示,CAUSE 能够在预期粒度下成功分割细粒度概念,如人、运动、车辆,而基线方法则存在过聚类或欠聚类问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。