[论文解读] Weakly-Supervised Semantic Segmentation via Sub-category Exploration
本文提出一种自监督子类别探索方法,通过增强初始类别激活图(CAMs)来改进弱监督语义分割。通过在每个父类别内迭代聚类图像特征并训练子类别目标,模型学习到更完整的物体表征,从而生成更优的CAMs,并在PASCAL VOC 2012数据集上结合CRF优化达到66.1%的SOTA mIoU。
Existing weakly-supervised semantic segmentation methods using image-level annotations typically rely on initial responses to locate object regions. However, such response maps generated by the classification network usually focus on discriminative object parts, due to the fact that the network does not need the entire object for optimizing the objective function. To enforce the network to pay attention to other parts of an object, we propose a simple yet effective approach that introduces a self-supervised task by exploiting the sub-category information. Specifically, we perform clustering on image features to generate pseudo sub-categories labels within each annotated parent class, and construct a sub-category objective to assign the network to a more challenging task. By iteratively clustering image features, the training process does not limit itself to the most discriminative object parts, hence improving the quality of the response maps. We conduct extensive analysis to validate the proposed method and show that our approach performs favorably against the state-of-the-art approaches.
研究动机与目标
- 解决依赖分类网络生成的不准确初始响应图的弱监督语义分割方法的局限性。
- 通过促使网络关注完整物体而非仅判别性局部区域,提升类别激活图(CAMs)的质量。
- 克服CAMs因图像级别分类的优化目标而仅聚焦显著物体部分的倾向。
- 引入自监督子类别发现任务,以增强特征表征,且无需额外标注。
- 通过改进初始预测步骤,实现SOTA性能,从而惠及后续优化与分割阶段。
提出的方法
- 在PASCAL VOC 2012数据集上,对每个父类别(如'aeroplane'、'car')的预训练分类网络提取的特征进行无监督聚类。
- 将所得聚类分配作为伪子类别标签,以自监督方式训练子类别分类头。
- 通过在聚类图像特征与子类别目标微调分类网络之间迭代交替,改进特征表征。
- 将子类别目标整合到训练过程中,以正则化网络并促使网络关注判别性较弱但语义相关的物体部分。
- 利用微调后的网络生成改进的初始响应图(CAMs),并将其作为训练最终分割网络的伪真实标签。
- 应用CRF后处理进一步优化最终分割输出,提升验证集与测试集上的mIoU。

实验结果
研究问题
- RQ1通过无监督聚类进行子类别发现,能否提升弱监督语义分割中初始类别激活图的质量?
- RQ2引入自监督子类别目标是否有助于网络关注完整物体而非仅判别性局部区域?
- RQ3迭代聚类与伪标签训练能否在无额外监督下实现更好的特征表征?
- RQ4与SOTA方法相比,该方法在mIoU和不同类别上的鲁棒性如何?
- RQ5该方法在多大程度上提升了初始响应图质量,以及这种提升如何转化为更优的最终分割性能?
主要发现
- 所提方法在PASCAL VOC 2012测试集上结合CRF优化达到66.1%的mIoU,优于SOTA方法。
- 即使不使用CRF优化,该方法仍达到64.8%的mIoU,与FickleNet的64.9% mIoU相当,表明改进的初始响应图具有强大性能。
- 通过定性示例验证,该方法通过减少对仅判别性局部区域的关注并鼓励关注完整物体,有效改善了初始CAMs。
- 消融实验表明,子类别聚类与迭代训练方案显著提升了特征表征与分割质量。
- 网络能够基于物体大小、类型、上下文及共现模式区分子类别,表明特征实现了有意义的解耦。
- 在使用CRF时,该方法在20个类别中的11个上表现优异,比较表格中最佳结果以红、绿、蓝标示。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。