[论文解读] Transformer-CNN Cohort: Semi-supervised Semantic Segmentation by the Best of Both Students
该论文提出了一种新型的半监督语义分割框架——Transformer-CNN 协同网络(TCC),该框架采用视觉变换器(ViT)和卷积神经网络(CNN)作为双学生模型。通过引入类别感知特征一致性蒸馏(CFCD)和一致性感知交叉蒸馏(CCD),TCC 在伪标签的基础上实现了特征空间与预测空间的多层次一致性,从而在 Cityscapes 和 Pascal VOC 2012 数据集上取得了最先进性能,相较于以往方法显著提升了准确率。
The popular methods for semi-supervised semantic segmentation mostly adopt a unitary network model using convolutional neural networks (CNNs) and enforce consistency of the model's predictions over perturbations applied to the inputs or model. However, such a learning paradigm suffers from two critical limitations: a) learning the discriminative features for the unlabeled data; b) learning both global and local information from the whole image. In this paper, we propose a novel Semi-supervised Learning (SSL) approach, called Transformer-CNN Cohort (TCC), that consists of two students with one based on the vision transformer (ViT) and the other based on the CNN. Our method subtly incorporates the multi-level consistency regularization on the predictions and the heterogeneous feature spaces via pseudo-labeling for the unlabeled data. First, as the inputs of the ViT student are image patches, the feature maps extracted encode crucial class-wise statistics. To this end, we propose class-aware feature consistency distillation (CFCD) that first leverages the outputs of each student as the pseudo labels and generates class-aware feature (CF) maps for knowledge transfer between the two students. Second, as the ViT student has more uniform representations for all layers, we propose consistency-aware cross distillation (CCD) to transfer knowledge between the pixel-wise predictions from the cohort. We validate the TCC framework on Cityscapes and Pascal VOC 2012 datasets, which outperforms existing SSL methods by a large margin.
研究动机与目标
- 为解决现有半监督学习(SSL)方法在语义分割中的局限性,特别是其在有效学习全局与局部特征方面的能力不足,以及难以利用异构模型之间的互补知识。
- 克服仅依赖一致性正则化的单架构 SSL 模型所面临的限制,此类方法常导致特征与预测的冗余。
- 探索视觉变换器(ViT)与 CNN 如何通过在异构特征空间与预测头之间迁移知识,协同提升半监督分割性能。
- 实现不仅在预测层面,而且在特征层面的有效伪标签化,利用类别感知特征图提升特征层面的一致性。
- 证明即使在未进行 ImageNet 预训练的情况下,异构模型组(ViT + CNN)仍可超越同构模型组在 SSL 中的表现。
提出的方法
- TCC 框架采用两种不同的学生模型:一种基于视觉变换器(ViT),另一种基于卷积神经网络(CNN),构成异构模型组。
- 提出类别感知特征一致性蒸馏(CFCD),通过从伪标签预测中生成类别感知特征(CF)图,实现两模型间知识迁移,从而实现特征层面的一致性正则化。
- 一致性感知交叉蒸馏(CCD)通过在模型组间蒸馏预测结果,强制 ViT 与 CNN 学生在像素级别上的预测保持一致,提升预测层面的鲁棒性。
- 对未标记数据应用伪标签化,以生成预测与特征层面的监督信号,其中 CF 图通过聚合具有相同伪标签的像素特征计算得到。
- 框架采用多层级一致性正则化:CFCD 作用于中间特征图,而 CCD 作用于最终的分割预测,确保互补知识的传递。
- 该方法通过联合使用标注数据上的监督损失与未标注数据上的一致性损失(CFCD 与 CCD)进行端到端训练,无需在 ImageNet 上进行预训练。
实验结果
研究问题
- RQ1基于 ViT 与 CNN 的异构双学生框架是否能够超越单架构模型,在半监督语义分割中实现更优性能?
- RQ2在 SSL 背景下,如何有效实现架构本质不同的模型(如 MSA 与 Conv)之间的知识迁移?
- RQ3通过类别感知特征图实现的特征层面伪标签化,是否相比仅预测层面的伪标签化,能提升模型泛化能力与特征可分性?
- RQ4能否在异构特征空间与预测头之间有效应用一致性正则化,以增强模型鲁棒性与性能?
- RQ5在未进行 ImageNet 预训练的情况下,双学生框架在从零开始训练时,其性能相对于最先进方法的提升程度如何?
主要发现
- TCC 在 Cityscapes 与 Pascal VOC 2012 上均达到最先进性能,显著超越以往 SSL 方法,包括先前的 SoTA 方法 CPS。
- 在 Pascal VOC 2012 数据集上,当标签率为 1/8 时,TCC-S 达到 82.32% 的 mIoU,较仅使用标注数据的全监督训练提升了 5.49%。
- 即使未进行 ImageNet 预训练,TCC-S 仍超越依赖预训练模型的先前 SoTA 方法,证明其能从未标记数据中实现强大泛化能力。
- 消融实验表明,CFCD 与 CCD 损失在所有标签率下均对 mIoU 有正向贡献,且随着未标记数据减少,CFCD 的增益趋于饱和。
- TSNE 可视化结果表明,CFCD 提升了类别间特征可分性,使特征更具判别性并降低类内方差。
- 在推理中,基于 ViT 的学生模型始终优于基于 CNN 的学生模型,验证了 MSA 表示在模型组中具有更优的特征学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。