[论文解读] Universal Semi-Supervised Semantic Segmentation
本文提出了一种通用的弱监督语义分割框架,通过使用少量标注数据和大量未标注数据,在多个领域上联合训练单一模型,利用像素感知的熵正则化方法对齐具有非重叠标签空间的领域间特征。该方法在Cityscapes、SUN和IDD等多样化数据集上实现了最先进性能,即使每个领域仅使用1500个标注样本,也优于监督学习和联合训练基线模型。
In recent years, the need for semantic segmentation has arisen across several different applications and environments. However, the expense and redundancy of annotation often limits the quantity of labels available for training in any domain, while deployment is easier if a single model works well across domains. In this paper, we pose the novel problem of universal semi-supervised semantic segmentation and propose a solution framework, to meet the dual needs of lower annotation and deployment costs. In contrast to counterpoints such as fine tuning, joint training or unsupervised domain adaptation, universal semi-supervised segmentation ensures that across all domains: (i) a single model is deployed, (ii) unlabeled data is used, (iii) performance is improved, (iv) only a few labels are needed and (v) label spaces may differ. To address this, we minimize supervised as well as within and cross-domain unsupervised losses, introducing a novel feature alignment objective based on pixel-aware entropy regularization for the latter. We demonstrate quantitative advantages over other approaches on several combinations of segmentation datasets across different geographies (Germany, England, India) and environments (outdoors, indoors), as well as qualitative insights on the aligned representations.
研究动机与目标
- 解决在户外驾驶场景和室内环境等多样化领域中进行语义分割数据标注的高成本与冗余问题。
- 开发一种统一模型,可在标签空间无重叠的前提下,以极少标注数据实现跨领域泛化。
- 利用每个领域的大规模未标注数据提升模型性能,而无需进行领域特定的微调或训练独立模型。
- 克服现有方法在真实语义分割应用中面临的问题,如领域偏移、灾难性遗忘和标签空间不匹配。
提出的方法
- 联合使用少量标注样本的监督损失和大量未标注数据的无监督熵正则化损失,对单一深度神经网络在多个数据集上进行联合训练。
- 提出一种基于像素级熵最小化的新型特征对齐目标,以促进不同领域间的一致性预测。
- 计算编码器特征图与类别原型(标签嵌入)之间的相似度得分,并最小化该分布的熵以优化预测结果。
- 同时应用领域内和跨领域熵最小化策略,实现在标签集非重叠情况下的特征对齐。
- 采用空洞残差网络并以ResNet-50为主干网络,提取适合密集预测任务的高分辨率特征。
- 通过结合监督损失与无监督损失的多任务学习目标,端到端优化模型。
实验结果
研究问题
- RQ1是否可以仅使用有限标注数据,在标签空间非重叠的多个语义分割数据集上有效训练单一模型?
- RQ2基于熵的特征对齐在光照、天气和场景内容存在领域偏移的情况下,如何提升跨领域的泛化能力?
- RQ3与监督学习或联合训练基线相比,来自多样化领域的未标注数据能在多大程度上提升模型性能?
- RQ4当标签语义相似但不完全相同时,基于熵正则化的跨领域特征对齐是否仍能带来更好的表征学习效果?
主要发现
- 所提方法在通用分割基准上仅使用每个领域1500个标注样本,即实现了50.52%的mIoU,显著优于基线模型Univ-basic(44.78% mIoU)。
- 在Cityscapes和SUN数据集上,模型分别达到57.91%和43.12%的mIoU,超越联合训练基线,展现出强大的跨领域迁移能力。
- 尽管仅使用SUN-RGBD训练数据的28%且未使用合成数据,模型仍达到了SceneNet报告mIoU的88%(SceneNet使用5300个标注样本和合成RGB-D数据)。
- t-SNE可视化结果表明,语义上相似的类别(如“Road”和“Floor”)在特征空间中被一致地对齐,即使标签空间无重叠。
- 模型显著降低了跨领域的预测熵,表明在未见领域上的预测更加自信且一致。
- 在标注数据稀缺的弱监督设置下,熵最小化优于基于对抗损失的方法,尤其在标注数据有限时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。