[论文解读] Cross-Dataset Collaborative Learning for Semantic Segmentation.
本文提出跨数据集协同学习(CDCL),一种通过使用数据集感知模块(DABs)和数据集交替训练(DAT)在多个数据集上训练以增强语义分割泛化能力的方法。该方法在不增加额外浮点运算量(FLOPs)的情况下实现了最先进性能,在Cityscapes、BDD100K和CamVid上的mIoU分别较单数据集基线模型提升5.65%、6.57%和5.79%。
Recent work attempts to improve semantic segmentation performance by exploring well-designed architectures on a target dataset. However, it remains challenging to build a unified system that simultaneously learns from various datasets due to the inherent distribution shift across different datasets. In this paper, we present a simple, flexible, and general method for semantic segmentation, termed Cross-Dataset Collaborative Learning (CDCL). Given multiple labeled datasets, we aim to improve the generalization and discrimination of feature representations on each dataset. Specifically, we first introduce a family of Dataset-Aware Blocks (DAB) as the fundamental computing units of the network, which help capture homogeneous representations and heterogeneous statistics across different datasets. Second, we propose a Dataset Alternation Training (DAT) mechanism to efficiently facilitate the optimization procedure. We conduct extensive evaluations on four diverse datasets, i.e., Cityscapes, BDD100K, CamVid, and COCO Stuff, with single-dataset and cross-dataset settings. Experimental results demonstrate our method consistently achieves notable improvements over prior single-dataset and cross-dataset training methods without introducing extra FLOPs. Particularly, with the same architecture of PSPNet (ResNet-18), our method outperforms the single-dataset baseline by 5.65\%, 6.57\%, and 5.79\% of mIoU on the validation sets of Cityscapes, BDD100K, CamVid, respectively. Code and models will be released.
研究动机与目标
- 解决在多样化语义分割数据集之间存在的分布偏移挑战。
- 提升跨多个数据集的特征表示泛化能力与判别能力。
- 开发一种灵活、统一的训练框架,利用多个标注数据集而不增加计算成本。
- 在不修改网络结构的前提下,实现在多样化数据集上的一致性能提升。
提出的方法
- 引入数据集感知模块(DABs)作为可学习单元,以捕捉跨数据集的同质与异质统计特性。
- 设计数据集交替训练(DAT)策略,在优化过程中交替使用不同数据集,提升收敛速度与特征多样性。
- 采用共享主干网络(如使用ResNet-18的PSPNet),并在多个阶段插入DABs以适应不同数据集的统计特性。
- 采用多数据集训练调度策略,每个训练步骤从不同数据集中采样,实现跨数据集知识迁移。
- 通过仅增加参数高效的DAB模块,避免引入额外FLOPs,从而保持推理效率。
- 使用标准语义分割损失进行端到端优化,无需额外正则化或辅助头。
实验结果
研究问题
- RQ1在多个数据集上联合训练的统一模型,是否能相比单数据集训练在语义分割中实现更好的泛化性能?
- RQ2如何使模型在存在显著领域偏移的数据集中有效学习,同时保持高效性?
- RQ3哪些网络组件能够实现有效的跨数据集知识迁移,且不增加FLOPs?
- RQ4在训练过程中交替使用不同数据集,是否能增强特征判别力与泛化能力?
- RQ5所提出方法是否能在多样化基准上超越现有的单数据集与多数据集训练方法?
主要发现
- 与单数据集PSPNet(ResNet-18)基线相比,CDCL在Cityscapes上mIoU提升5.65%。
- 在BDD100K上,该方法实现了6.57%的mIoU增益,表明其在多样化城市驾驶场景中具有强大的泛化能力。
- 在CamVid上,CDCL实现了5.79%的mIoU提升,证实其在分辨率和标注质量各异的数据集中具备鲁棒性。
- 性能增益在所有四个评估数据集(Cityscapes、BDD100K、CamVid和COCO Stuff)上均保持一致。
- 该方法在不引入任何额外FLOPs的前提下实现性能提升,保持了推理效率。
- 消融实验表明,DABs与DAT均对性能增益至关重要,任一组件的移除均导致mIoU显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。