[论文解读] Adaptive Semantic Segmentation with a Strategic Curriculum of Proxy Labels
本文提出了一种用于语义分割无监督域自适应的战略性课程训练方法,利用目标域的代理标签,并结合来自代理标签目标数据的简单样本挖掘与来自有标签源数据的困难样本挖掘。通过动态平衡地混合这些样本进行训练,并采用双解码器架构来评估预测置信度,该方法在无需对抗性特征对齐的情况下,在合成到真实域自适应基准上实现了最先进性能。
Training deep networks for semantic segmentation requires annotation of large amounts of data, which can be time-consuming and expensive. Unfortunately, these trained networks still generalize poorly when tested in domains not consistent with the training data. In this paper, we show that by carefully presenting a mixture of labeled source domain and proxy-labeled target domain data to a network, we can achieve state-of-the-art unsupervised domain adaptation results. With our design, the network progressively learns features specific to the target domain using annotation from only the source domain. We generate proxy labels for the target domain using the network's own predictions. Our architecture then allows selective mining of easy samples from this set of proxy labels, and hard samples from the annotated source domain. We conduct a series of experiments with the GTA5, Cityscapes and BDD100k datasets on synthetic-to-real domain adaptation and geographic domain adaptation, showing the advantages of our method over baselines and existing approaches.
研究动机与目标
- 解决语义分割中的域偏移问题,即在源域上训练的模型因分布偏移而在目标域上泛化能力差。
- 通过代理标签技术利用未标注的目标域数据,减少对目标域昂贵像素级标注的依赖。
- 通过结合源域和目标域的简单与困难样本的课程化训练策略,提升无监督域自适应性能。
- 设计一种轻量级、非对抗性的架构,通过集成一致度图实现有效样本难度估计。
- 在合成到真实域和跨城市域自适应基准上展示优越性能,且无需显式特征对齐。
提出的方法
- 使用自训练方法,混合有标签的源域数据与代理标签化的目标域数据,迭代提升模型泛化能力。
- 采用双解码器架构,通过分支间预测的一致性生成一致度图,以估计样本难度。
- 应用梯度过滤机制,避免在低一致度(困难)样本上进行更新,将训练重点集中于可靠预测。
- 实施类别加权损失,以缓解源域和目标域中的类别不平衡问题。
- 实施战略性课程调度:逐步增加目标域数据的比例,同时优先选择简单代理标签样本和困难源标签样本。
- 基于置信度进行样本挖掘——从目标域中选择简单样本,从源域中选择困难样本,以引导训练过程。
实验结果
研究问题
- RQ1能否通过结合代理标签化目标数据与源域困难样本的课程化训练策略,提升语义分割中的无监督域自适应性能?
- RQ2通过双解码器一致度估计的不确定性方法,如何提升低资源适应设置下模型的鲁棒性与泛化能力?
- RQ3所提出方法在合成到真实域与跨城市域自适应任务中是否优于现有基于特征对齐的方法?
- RQ4代理标签与选择性样本挖掘在多大程度上可减少自训练过程中的误差放大?
- RQ5当源域与目标域在分辨率和内容上存在显著差异时,该方法是否仍能泛化至如BDD100k等多样化目标域?
主要发现
- 在GTA5 → Cityscapes基准上,该方法实现了48.4的mIoU(平均交并比),为当前最先进性能,且仅使用GTA5标签,优于所有先前的无监督域自适应方法。
- 在19个类别中的9个类别上,该方法的IoU优于最佳现有方法,尤其在car和person等类别上提升显著。
- 通过基于预测一致度的梯度过滤机制,有效减少了自训练过程中的误差放大,实现了更稳定的收敛。
- 双解码器一致度图能有效突出模糊区域与类别边界,为模型不确定性的可视化提供了可解释性。
- 在BDD100k上,该方法也表现出具有竞争力的性能,从GTA5进行域自适应的mIoU略高于从Cityscapes迁移,表明其在合成到真实域自适应任务中具有强大适用性。
- 该方法与CyCADA等对抗性特征对齐方法具有正交性,两者可结合以进一步提升性能,但超参数调优仍具挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。