[论文解读] Synergizing between Self-Training and Adversarial Learning for Domain Adaptive Object Detection
本文提出了一种基于不确定性的引导框架,通过协同结合自训练与对抗学习,实现领域自适应目标检测。通过利用蒙特卡洛丢弃法估计分类与定位任务中的预测不确定性,该方法将低不确定性检测结果作为伪标签用于自监督学习,同时将高不确定性区域作为图像块用于对抗特征对齐,在多种领域偏移场景下实现了显著领先于当前最先进方法的性能表现。
We study adapting trained object detectors to unseen domains manifesting significant variations of object appearance, viewpoints and backgrounds. Most current methods align domains by either using image or instance-level feature alignment in an adversarial fashion. This often suffers due to the presence of unwanted background and as such lacks class-specific alignment. A common remedy to promote class-level alignment is to use high confidence predictions on the unlabelled domain as pseudo labels. These high confidence predictions are often fallacious since the model is poorly calibrated under domain shift. In this paper, we propose to leverage model predictive uncertainty to strike the right balance between adversarial feature alignment and class-level alignment. Specifically, we measure predictive uncertainty on class assignments and the bounding box predictions. Model predictions with low uncertainty are used to generate pseudo-labels for self-supervision, whereas the ones with higher uncertainty are used to generate tiles for an adversarial feature alignment stage. This synergy between tiling around the uncertain object regions and generating pseudo-labels from highly certain object regions allows us to capture both the image and instance level context during the model adaptation stage. We perform extensive experiments covering various domain shift scenarios. Our approach improves upon existing state-of-the-art methods with visible margins.
研究动机与目标
- 解决在源域上训练的模型在目标域(具有不同外观、视角和背景)上泛化能力下降的领域偏移问题。
- 克服现有方法依赖置信度的伪标签生成或图像级对抗对齐所导致的校准性差与缺乏类别特定对齐的局限性。
- 通过合理的不确定性估计,平衡自训练与对抗学习,提升模型泛化能力,减少不可靠伪标签带来的噪声,并增强特征的判别性。
- 开发一种简单、通用且高效的框架,兼容计算轻量级的一阶段无锚框检测器,实现在无需复杂架构的前提下有效适应。
提出的方法
- 通过在多次前向传播中测量方差,利用蒙特卡洛丢弃法估计目标检测中的预测不确定性,同时考虑分类置信度与边界框定位预测。
- 将低不确定性检测结果用作高质量伪标签,实现对未标注目标域的可靠自监督。
- 提取以高不确定性检测为中心的图像块,作为对抗特征对齐的输入,保留实例级上下文信息,促进鲁棒的领域对齐。
- 在两轮优化流程中整合不确定性引导的伪标签生成(UGPL)与不确定性引导的图像块裁剪(UGT):R0 用于初始适应,R1/R2 用于基于不确定性感知选择的迭代优化。
- 应用领域判别器,将来自目标域图像块的特征与源域特征对齐,最小化领域差异,同时保留类别特定的判别性特征。
- 采用计算高效的单阶段无锚框检测器(如基于 YOLO 的模型)作为骨干网络,确保在多种适应场景下的实用性与可扩展性。
实验结果
研究问题
- RQ1如何在目标检测中有效估计预测不确定性,以同时指导自训练与对抗适应?
- RQ2将高置信度检测用于伪标签生成、高不确定性检测用于对抗图像块裁剪,是否相比基于置信度的选择策略能显著提升领域适应性能?
- RQ3不确定性引导的自训练与对抗学习平衡在多大程度上可减轻模型在领域偏移下校准不良带来的负面影响?
- RQ4实例级上下文(通过图像块裁剪实现)与类别级监督(通过伪标签实现)之间的协同作用,是否能带来更强的特征判别性与跨领域泛化能力?
主要发现
- 所提出的不确定性引导方法在多个领域自适应基准测试中达到最先进性能,包括 Cityscapes、Foggy Cityscapes 和 KITTI,其中在 Sim10K → Cityscapes 上达到 51.8% AP@0.5。
- 结合不确定性引导伪标签生成(UGPL)与不确定性引导图像块裁剪(UGT)的策略性能最高,相比单一组件最高提升 3.4% AP@0.5。
- UGT 策略(在不确定检测周围裁剪图像块)在所有图像块选择方法中带来最大增益,当与 UGPL 结合时,优于全图、随机选择与确定性图像块基线方法。
- R0 轮次(初始适应)贡献显著,但通过 R1 和 R2 轮次采用不确定性感知的迭代优化进一步提升了性能,证明了迭代不确定性选择的优势。
- 与基于置信度的选择相比,该方法显著减少了伪标签中的噪声,表现为所选伪标签的平均准确率更高,且在漏检实例上的检测召回率更优。
- 尽管性能有所提升,该方法在小目标检测方面仍存在困难,提示未来需进一步研究不确定性与目标尺寸之间的相互作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。