[论文解读] Multi-level Domain Adaptive learning for Cross-Domain Detection
本文提出了一种多层级域自适应 Faster R-CNN,通过在不同特征尺度上使用多个域分类器,联合对齐跨域的全局与局部特征分布,显著提升了跨域目标检测性能。该方法通过分层特征监督实现更强的对抗性训练,在 Foggy Cityscapes、KITTI 和 SIM10k 基准上实现了最先进(SOTA)的 mAP 提升。
In recent years, object detection has shown impressive results using supervised deep learning, but it remains challenging in a cross-domain environment. The variations of illumination, style, scale, and appearance in different domains can seriously affect the performance of detection models. Previous works use adversarial training to align global features across the domain shift and to achieve image information transfer. However, such methods do not effectively match the distribution of local features, resulting in limited improvement in cross-domain object detection. To solve this problem, we propose a multi-level domain adaptive model to simultaneously align the distributions of local-level features and global-level features. We evaluate our method with multiple experiments, including adverse weather adaptation, synthetic data adaptation, and cross camera adaptation. In most object categories, the proposed method achieves superior performance against state-of-the-art techniques, which demonstrates the effectiveness and robustness of our method.
研究动机与目标
- 解决目标检测中的域偏移问题,其中光照、风格、尺度和外观的变化会降低模型在不同域之间的性能。
- 克服现有域自适应方法在有效对齐局部特征方面的局限性,从而在大域偏移下实现更优的检测效果。
- 通过在不同网络深度引入多个域分类器,提升特征分布对齐能力,增强对抗性训练效果。
- 通过仅在训练阶段使用域分类器,而非推理阶段,保持推理效率。
- 在多种跨域场景下实现稳健性能,包括恶劣天气、合成数据以及跨摄像头设置。
提出的方法
- 提出一种多层级域自适应 Faster R-CNN,通过在不同特征提取阶段(如 RPN 和 ROI 池化层)引入多个域分类器,监督特征对齐。
- 使用梯度反转层(GRLs)实现端到端对抗性训练,使域分类器的梯度反向传播以更新主干网络。
- 应用多尺度域分类器,对齐全局特征(图像级)与局部特征(实例级),提升对域偏移的鲁棒性。
- 设计模型使低层级特征提取器接收来自所有后续域分类器的梯度,增强其欺骗分类器的能力,从而改善对齐效果。
- 使用 t-SNE 可视化分析并验证源域与目标域之间特征分布对齐的有效性。
- 仅使用源域标注与目标域无标签图像进行训练,从而保持推理效率。
实验结果
研究问题
- RQ1在跨域目标检测中,使用多个域分类器进行多层级对抗性训练,能否有效提升局部与全局特征对齐?
- RQ2与单层级或仅全局对齐的方法相比,多层级域自适应在处理大域偏移时表现如何?
- RQ3使用多个域分类器是否能增强模型在雾天天气、合成数据以及跨摄像头设置等多样化域中的鲁棒性与泛化能力?
- RQ4在小域偏移场景下,多层级自适应在多大程度上可减少性能退化,避免域自适应带来的不稳定性?
- RQ5来自多个域分类器的分层梯度流如何影响不同网络深度特征提取器的学习能力?
主要发现
- 在 Foggy Cityscapes 基准上,所提方法达到 40.7 的平均平均精度(mAP),显著优于基线模型(34.0)与 DA 模型(34.4),证明其在恶劣天气适应任务中的强大性能。
- 在从 Cityscapes 到 KITTI 的跨摄像头适应任务中,所提方法达到 40.7 的 mAP,超越基线(34.0)与 DA 模型(34.4),尤其在行人、骑行人与卡车的检测上表现更优。
- 在 SIM10k 适应实验中,模型实现了最先进性能,验证了其在合成数据到真实数据迁移中的有效性。
- t-SNE 可视化结果表明,与 DA 模型相比,所提方法能更有效地对齐全局与局部特征,尤其减少了局部特征的错位。
- 该模型显著降低了误报与误分类现象——例如,能正确将公交车识别为公交车而非卡车,尤其在雾天等复杂条件下表现更优。
- 由于多个域分类器仅在训练阶段使用,推理阶段不参与,因此该方法保持了高效的推理速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。