Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptive YOLO for One-Stage Cross-Domain Detection

Shizhao Zhang, Hongya Tuo|arXiv (Cornell University)|Jun 26, 2021
Domain Adaptation and Few-Shot Learning参考文献 32被引用 15
一句话总结

本文提出域自适应 YOLO(DA-YOLO),一种新颖的单阶段目标检测器域自适应框架,通过整合图像级与实例级特征对齐以减少域偏移。通过引入回归图像对齐(RIA)、多尺度实例对齐(MSIA)以及多层级一致性正则化(MLCR),DA-YOLO 在跨域检测基准上实现了最先进性能,在某些设置下相较基于 Faster R-CNN 的方法实现了高达 17.6% 的 mAP 提升。

ABSTRACT

Domain shift is a major challenge for object detectors to generalize well to real world applications. Emerging techniques of domain adaptation for two-stage detectors help to tackle this problem. However, two-stage detectors are not the first choice for industrial applications due to its long time consumption. In this paper, a novel Domain Adaptive YOLO (DA-YOLO) is proposed to improve cross-domain performance for one-stage detectors. Image level features alignment is used to strictly match for local features like texture, and loosely match for global features like illumination. Multi-scale instance level features alignment is presented to reduce instance domain shift effectively , such as variations in object appearance and viewpoint. A consensus regularization to these domain classifiers is employed to help the network generate domain-invariant detections. We evaluate our proposed method on popular datasets like Cityscapes, KITTI, SIM10K and etc.. The results demonstrate significant improvement when tested under different cross-domain scenarios.

研究动机与目标

  • 解决单阶段目标检测器中的域偏移问题,该类模型在因光照、视角和图像质量分布变化而跨域部署时性能会下降。
  • 克服现有域自适应方法主要针对两阶段检测器(如 Faster R-CNN)设计的局限性,后者因速度过慢而不适用于实时工业应用。
  • 为 YOLOv3 开发统一的域自适应框架,实现在无需依赖区域建议网络的前提下,有效实现图像级与实例级特征对齐。
  • 提升真实世界场景(如自动驾驶)中的跨域泛化能力,其中测试数据常在天气、相机角度和图像清晰度方面与训练数据不同。

提出的方法

  • 提出回归图像对齐(RIA),在 YOLOv3 的不同特征图层使用三个域分类器,并采用递减权重,以在局部特征(如纹理)上施加更严格的对齐,在全局特征(如光照)上施加更宽松的对齐。
  • 引入多尺度实例对齐(MSIA),在 YOLOv3 的三个尺度预测上分别应用实例级域分类器,以对齐不同感受野的特征,减少实例级域偏移。
  • 实施多层级一致性正则化(MLCR),强制图像级与实例级域分类器之间的一致性,以鼓励网络在所有层级学习域不变特征。
  • 使用带有梯度反转层(GRL)的对抗性训练,联合优化特征提取器与域分类器,使网络在无需目标域标注的情况下生成域不变特征。
  • 端到端训练模型,损失函数包含检测损失、图像级与实例级域分类损失,以及一致性正则化损失。
  • 利用来自骨干网络多个层级的特征图,实现多尺度适应,域分类器在 YOLOv3 特征提取器的不同阶段应用。

实验结果

研究问题

  • RQ1专为两阶段检测器(如 Faster R-CNN)设计的域自适应技术能否有效迁移至单阶段检测器(如 YOLOv3)?
  • RQ2在无区域建议网络的单阶段检测器中,如何联合优化图像级与实例级域对齐?
  • RQ3图像级域分类器的加权策略对对齐局部特征与全局特征有何影响?
  • RQ4图像级与实例级域分类器之间的一致性正则化是否能提升单阶段检测器中域不变特征的学习效果?
  • RQ5所提方法能否在跨域检测性能上超越基于两阶段检测器的现有 SOTA 方法?

主要发现

  • 在从 KITTI 到 Cityscapes 的域迁移中,DA-YOLO 相较基线 YOLOv3 实现了 17.6% 的 mAP 提升,显著优于现有基于 Faster R-CNN 的域自适应方法。
  • 在 Cityscapes 到 Foggy Cityscapes 的基准测试中,DA-YOLO 达到 54.0% mAP,较之前 SOTA 方法(51.8%)高出 2.2 个百分点,并接近于理想性能(57.8%)。
  • 消融实验表明,RIA、MSIA 和 MLCR 每一模块均对性能有逐步贡献,其中 MLCR 在 Cityscapes 到 Foggy Cityscapes 设置中贡献最大,提升达 1.2% mAP。
  • RIA 模块通过为图像级域分类器采用递减权重,相比等权重图像对齐,使 mAP 提升 1.5%,验证了其在优先对齐局部特征方面的有效性。
  • t-SNE 可视化结果表明,DA-YOLO 的全局特征在源域与目标域之间对齐效果优于仅使用源域训练的基线模型,验证了域对齐的成功。
  • 定性结果表明,DA-YOLO 在恶劣天气条件下成功检测出基线模型漏检的车辆,展示了其在真实世界跨域场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。