Skip to main content
QUICK REVIEW

[论文解读] WQT and DG-YOLO: towards domain generalization in underwater object detection

Hong Liu, Pinhao Song|arXiv (Cornell University)|Apr 14, 2020
Advanced Neural Network Applications参考文献 21被引用 13
一句话总结

该论文提出WQT,一种利用$WCT^{2}$合成多样化水下水质风格的数据增强方法,以及DG-YOLO,一种结合YOLOv3与域不变模块(DIM)和不变风险最小化(IRM)正则项的域泛化目标检测器。该方法在未见水质域上的域泛化性能达到当前最优,相较于基线方法mAP提升3.21%。

ABSTRACT

A General Underwater Object Detector (GUOD) should perform well on most of underwater circumstances. However, with limited underwater dataset, conventional object detection methods suffer from domain shift severely. This paper aims to build a GUOD with small underwater dataset with limited types of water quality. First, we propose a data augmentation method Water Quality Transfer (WQT) to increase domain diversity of the original small dataset. Second, for mining the semantic information from data generated by WQT, DG-YOLO is proposed, which consists of three parts: YOLOv3, DIM and IRM penalty. Finally, experiments on original and synthetic URPC2019 dataset prove that WQT+DG-YOLO achieves promising performance of domain generalization in underwater object detection.

研究动机与目标

  • 为解决由于训练数据有限且多样性不足导致的水下目标检测领域漂移问题。
  • 通过数据增强与不变表示学习,提升模型在不同水下水质条件下的泛化能力。
  • 开发一种实时、通用的水下目标检测器(GUOD),适用于未见的水下环境。
  • 在真实与合成水下数据集上验证WQT与DG-YOLO的有效性。
  • 分析模型学习语义域不变特征的能力,而非依赖虚假相关性。

提出的方法

  • WQT使用$WCT^{2}$将URPC2019数据集中的内容图像迁移至七种合成水质风格,提升领域多样性。
  • 该方法生成八个特定领域的数据集(type1–type8),其中type8仅用于评估域泛化性能。
  • DG-YOLO将YOLOv3与域不变模块(DIM)结合,以促进在不同水质领域间保持不变的特征学习。
  • 应用IRM正则项以最小化跨领域风险,促使模型学习在所有源领域上均稳定的预测器。
  • 模型采用联合损失函数进行训练:$L_{yolo} = L_{cls} + \lambda_{coord}L_{coord} + L_{obj} + \lambda_{noobj}L_{noobj} + \alpha L_d + \beta P_{IRM}$,其中$L_d$为域分类损失,$P_{IRM}$为IRM正则项。
  • 采用SmoothGrad可视化方法解释模型注意力机制,验证DG-YOLO学习的是语义相关特征,而非虚假相关性。

实验结果

研究问题

  • RQ1通过水质风格迁移(WQT)进行数据增强,能否有效提升小样本水下数据集的领域多样性?
  • RQ2结合域不变模块(DIM)与不变风险最小化(IRM)正则项,是否能提升水下目标检测的域泛化性能?
  • RQ3DG-YOLO在未见水质域(val_type8)上的性能相较于基线模型提升程度如何?
  • RQ4DG-YOLO的注意力图与基线模型及仅使用WQT的模型相比,在关注语义目标方面有何差异?
  • RQ5WQT与DG-YOLO带来的性能提升是源于学习域不变特征,还是虚假相关性?

主要发现

  • WQT+DG-YOLO在未见的val_type8领域上达到33.77%的mAP,较仅使用WQT的模型(30.55% mAP)提升3.21%。
  • 消融实验表明,仅当DIM与IRM正则项联合使用时(即DG-YOLO)才能获得显著性能提升;单独使用任一模块均导致性能下降或提升微弱。
  • SmoothGrad可视化结果表明,DG-YOLO聚焦于实际目标(如海星),而基线模型与仅使用WQT的模型则关注无关区域或呈现分散注意力,表明其依赖虚假相关性。
  • 尽管性能有所提升,DG-YOLO在val_type8上的表现仍低于其在已见领域中的表现,表明在极端领域漂移下,域泛化仍具挑战性。
  • 风格距离矩阵显示,type1–type7在风格空间中分布不均,且type8显著不同,解释了泛化困难的原因。
  • 仅使用WQT的模型在已见领域表现优异(如ori上达到58.56% mAP),但这是由于领域特定的虚假相关性所致,而非真正泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。