Skip to main content
QUICK REVIEW

[论文解读] Towards Domain Generalization in Object Detection

Xingxuan Zhang, Zekai Xu|arXiv (Cornell University)|Mar 27, 2022
Domain Adaptation and Few-Shot Learning被引用 16
一句话总结

本文提出了目标检测中的域泛化(DGOD),提出了一种名为区域感知提议重加权(RAPT)的新方法,通过学习提议级别的样本权重来减少域不变特征与域特定特征之间的虚假相关性。RAPT显著提升了检测器在多种未见分布偏移下的泛化能力——在包括密度、上下文和随机偏移在内的多个跨数据集基准上超越了当前最先进方法。

ABSTRACT

Despite the striking performance achieved by modern detectors when training and test data are sampled from the same or similar distribution, the generalization ability of detectors under unknown distribution shifts remains hardly studied. Recently several works discussed the detectors' adaptation ability to a specific target domain which are not readily applicable in real-world applications since detectors may encounter various environments or situations while pre-collecting all of them before training is inconceivable. In this paper, we study the critical problem, domain generalization in object detection (DGOD), where detectors are trained with source domains and evaluated on unknown target domains. To thoroughly evaluate detectors under unknown distribution shifts, we formulate the DGOD problem and propose a comprehensive evaluation benchmark to fill the vacancy. Moreover, we propose a novel method named Region Aware Proposal reweighTing (RAPT) to eliminate dependence within RoI features. Extensive experiments demonstrate that current DG methods fail to address the DGOD problem and our method outperforms other state-of-the-art counterparts.

研究动机与目标

  • 为解决在自动驾驶等真实应用场景中常见的未知分布偏移下评估目标检测器的关键空白问题。
  • 将目标检测中的域泛化(DGOD)问题形式化,即模型在已知源域上进行训练,并在完全未知的目标域上进行测试。
  • 构建一个全面的跨数据集评估基准,包含四种不同的偏移类型:经典DG、密度偏移、上下文偏移和随机偏移。
  • 提出一种新方法 RAPT,通过减少区域提议中无关特征(如上下文、风格)与相关特征(如物体类别)之间的虚假相关性,来缓解其影响。
  • 证明当前的域泛化与域自适应方法在未见分布偏移上表现失败,而 RAPT 实现了最先进的泛化性能。

提出的方法

  • 提出一种新的评估协议,基于密度、上下文和随机分割等分布偏移,将大规模检测数据集划分为训练组和评估组。
  • 引入区域感知提议重加权(RAPT),一种样本重加权机制,通过学习提议级别的权重来最小化区域建议特征(RoI features)与域特定属性之间的统计依赖性。
  • 通过基于学习到的提议重要性重新加权损失,将 RAPT 作为即插即用模块应用于现有基于提议的检测器(如 Faster R-CNN、RetinaNet、CrowdDet)。
  • 采用对比学习目标,通过减少类别相关特征与域相关特征之间的相关性,来促进 RoI 特征的不变性。
  • 采用基于聚类的数据分组方法,以模拟现实中的分布偏移,从而在多样化且未见的测试域下评估泛化能力。
  • 在四种不同的偏移设置下验证该方法:密度偏移(如 Caltech 与 CrowdHuman)、上下文偏移(如街道场景与开放世界场景),以及数据集的随机分割。

实验结果

研究问题

  • RQ1当测试集分布偏移在训练阶段完全未见时,现代目标检测器的表现如何?
  • RQ2现有域泛化与自适应方法在未知域偏移下的目标检测中,其主要失败模式是什么?
  • RQ3提议级别的重加权机制是否能有效减少目标检测中域不变特征与域特定特征之间的虚假相关性?
  • RQ4RAPT 在诸如行人密度变化、场景上下文变化和随机数据集分割等多样化分布偏移下,能在多大程度上提升泛化能力?
  • RQ5RAPT 是否能在不同检测器架构上泛化,并在密集与稀疏行人检测场景中均提升性能?

主要发现

  • 当前的域泛化与自适应方法在目标检测中无法泛化到训练阶段未见的分布偏移,尤其当测试域未在训练中出现时表现更差。
  • 通用目标检测器(如 Faster R-CNN)在未见的密集或稀疏场景中表现优于专用行人检测器(如 CrowdDet、IterDet),表明专用模型并未学习到不变特征。
  • RAPT 在所有评估设置中均达到最先进性能,包括密度偏移、上下文偏移和随机分布偏移,持续优于 Faster R-CNN、RetinaNet 和专用检测器。
  • 在 ECP 数据集(密集场景)上,RAPT 相较 Faster R-CNN 提升 4.2% AP,相较 CrowdDet 提升 3.1% AP,证明其在挑战性密集场景中的有效性。
  • 在上下文偏移评估中(如在非交通数据集 WiderPedestrian 上训练,在 CityPersons 上测试),RAPT 在所有设置中均取得最高 mAP,表明其对上下文分布偏移具有强鲁棒性。
  • 可视化结果表明,RAPT 在随机分布偏移下生成了更准确且更少的错误边界框,表明其泛化能力更强,并有效减少了对域特定模式的过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。