[论文解读] Multi-Granularity Alignment Domain Adaptation for Object Detection
该论文提出了一种用于目标检测无监督域自适应的多粒度对齐框架,通过整合像素级、实例级和类别级特征对齐,学习域不变表示。该方法引入了一种类全尺度门控融合模块以实现多尺度特征聚合,并设计了类别级判别器以增强实例可分性与跨域类别一致性,在使用FCOS的Cityscapes到FoggyCityscapes迁移任务中实现了43.8%的SOTA mAP。
Domain adaptive object detection is challenging due to distinctive data distribution between source domain and target domain. In this paper, we propose a unified multi-granularity alignment based object detection framework towards domain-invariant feature learning. To this end, we encode the dependencies across different granularity perspectives including pixel-, instance-, and category-levels simultaneously to align two domains. Based on pixel-level feature maps from the backbone network, we first develop the omni-scale gated fusion module to aggregate discriminative representations of instances by scale-aware convolutions, leading to robust multi-scale object detection. Meanwhile, the multi-granularity discriminators are proposed to identify which domain different granularities of samples(i.e., pixels, instances, and categories) come from. Notably, we leverage not only the instance discriminability in different categories but also the category consistency between two domains. Extensive experiments are carried out on multiple domain adaptation scenarios, demonstrating the effectiveness of our framework over state-of-the-art algorithms on top of anchor-free FCOS and anchor-based Faster RCNN detectors with different backbones.
研究动机与目标
- 解决由于源域与目标域分布差异导致的目标检测领域偏移问题。
- 在像素、实例和类别三个粒度层次上实现特征对齐,超越单一层次对齐方法。
- 通过可学习门控机制融合不同分辨率的特征,提升多尺度目标检测的鲁棒性。
- 同时建模类内可分性与跨域类别一致性,以提升域泛化能力。
- 在多种域自适应基准上实现SOTA性能,且计算开销极低。
提出的方法
- 提出一种全尺度门控融合模块,基于粗粒度检测指导,从低分辨率和高分辨率特征图中选择最合适的卷积操作,以提升多尺度特征表示能力。
- 在像素、实例和类别三个层次上使用多粒度判别器,以区分源域和目标域样本,其中类别级判别器用于强制实现域间的一致性。
- 利用高置信度检测结果进行伪标签监督,以指导类别级判别器训练,实现类别一致性与实例可分性的联合学习。
- 利用主干网络的特征图生成粗粒度检测结果,用以指导每个实例最优卷积路径的选择。
- 设计统一的训练目标,以对抗方式联合优化目标检测器与多粒度域判别器。
- 将该框架应用于基于锚点(Faster R-CNN)和无锚点(FCOS)的检测器,采用VGG-16与ResNet-101主干网络,验证了其广泛适用性。
实验结果
研究问题
- RQ1在像素、实例和类别三个粒度上联合对齐,是否能提升目标检测的域泛化能力?
- RQ2采用可学习门控机制的多尺度特征融合,如何提升小目标与大目标的检测性能?
- RQ3建模源域与目标域之间的类别一致性,能在多大程度上提升域自适应性能?
- RQ4各粒度层次(像素、实例、类别)对整体域自适应性能的相对贡献如何?
- RQ5与现有SOTA域自适应方法相比,该方法在准确率与效率方面表现如何?
主要发现
- 在使用FCOS的Cityscapes到FoggyCityscapes域自适应基准上,所提方法实现了43.8%的SOTA mAP,比第二名方法CFA高出3.6个百分点。
- 若移除类别级判别器,mAP从43.6%显著下降至39.3%,证明其在性能提升中的关键作用。
- 与无该模块的基线相比,全尺度门控融合模块使mAP提升4.3%,凸显其在多尺度特征聚合中的有效性。
- 类别级判别器优于现有判别器如$D^{\text{cen}}$、$D^{\text{grp}}$和$D^{\text{cls}}$,相比基线实现5%的性能增益。
- 该方法保持合理的计算成本,Faster R-CNN参数量仅255M,推理速度达21.4 FPS,在准确率与效率上均优于SCL和SAPNet。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。