[论文解读] Adaptive Object Detection with Dual Multi-Label Prediction
本文提出MCAR,一种用于跨域目标检测的新型无监督域自适应模型,通过将多标签预测作为双重辅助任务来提升特征对齐与检测一致性。通过利用基于多标签预测的条件对抗性特征对齐,并引入一致性正则化机制,该模型在多个基准数据集上实现了最先进性能,在域泛化能力和检测精度方面显著优于现有方法。
In this paper, we propose a novel end-to-end unsupervised deep domain adaptation model for adaptive object detection by exploiting multi-label object recognition as a dual auxiliary task. The model exploits multi-label prediction to reveal the object category information in each image and then uses the prediction results to perform conditional adversarial global feature alignment, such that the multi-modal structure of image features can be tackled to bridge the domain divergence at the global feature level while preserving the discriminability of the features. Moreover, we introduce a prediction consistency regularization mechanism to assist object detection, which uses the multi-label prediction results as an auxiliary regularization information to ensure consistent object category discoveries between the object recognition task and the object detection task. Experiments are conducted on a few benchmark datasets and the results show the proposed model outperforms the state-of-the-art comparison methods.
研究动机与目标
- 为解决目标检测中的域偏移问题,即训练数据与测试数据来自不同分布,尤其是在具有复杂视觉变化的多目标场景中。
- 通过利用多标签识别作为双重辅助任务,揭示图像中的全局物体类别信息,以提升域泛化能力。
- 通过使用多标签预测作为条件信号,实施条件对抗性特征对齐,以增强特征的判别性与域不变性。
- 通过一致性正则化机制,确保检测任务与识别任务之间物体类别预测的一致性。
- 在无需目标域标注数据的情况下,实现无监督跨域目标检测的最先进性能。
提出的方法
- 模型引入一种双任务学习框架,使目标检测与多标签图像分类在端到端方式下联合优化。
- 将多标签预测作为辅助任务,从图像中提取全局类别信息,并用于条件化对抗性域对齐过程。
- 通过将全局图像特征与多标签预测输出同时输入域判别器,执行条件对抗性域对齐,从而实现更具判别性与域不变性的特征学习。
- 引入一致性正则化损失,对齐检测头(在区域提议上)与多标签头(在全球特征上)的预测结果,确保物体类别发现的一致性。
- 整体训练目标结合了检测损失、多标签分类损失、对抗性域对齐损失与一致性正则化损失,通过超参数控制各项损失之间的权衡。
- 采用特征可视化与t-SNE分析,评估域对齐质量与域不变表示学习效果。
实验结果
研究问题
- RQ1将多标签预测作为辅助任务,是否能通过揭示全局类别信息,提升多目标检测中的域自适应性能?
- RQ2基于多标签预测条件的对抗性特征对齐,是否能带来更具域不变性与判别性的特征表示?
- RQ3检测头与多标签识别头之间的一致性正则化,是否能提升在域偏移条件下的检测精度?
- RQ4所提方法与当前最先进的无监督域自适应方法相比,在跨域目标检测中表现如何?
- RQ5关键超参数(如对抗损失权重与难样本聚焦)对模型性能有何影响?
主要发现
- 在从PASCAL VOC到Watercolor的迁移任务中,所提模型实现了54.4%的平均平均精度(mAP),较次优方法高出超过5个百分点。
- 在Cityscapes到Foggy Cityscapes的迁移任务中,模型成功检测到雾霾场景中远距离、模糊的车辆,而基线方法未能检测到,展现出对视觉退化的鲁棒性。
- 使用t-SNE的特征可视化显示,所提模型有效减少了域偏移,其源域与目标域特征相比源域单阶段基线更加难以区分。
- 超参数分析表明,λ = 0.5与γ = 5时性能最优,表明适度的对抗对齐与平衡的难样本聚焦对性能至关重要。
- 消融实验确认,条件对抗性对齐与一致性正则化组件均对性能提升有显著贡献,任一组件的移除均导致mAP大幅下降。
- 定性结果表明,与DA-Faster和SW-DA相比,该模型显著减少了误报与漏检,尤其在小尺寸或远距离物体上表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。