[论文解读] Cross-Domain Weakly-Supervised Object Detection through Progressive Domain Adaptation
本文提出了一种两步渐进式域自适应框架,用于跨域弱监督目标检测,通过域迁移(基于CycleGAN的图像翻译)和伪标签法,从目标域的图像级标签生成合成的实例级标注。该方法在三个新数据集(Clipart1k、Watercolor2k、Comic2k)上相较基线模型实现了5–20个百分点的mAP提升,证明了其在多样化视觉域中具有强大的泛化能力,且对人工标注的依赖极低。
Can we detect common objects in a variety of image domains without instance-level annotations? In this paper, we present a framework for a novel task, cross-domain weakly supervised object detection, which addresses this question. For this paper, we have access to images with instance-level annotations in a source domain (e.g., natural image) and images with image-level annotations in a target domain (e.g., watercolor). In addition, the classes to be detected in the target domain are all or a subset of those in the source domain. Starting from a fully supervised object detector, which is pre-trained on the source domain, we propose a two-step progressive domain adaptation technique by fine-tuning the detector on two types of artificially and automatically generated samples. We test our methods on our newly collected datasets containing three image domains, and achieve an improvement of approximately 5 to 20 percentage points in terms of mean average precision (mAP) compared to the best-performing baselines.
研究动机与目标
- 解决在目标图像域(如水彩画、漫画)中缺乏实例级标注时检测目标的挑战。
- 实现从源域(具有丰富实例级标注)到目标域(仅有图像级标签)的有效域自适应。
- 开发一种可扩展、泛化能力强的框架,最大限度减少在新领域中对昂贵人工标注边界框的依赖。
- 构建新的基准数据集,涵盖非自然图像域的完整实例标注,用于评估。
提出的方法
- 应用基于CycleGAN的域迁移(DT),将具有实例级标注的源域图像转换为合成的目标域图像。
- 在DT生成的图像上微调检测器,为图像级标注的目标域图像生成伪边界框。
- 通过结合图像级标签与模型预测结果进行伪标签法(PL),生成伪实例级标注。
- 实施两步渐进式域自适应:首先在DT生成的数据上微调,然后在PL生成的数据上进一步微调以优化检测性能。
- 利用外部来源(如BAM!数据集)的额外噪声图像级标签,进一步提升性能。
- 使用标准弱监督学习目标训练检测器,并通过域自适应实现迭代优化。
实验结果
研究问题
- RQ1从具有实例级标注的源域进行域迁移,能否生成适合检测器微调的真实感目标域图像?
- RQ2利用图像级标注与模型预测结果进行伪标签法,能否在目标域中有效生成可靠的合成实例级标注?
- RQ3分步、两阶段渐进式域自适应(先DT后PL)是否在跨域弱监督目标检测中优于单步自适应或基线方法?
- RQ4来自外部来源的大规模噪声图像级标签在无手动标注的情况下,能在多大程度上提升检测性能?
主要发现
- 所提出的DT+PL方法在所有三个数据集(Clipart1k、Watercolor2k、Comic2k)上相较最佳基线模型实现了约5至20个百分点的平均精度(mAP)提升。
- 在Watercolor2k数据集上,使用BAM!数据集中噪声图像级标签的+extra变体,其性能甚至超过了在1,000个干净实例级标注上训练的理想情况,证明了大规模噪声数据的价值。
- 误差分析表明,DT显著提升了检测性能,尤其对置信度较低的预测;而PL则大幅减少了置信度较高的检测结果中的误分类与定位错误。
- 定性结果证实,CycleGAN成功实现了风格与纹理的迁移,同时保持了语义结构,从而实现了有效的域自适应。
- 该框架在多种视觉域(剪贴画、水彩画、漫画)中均表现出色,表明其泛化能力超越自然图像。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。