[论文解读] One-Shot Unsupervised Cross-Domain Detection
本文提出 OSHOT,一种新颖的单样本无监督跨域目标检测框架,仅在推理时使用单张未标注图像即可适应新目标域。通过在伪标签目标区域上利用多任务架构与自监督旋转预测,并结合跨任务伪标签生成,OSHOT 在多个基准测试中达到最先进性能,在单样本适应场景下相比现有方法最高提升 5.9 mAP 点。
Despite impressive progress in object detection over the last years, it is still an open challenge to reliably detect objects across visual domains. Although the topic has attracted attention recently, current approaches all rely on the ability to access a sizable amount of target data for use at training time. This is a heavy assumption, as often it is not possible to anticipate the domain where a detector will be used, nor to access it in advance for data acquisition. Consider for instance the task of monitoring image feeds from social media: as every image is created and uploaded by a different user it belongs to a different target domain that is impossible to foresee during training. This paper addresses this setting, presenting an object detection algorithm able to perform unsupervised adaption across domains by using only one target sample, seen at test time. We achieve this by introducing a multi-task architecture that one-shot adapts to any incoming sample by iteratively solving a self-supervised task on it. We further enhance this auxiliary adaptation with cross-task pseudo-labeling. A thorough benchmark analysis against the most recent cross-domain detection methods and a detailed ablation study show the advantage of our method, which sets the state-of-the-art in the defined one-shot scenario.
研究动机与目标
- 为解决在动态环境(如社交媒体信息流)中实时适应新未见视觉域的目标检测挑战。
- 克服现有跨域检测方法在适应过程中需要大量目标域数据的局限性。
- 提出一种仅依赖单张目标图像即可实现无监督域自适应的框架,适用于目标数据稀缺或不可预测的场景。
- 设计一种多任务学习架构,将自监督预训练任务与目标检测相结合,以提升跨域特征泛化能力。
- 验证跨任务伪标签与迭代自监督在最小化监督条件下减少域偏移的有效性。
提出的方法
- 该方法采用多任务深度学习架构,联合优化目标检测与同一特征图上的自监督旋转预测任务。
- 利用初始检测器推理生成的伪标签裁剪出目标区域,并将其作为旋转预测任务的输入,使自监督聚焦于语义相关的内容。
- 在推理时自适应过程中迭代应用自监督任务,网络在单张目标图像上经过多轮优化步骤进行微调。
- 跨任务伪标签确保旋转任务仅作用于目标级别的特征,避免水印或背景纹理等误导性模式的影响。
- 通过使用单张目标图像持续更新网络权重,实现迭代式自适应,逐步缩小源域与目标域之间的域差距。
- 该方法端到端训练,且在自适应过程中无需访问完整的源域训练集,从而实现高效的单样本推理。
实验结果
研究问题
- RQ1能否仅在推理时使用单张未标注图像,有效适应深度目标检测器至新视觉域?
- RQ2在减少域偏移方面,针对目标特定区域的自监督学习相较于全图自监督,表现如何?
- RQ3在单样本跨域目标检测中,实现稳定性能的最优迭代自适应步数是多少?
- RQ4与全图相比,通过聚焦于语义相关区域而非整张图像来实施自监督,是否能提升特征学习效果?
- RQ5在单样本、跨域设置下,所提方法相较于现有无监督域自适应与单样本学习方法表现如何?
主要发现
- 在 Clipart100 基准上,OSHOT 的 mAP 达到 30.7,相比基线 Faster R-CNN 提升 2.8 点,相比 BiOST 提升 2.8 点。
- 在新的基于社交媒体的 Social Bikes 数据集上,OSHOT 保持了强劲性能,而 BiOST 出现负迁移现象,表明其在真实世界动态域中的局限性。
- 使用伪标签生成的边界框进行自监督旋转预测,在不同域迁移设置下均带来 2.9 至 5.9 点的 mAP 提升,证明了局部化自监督的有效性。
- 性能在约 30 次自适应迭代后趋于稳定,表明进一步迭代无法显著提升结果。
- 消融实验证实,将自监督聚焦于目标区域而非整张图像,可获得更鲁棒、更具泛化能力的特征,减少对虚假模式的依赖。
- OSHOT 在单样本无监督跨域目标检测任务中创下新的 SOTA 成绩,相比先前方法展现出更优的泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。