[论文解读] A Survey of Self-Supervised and Few-Shot Object Detection
本综述全面回顾了自监督与少样本目标检测方法,分析了自监督预训练如何通过从无标签数据中学习鲁棒视觉表征来提升少样本泛化能力。文中突出介绍了SOTA方法如DETReg,该方法通过自监督联合预训练主干网络与检测头,在MS COCO数据集上实现了SOTA性能。
Labeling data is often expensive and time-consuming, especially for tasks such as object detection and instance segmentation, which require dense labeling of the image. While few-shot object detection is about training a model on novel (unseen) object classes with little data, it still requires prior training on many labeled examples of base (seen) classes. On the other hand, self-supervised methods aim at learning representations from unlabeled data which transfer well to downstream tasks such as object detection. Combining few-shot and self-supervised object detection is a promising research direction. In this survey, we review and characterize the most recent approaches on few-shot and self-supervised object detection. Then, we give our main takeaways and discuss future research directions. Project page at https://gabrielhuang.github.io/fsod-survey/
研究动机与目标
- 系统性地回顾并分类近期在少样本与自监督目标检测方面的进展。
- 分析以分类为导向的自监督表征在目标检测中的局限性,并识别改进方向。
- 评估在少样本设置下,对主干网络与检测头组件进行自监督预训练的性能表现。
- 识别低数据、半监督与零样本目标检测中的关键趋势与未来研究方向。
- 提供在监督、少样本与自监督范式之间方法的分类体系与基准对比。
提出的方法
- 根据预训练策略对方法进行分类:监督主干网络、自监督主干网络与检测头,或完整架构的自监督。
- 回顾如对比学习(例如SimCLR、MoCo)、实例判别与掩码自编码等预训练任务,用于自监督预训练。
- 分析将自监督表征微调或适配至检测头与区域建议网络(RPN)的方法。
- 在标准基准测试(如MS COCO与PASCAL VOC)上评估性能,尤其关注低样本与少样本场景。
- 将自监督方法与监督基线进行比较,并考察表征在检测任务中的可迁移性。
- 引入并讨论DETReg作为SOTA方法,其在完整Faster R-CNN架构上执行自监督预训练。
实验结果
研究问题
- RQ1为图像分类预训练的自监督表征在目标检测中的迁移效果如何?其局限性是什么?
- RQ2哪些关键的架构与预训练组件能够提升少样本目标检测的性能?
- RQ3对整个检测器(主干网络、RPN、检测头)进行自监督预训练的策略,与仅预训练主干网络的策略相比如何?
- RQ4在低数据量场景(如mini-COCO或1% COCO子集)下,自监督方法的性能增益如何?
- RQ5少样本、半监督与零样本检测方法之间有何关联?可从中获得哪些跨方法的洞见?
主要发现
- 对整个目标检测器架构(包括主干网络、RPN与检测头)进行自监督预训练,可在MS COCO数据集的少样本目标检测中实现SOTA性能。
- 如DETReg等方法通过自监督联合预训练所有组件,实现了SOTA结果,优于仅预训练主干网络的方法。
- 在ImageNet或COCO上使用对比学习或实例判别目标预训练的自监督表征,即使未针对定位任务优化,也能在目标检测中表现出强大的迁移能力。
- 自监督预训练在低数据量场景(如1%或5%的MS COCO标注)下带来的性能增益尤为显著。
- ImageNet Top-1准确率与下游检测性能之间存在显著差距,表明以分类优化的自监督方法对检测任务而言并非最优。
- 未来改进有望来自检测器组件的联合预训练,以及整合视觉-语言先验,如零样本检测方法中所见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。