[论文解读] Frustratingly Simple Few-Shot Object Detection
本文表明,在一个平衡的基础类与新类集合上仅微调目标检测器的最后一层(两阶段微调),再结合实例级特征归一化和余弦相似性分类,能优于元学习方法在小样本目标检测上的表现,并在 VOC、COCO 与 LVIS 上引入更可靠的基准。
Detecting rare objects from a few examples is an emerging problem. Prior works show meta-learning is a promising approach. But, fine-tuning techniques have drawn scant attention. We find that fine-tuning only the last layer of existing detectors on rare classes is crucial to the few-shot object detection task. Such a simple approach outperforms the meta-learning methods by roughly 2~20 points on current benchmarks and sometimes even doubles the accuracy of the prior methods. However, the high variance in the few samples often leads to the unreliability of existing benchmarks. We revise the evaluation protocols by sampling multiple groups of training examples to obtain stable comparisons and build new benchmarks based on three datasets: PASCAL VOC, COCO and LVIS. Again, our fine-tuning approach establishes a new state of the art on the revised benchmarks. The code as well as the pretrained models are available at https://github.com/ucbdrive/few-shot-object-detection.
研究动机与目标
- 评估简单微调是否能在小样本目标检测中超越元学习。
- 探究训练日程安排和实例级特征归一化对检测性能的影响。
- 修订评估协议,以解决小样本设置中的变异性以及对基础类知识保留的考量。
提出的方法
- 采用 Faster R-CNN 作为基本检测器,将训练分为基础类阶段和少样本阶段(两阶段微调,TFA)。
- 在第一阶段,在基础类上训练检测器;在第二阶段,冻结特征提取器,仅在基础类和新类的平衡集合上微调框预测器的最后几层。
- 在第二阶段,在框分类器内应用实例级特征归一化,以降低类内方差。
- 使用基于余弦相似性的框分类器对候选框进行分类,采用固定缩放因子 alpha(经验值为 20)。
- 与元学习基线(FSRW、Meta R-CNN、MetaDet)以及完全微调或联合训练的基线进行比较。
- 通过对多个训练组的抽样来修订基准,报告在 VOC、COCO 与 LVIS 上的基础类 AP、新类 AP 和广义 AP。
实验结果
研究问题
- RQ1在一个平衡的基础+新类集合上仅微调检测器的最后几层,是否能在小样本目标检测中超越元学习方法?
- RQ2哪些训练机制(日程安排、归一化、余弦分类器)最能稳定并提升小样本检测性能?
- RQ3修订后的评估协议在小样本检测中如何影响跨数据集(VOC、COCO、LVIS)的可靠性和比较?
主要发现
- 两阶段微调(TFA)在 VOC 和 COCO 基准上,一致性地比此前的元学习方法高出约 2 到 20 个 AP 点。
- 使用基于余弦相似性的框分类器并结合实例级归一化,进一步提升新类 AP,尤其是在极低样本场景(1-shot)中。
- 在 LVIS 上,TFA 将稀有类 AP 提升约 4 点,常见类 AP 提升约 2 点,对频繁类影响甚微。
- 修订后的基准揭示了小样本检测结果的高方差;多次运行、不同采样组的结果带来更稳定、可靠的比较。
- 在 VOC、COCO 与 LVIS 上,TFA 在修订后的评估协议下创造了新的最先进结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。