Skip to main content
QUICK REVIEW

[论文解读] Hallucination Improves Few-Shot Object Detection

Weilin Zhang, Yu-Xiong Wang|arXiv (Cornell University)|May 4, 2021
Domain Adaptation and Few-Shot Learning参考文献 46被引用 11
一句话总结

本文提出了一种幻觉网络(hallucinator network),通过在特征空间中生成合成的感兴趣区域(RoI)特征来增强少样本目标检测的训练,将基础类别中的类内变化迁移至新类别,以提升分类器的泛化能力。通过在特征空间中迭代生成多样化且逼真的样本,该方法在 COCO 和 PASCAL VOC 数据集上实现了极少数样本设置(1–2 张图)下的最先进性能,显著减少了误报,并提升了检测准确率。

ABSTRACT

Learning to detect novel objects from few annotated examples is of great practical importance. A particularly challenging yet common regime occurs when there are extremely limited examples (less than three). One critical factor in improving few-shot detection is to address the lack of variation in training data. We propose to build a better model of variation for novel classes by transferring the shared within-class variation from base classes. To this end, we introduce a hallucinator network that learns to generate additional, useful training examples in the region of interest (RoI) feature space, and incorporate it into a modern object detection model. Our approach yields significant performance improvements on two state-of-the-art few-shot detectors with different proposal generation procedures. In particular, we achieve new state of the art in the extremely-few-shot regime on the challenging COCO benchmark.

研究动机与目标

  • 解决少样本目标检测中标签变化有限的关键挑战,特别是在每个新类别仅有 1–2 个样本时。
  • 克服现有方法仅依赖区域建议网络(RPNs)或元学习的局限性,这些方法无法充分捕捉外观变化。
  • 通过将数据丰富的基础类别中的共享类内变化(如姿态、光照)迁移到新类别,提升分类器的鲁棒性。
  • 开发一种即插即用的幻觉模块,兼容现代两阶段检测器(如 TFA 和 CoRPNs),无需复杂的元学习机制。

提出的方法

  • 以类似期望最大化(EM)的方式训练幻觉网络:首先使用当前分类器生成合成 RoI 特征,然后在真实样本与生成样本上联合微调分类器。
  • 在学习到的 RoI 特征空间中进行幻觉生成,使模型能够生成新类别特征的多样化且逼真的变化。
  • 采用简单、端到端的训练流程,交替进行分类器优化与幻觉生成,避免使用元学习。
  • 每类每轮训练批次生成固定数量的幻觉样本(例如 20 个),该数量通过超参数调优以达到最佳性能。
  • 将生成的幻觉样本纳入分类器的训练损失中,从而改善决策边界的估计。
  • 在推理阶段的微调过程中应用幻觉网络,即使仅有极少真实样本,也能实现更好的泛化性能。

实验结果

研究问题

  • RQ1在特征空间中进行数据幻觉是否能有效缓解极少数样本目标检测中外观变化不足的问题?
  • RQ2在 RoI 特征空间中生成样本与仅依赖 RPN 生成的建议框相比,对分类器训练有何影响?
  • RQ3所提出的类似 EM 的幻觉网络训练流程是否在少样本检测任务中优于基于元学习的替代方案?
  • RQ4幻觉生成在多大程度上通过改善决策边界估计来减少误报预测?
  • RQ5该幻觉模块能否在不进行架构重构的前提下,有效集成到多种先进的少样本检测器中?

主要发现

  • 在 PASCAL VOC 新类别数据集 1 上,所提方法将 1 张图 AP50 提升 5.3 个百分点,达到 45.1,优于 TFA 的 39.8。
  • 在新类别数据集 2 上,采用激进型幻觉设置后,方法达到 29.3 的 AP50,较 TFA 的 23.5 提升 6.1 个百分点。
  • 平均而言,幻觉生成将误报框数量减少最多达 25%(从 3,440.6 降至 3,041.1),表明决策边界估计更加准确。
  • 性能在每批次生成 20 个幻觉样本时趋于饱和,超过该数量后性能略有下降,表明存在最优容量。
  • 该方法同时提升了真正例检测率与误报抑制能力,其中后者提升更显著,说明决策边界泛化能力得到增强。
  • 该幻觉模块在不同分类器类型中均表现有效:在 CoRPNs 中同时提升了余弦分类器与全连接分类器的性能,证实其通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。