Skip to main content
QUICK REVIEW

[论文解读] Leveraging Bottom-Up and Top-Down Attention for Few-Shot Object Detection

Xianyu Chen, Ming Jiang|arXiv (Cornell University)|Jul 23, 2020
Advanced Neural Network Applications参考文献 63被引用 8
一句话总结

本文提出 AttFDNet,一种新颖的少样本目标检测框架,通过结合自底向上的视觉显著性图与自顶向下的注意力机制,在极端数据稀缺条件下提升检测性能。通过利用人类注意力先验的自底向上注意力机制,并引入新型集中损失函数与混合学习策略,AttFDNet 在 PASCAL VOC 上实现最先进性能,在 2-shot 和 3-shot 设置下显著提升新类别 mAP。

ABSTRACT

Few-shot object detection aims at detecting objects with few annotated examples, which remains a challenging research problem yet to be explored. Recent studies have shown the effectiveness of self-learned top-down attention mechanisms in object detection and other vision tasks. The top-down attention, however, is less effective at improving the performance of few-shot detectors. Due to the insufficient training data, object detectors cannot effectively generate attention maps for few-shot examples. To improve the performance and interpretability of few-shot object detectors, we propose an attentive few-shot object detection network (AttFDNet) that takes the advantages of both top-down and bottom-up attention. Being task-agnostic, the bottom-up attention serves as a prior that helps detect and localize naturally salient objects. We further address specific challenges in few-shot object detection by introducing two novel loss terms and a hybrid few-shot learning strategy. Experimental results and visualization demonstrate the complementary nature of the two types of attention and their roles in few-shot object detection. Codes are available at https://github.com/chenxy99/AttFDNet.

研究动机与目标

  • 解决少样本目标检测中的挑战,即标注样本有限导致模型过拟合与泛化能力差。
  • 克服在少样本场景中自顶向下注意力机制的局限性,因监督信息不足而难以有效学习注意力图。
  • 利用来自眼动追踪数据的自底向上注意力作为与任务无关的先验,引导检测显著且自然吸引注意力的物体。
  • 通过引入两项新型损失函数——物体集中损失与背景集中损失,提升模型鲁棒性与特征判别能力。
  • 开发一种混合少样本学习策略,结合迁移学习与元学习,以更好地初始化模型并防止过拟合。

提出的方法

  • 将源自人类眼动追踪数据的自底向上注意力图作为先验,突出图像中显著且吸引注意力的区域。
  • 在单阶段检测器(RFB-SSD)中融合自底向上与自顶向下注意力机制,以增强少样本类别的特征表示。
  • 提出一种混合少样本学习策略,通过在元学习与迁移学习之间交替,提升模型泛化能力。
  • 引入物体集中损失,以增强新类别内部的特征一致性,并降低难负样本锚框的影响。
  • 设计背景集中损失,以抑制无关特征,提升前景与背景区域之间的判别能力。
  • 通过知识蒸馏从预训练的全数据集模型中迁移知识,以保留基础类别知识,并在数据稀缺条件下稳定训练。

实验结果

研究问题

  • RQ1在监督信息极度有限的情况下,人类眼动追踪数据提供的自底向上注意力是否能作为有效先验,以提升少样本目标检测性能?
  • RQ2在少样本目标检测中,自底向上与自顶向下注意力机制如何互补?它们各自对检测性能的贡献是什么?
  • RQ3所提出的集中损失函数(物体与背景)在少样本场景中,对提升特征判别能力与模型泛化能力的贡献程度如何?
  • RQ4与仅使用标准元学习或迁移学习相比,该混合少样本学习策略在鲁棒性与准确性方面是否更具优势?
  • RQ5整合显著性先验如何影响模型检测新类别物体的能力,同时保持对基础类别的性能?

主要发现

  • 在 PASCAL VOC 上,AttFDNet 在 2-shot 设置下实现新类别 mAP 为 20.7%,在 3-shot 设置下为 29.1%,显著优于基线模型 RFB-ft-full(分别为 8.1% 和 10.8% mAP)。
  • 消融实验表明,自底向上注意力(BU)带来显著性能提升:AttFDNet(BU+TD)在 2-shot 设置下实现 58.1% 的全类别 mAP,而仅使用自顶向下注意力(TD)为 56.3%,基线模型为 48.6%。
  • 移除蒸馏损失后,基础类别 mAP 降至 52.0%,新类别 mAP 降至 18.0%,证明其在保留基础类别知识方面具有关键作用。
  • 背景集中损失与物体集中损失各自独立提升性能:若同时移除两者,2-shot 设置下的全类别 mAP 降至 55.4%,表明二者具有协同增益效果。
  • 混合少样本学习策略实现了更优的模型初始化,AttFDNet(BU+TD)无背景损失设置下实现 57.5% 的全类别 mAP,优于标准元学习基线。
  • 可视化与定性分析表明,即使自顶向下注意力图较为模糊,自底向上注意力仍能有效突出显著物体,证实二者具有互补作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。