[论文解读] Dual-Awareness Attention for Few-Shot Object Detection
本文提出了一种新型注意力机制——双-awareness 注意力(DAnA),通过从支持图像中实现查询位置感知(QPA)的特征自适应,增强了少样本目标检测性能。DAnA 结合了背景抑制(BA),以抑制噪声特征,以及跨图像空间注意力(CISA),以建模支持区域与查询区域之间的空间对应关系,在 COCO 数据集上相比之前的方法实现了 6.9 AP 的性能提升,达到当前最先进水平。
While recent progress has significantly boosted few-shot classification (FSC) performance, few-shot object detection (FSOD) remains challenging for modern learning systems. Existing FSOD systems follow FSC approaches, ignoring critical issues such as spatial variability and uncertain representations, and consequently result in low performance. Observing this, we propose a novel extbf{Dual-Awareness Attention (DAnA)} mechanism that enables networks to adaptively interpret the given support images. DAnA transforms support images into extbf{query-position-aware} (QPA) features, guiding detection networks precisely by assigning customized support information to each local region of the query. In addition, the proposed DAnA component is flexible and adaptable to multiple existing object detection frameworks. By adopting DAnA, conventional object detection networks, Faster R-CNN and RetinaNet, which are not designed explicitly for few-shot learning, reach state-of-the-art performance in FSOD tasks. In comparison with previous methods, our model significantly increases the performance by 47\% (+6.9 AP), showing remarkable ability under various evaluation settings.
研究动机与目标
- 解决现有少样本目标检测(FSOD)方法在基础类和新类上均表现不佳的问题,其原因在于空间错位与特征不确定性。
- 开发一种灵活的注意力机制,增强从少量支持图像中提取的特征表示,而无需修改现有检测器的主干网络。
- 通过保留空间关系并减少支持特征聚合中的不确定性,提升检测性能。
- 使两阶段检测器(如 Faster R-CNN)和一阶段检测器(如 RetinaNet)在不进行架构重构的情况下,实现当前最先进水平的 FSOD 性能。
提出的方法
- 提出背景抑制(BA),将高层特征建模为通道维度上的波模式,通过抑制波模式差异较大的特征来抑制噪声。
- 引入跨图像空间注意力(CISA),通过测量查询区域与支持特征之间的相似性,生成查询位置感知(QPA)向量,以指导检测。
- 使用特征拼接将 QPA 向量与查询特征结合,实现在不使用逐元素操作的情况下实现局部化、类别特定的注意力。
- 以模块化方式应用 BA 和 CISA,使 DAnA 兼容两阶段(如 Faster R-CNN)和一阶段(如 RetinaNet)目标检测框架。
- 采用多支持特征聚合策略,利用 QPA 向量减少不确定性,相比简单的平均池化更具优势。
- 利用 RPN 作为关键组件以维持检测质量,表明 RPN 对 DAnA 性能至关重要。
实验结果
研究问题
- RQ1是否可以通过一种可学习的注意力机制,保留局部与空间关系,缓解少样本目标检测中的空间错位与特征不确定性?
- RQ2与全局平均池化或标准注意力相比,将支持特征转换为查询位置感知表示是否能提升检测准确率?
- RQ3双模块注意力机制(BA 与 CISA)是否能优于通用软注意力或基线特征融合方法?
- RQ4所提出的 DAnA 机制是否在不同检测架构(包括两阶段与一阶段检测器)中均有效?
- RQ5RPN 的使用是否显著提升 DAnA 的性能,且是否对实现最先进结果至关重要?
主要发现
- 在 COCO 少样本目标检测基准上,DAnA 相较于之前最先进方法实现了 6.9 AP 的性能提升,展现出显著的性能增强。
- 消融实验确认,CISA 通过实现查询位置感知的特征自适应显著提升了性能,优于对支持特征进行简单平均池化的基线方法。
- 背景抑制(BA)在抑制噪声方面优于通用软注意力,消融实验显示其带来 1.5 AP 的性能增益。
- 将 QPA 向量与查询特征拼接优于逐元素乘法,表明特征融合策略对注意力集成具有重要影响。
- 移除 RPN 导致性能显著下降,证明 RPN 对 DAnA 实现最优检测性能至关重要。
- 可视化结果表明,CISA 能够成功捕捉查询图像与支持图像之间的语义对应关系,例如动物的头部或肢体,即使在复杂场景中亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。