[论文解读] Hierarchical Attention Network for Few-Shot Object Detection via Meta-Contrastive Learning
该论文提出了一种基于元对比学习的层次化注意力网络,用于少样本目标检测,通过多尺度特征聚合模块结合局部与全局注意力,并引入类别无关的相似性学习目标,以提升特征表示能力。该方法在 COCO 数据集上实现了 1–30 张支持图像下的最先进性能,即使在无需微调的情况下,也能通过基于相关性的对比学习有效利用支持图像。
Few-shot object detection (FSOD) aims to classify and detect few images of novel categories. Existing meta-learning methods insufficiently exploit features between support and query images owing to structural limitations. We propose a hierarchical attention network with sequentially large receptive fields to fully exploit the query and support images. In addition, meta-learning does not distinguish the categories well because it determines whether the support and query images match. In other words, metric-based learning for classification is ineffective because it does not work directly. Thus, we propose a contrastive learning method called meta-contrastive learning, which directly helps achieve the purpose of the meta-learning strategy. Finally, we establish a new state-of-the-art network, by realizing significant margins. Our method brings 2.3, 1.0, 1.3, 3.4 and 2.4% AP improvements for 1-30 shots object detection on COCO dataset. Our code is available at: https://github.com/infinity7428/hANMCL
研究动机与目标
- 为解决现有少样本目标检测方法仅依赖全局注意力而导致局部上下文信息利用不足的问题。
- 探究元学习在少样本目标检测中的有效性,并改进其目标函数以实现更好的特征对齐。
- 设计一种层次化注意力机制,从局部区域逐步扩展感受野至全局区域,以增强特征表示。
- 开发一种元对比学习模块,实现在查询图像与支持图像之间进行类别无关的相似性学习,提升泛化能力。
- 在低数据场景(包括零样本和跨域设置)下实现最先进性能,且无需微调。
提出的方法
- 提出一种层次化注意力模块(HAM),结合深度可分离卷积与空洞卷积,并引入全局自注意力机制,实现从局部到全局尺度的感受野逐步扩展。
- 采用一种元对比学习模块(Meta-CLM),利用共享的全连接层生成查询图像与支持图像特征之间的相关性特征,实现与类别无关的二分类相似性判断。
- 使用两阶段 Faster R-CNN 主干网络,以 ResNet-101 作为特征提取器,并将 HAM 集成至区域建议网络和检测头中。
- 基于相关性特征应用对比损失,促使嵌入空间中同类的查询-支持对彼此靠近,不同类对彼此远离。
- 在基础类别上使用元学习进行端到端训练,使模型在无需微调的情况下即可实现对新类别的零样本推理。
- 采用具有递增卷积核大小(如 5, 7, 14, 21, 28)的层次化注意力结构,系统性地探索从局部到全局的上下文信息,并通过消融实验加以验证。
实验结果
研究问题
- RQ1结合局部与全局注意力的层次化注意力机制是否能提升少样本目标检测中的特征表示?
- RQ2当目标函数被重构为基于相似性的匹配而非多分类任务时,元学习是否能有效提升少样本目标检测性能?
- RQ3类别无关的对比学习目标是否能增强新类别间查询图像与支持图像之间的特征对齐?
- RQ4在发生领域或类别偏移的零样本和跨领域少样本检测场景中,所提方法表现如何?
- RQ5具有递增感受野的层次化注意力结构是否比非层次化或反向层次化设计更有效?
主要发现
- 所提方法在 COCO 数据集上 1、2、3、5、10 和 30 张样本设置下均实现了最先进平均精度(mAP),且无需微调即超越先前方法。
- 在零样本评估设置下(仅在基础类别上训练,新类别上测试),该方法保持了强劲性能,展现出高度适应能力。
- 消融实验证实,与非层次化或反向层次化结构相比,层次化注意力机制显著提升了 mAP,最佳性能出现在卷积核大小为 14、21 和 28 时。
- 元对比学习模块提升了特征判别能力,消融实验显示其在少样本和跨域设置下 mAP 显著提高。
- 在跨领域评估中(如在 Pascal VOC 上训练,在 COCO 上测试),该模型泛化能力优于现有方法,展现出对领域偏移的鲁棒性。
- 注意力图可视化结果表明,与基线方法相比,所提方法能更准确地聚焦于目标区域,即使在未见类别上亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。