Skip to main content
QUICK REVIEW

[论文解读] Object Counting: You Only Need to Look at One

Hui Lin, Xiaopeng Hong|arXiv (Cornell University)|Dec 11, 2021
Video Surveillance and Tracking Methods被引用 9
一句话总结

本文提出 LaoNet,一种新颖的一次性目标计数模型,通过结合自注意力(Self-Attention)与关联注意力(Correlative-Attention)来建模实例内与实例间的关系,并引入尺度聚合机制以实现多尺度特征提取。该模型仅使用一个支持样本即可对新类别目标进行计数,在 FSC-147 和 COCO 基准测试中实现了最先进性能,收敛速度更快且精度更高。

ABSTRACT

This paper aims to tackle the challenging task of one-shot object counting. Given an image containing novel, previously unseen category objects, the goal of the task is to count all instances in the desired category with only one supporting bounding box example. To this end, we propose a counting model by which you only need to Look At One instance (LaoNet). First, a feature correlation module combines the Self-Attention and Correlative-Attention modules to learn both inner-relations and inter-relations. It enables the network to be robust to the inconsistency of rotations and sizes among different instances. Second, a Scale Aggregation mechanism is designed to help extract features with different scale information. Compared with existing few-shot counting methods, LaoNet achieves state-of-the-art results while learning with a high convergence speed. The code will be available soon.

研究动机与目标

  • 解决在仅有一个标注样本的情况下对图像中新型未见目标类别进行计数的挑战。
  • 克服少样本计数场景中因领域偏移和实例差异(如尺度、旋转)带来的影响。
  • 设计一种在无需微调的情况下能有效泛化到多样化目标类别的模型。
  • 通过建模实例内与实例间特征相关性,提升一次性计数任务中的鲁棒性与准确性。
  • 相比现有少样本计数方法,实现更快的收敛速度与更稳定的训练性能。

提出的方法

  • 提出一种特征相关性模块,结合自注意力与关联注意力,以学习查询图像内部特征的关联关系,以及查询与支持特征之间的跨实例关联关系。
  • 应用自注意力机制对查询图像内部特征及支持框特征进行优化,增强对显著区域及其空间依赖关系的关注。
  • 设计尺度聚合机制,从支持区域提取多尺度特征并进行融合,同时保持空间一致性。
  • 在展平后的特征上使用位置嵌入,以在注意力计算过程中保持空间结构。
  • 采用密度回归头预测最终的密度图,总数量通过累加图中所有值获得。
  • 采用 L1 损失与 SSIM 损失的组合进行训练,以提升特征对齐效果与回归精度。

实验结果

研究问题

  • RQ1单个支持样本是否足以实现对新型目标类别的准确且鲁棒的计数?
  • RQ2注意力机制在不同尺度与姿态的目标实例之间,如何提升特征相关性学习能力?
  • RQ3多尺度特征聚合在少样本计数任务中在多大程度上提升了模型的泛化能力?
  • RQ4所提出的 LaoNet 是否相比现有少样本计数模型实现了更快的收敛速度与更好的稳定性?
  • RQ5在相同类别上微调的前提下,一次性计数模型是否仍能超越预训练目标检测器?

主要发现

  • 在 FSC-147 数据集上,LaoNet 达到最先进性能,测试集上的 MAE 从 17.11 降低至 15.78,RMSE 从 56.81 降低至 97.15(注:原文 RMSE 从 56.81 降至 97.15 明显有误,应为升高,但按原文保留)
  • 在 COCO 数据集上,LaoNet 在 FSC147-COCO 测试集上取得 MAE 12.89 与 RMSE 26.64,显著优于 RetinaNet 和 Faster R-CNN 等预训练目标检测器。
  • 消融实验表明,自注意力模块对性能贡献最大,相比消融版本,MAE 降低 19.9%,RMSE 降低 13.1%。
  • 尺度聚合机制提升了模型鲁棒性,尤其在无该模块的消融版本中,RMSE 降低 10.4%。
  • SSIM 损失进一步提升性能,相比无该损失的基线,MAE 降低 1.5%,RMSE 降低 3.4%。
  • LaoNet 收敛速度显著快于基线方法——仅用 2 个训练周期即达到低验证 MAE,而 FamNet 需要 40 个周期才能达到类似性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。