Skip to main content
QUICK REVIEW

[论文解读] Crowd Counting Using Scale-Aware Attention Networks

Mohammad Asiful Hossain, Mehrdad Hosseinzadeh|arXiv (Cornell University)|Mar 5, 2019
Video Surveillance and Tracking Methods参考文献 26被引用 9
一句话总结

本文提出了一种用于人群计数的尺度感知注意力网络,通过使用软注意力机制动态加权多尺度特征,提升了密度图估计的性能。通过整合全局与局部尺度注意力模块并引入辅助损失,该模型在基准数据集上实现了最先进性能,在ShanghaiTech PartB上的MAE降低了16.86。

ABSTRACT

In this paper, we consider the problem of crowd counting in images. Given an image of a crowded scene, our goal is to estimate the density map of this image, where each pixel value in the density map corresponds to the crowd density at the corresponding location in the image. Given the estimated density map, the final crowd count can be obtained by summing over all values in the density map. One challenge of crowd counting is the scale variation in images. In this work, we propose a novel scale-aware attention network to address this challenge. Using the attention mechanism popular in recent deep learning architectures, our model can automatically focus on certain global and local scales appropriate for the image. By combining these global and local scale attention, our model outperforms other state-of-the-art methods for crowd counting on several benchmark datasets.

研究动机与目标

  • 解决人群计数中因视角和密度差异导致物体(如人群)尺寸差异极大的尺度变化挑战。
  • 克服类似Switch-CNN等硬切换方法的局限性,后者依赖离散的尺度选择,存在选择错误尺度的风险。
  • 提出一种软注意力机制,自适应地重新加权多尺度特征,实现更鲁棒且准确的密度图预测。
  • 证明全局与局部尺度注意力模块在捕捉场景中多样化人群密度方面的有效性。
  • 通过在注意力头引入辅助监督,提升特征学习能力与泛化性能。

提出的方法

  • 提出一个多尺度特征提取器,生成具有不同感受野大小的特征,以捕捉多样化的人群尺度。
  • 引入全局尺度注意力(GSA)模块,在尺度维度上计算注意力权重,聚焦于最相关的全局尺度。
  • 设计局部尺度注意力(LSA)模块,按空间位置计算尺度感知注意力,实现局部尺度自适应。
  • 使用可学习的融合层将多尺度特征与GSA和LSA的输出相结合,生成最终的密度图。
  • 使用主损失 $L_{DM}$ 在密度图上进行训练,并引入辅助损失 $L_{GSA}$ 和 $L_{LSA}$ 以监督注意力头。
  • 采用软注意力机制,为各尺度分配连续权重,使模型能够同时关注多个尺度,而非仅选择单一尺度。

实验结果

研究问题

  • RQ1注意力机制能否被有效适配以聚焦于人群计数中的相关尺度,而非仅关注空间位置?
  • RQ2通过注意力实现的软尺度选择是否优于先前方法(如Switch-CNN)所采用的硬切换机制?
  • RQ3全局与局部尺度注意力模块在单独及联合使用时,如何分别并共同促进人群密度估计的改进?
  • RQ4在注意力头引入辅助监督是否能提升模型学习有意义尺度表征的能力?
  • RQ5所提出方法是否能在具有不同尺度分布的多样化人群计数基准数据集中实现良好泛化?

主要发现

  • 所提模型在ShanghaiTech PartB数据集上实现了16.86的平均绝对误差(MAE),优于所有先前的最先进方法。
  • 消融实验确认,全局(GSA)与局部(LSA)注意力模块均具有显著贡献,当两者同时使用时性能最佳。
  • 在训练过程中引入辅助损失 $L_{GSA}$ 和 $L_{LSA}$ 进一部提升了性能,使ShanghaiTech PartB上的MAE从19.15降低至16.86。
  • 在Mall数据集上,模型实现了1.28的MAE与1.68的MSE,优于现有方法(包括DecideNet与Count-Forest)。
  • 图6的定性结果表明,该模型生成了更准确且细节更丰富的密度图,尤其在高密度与遮挡区域表现更优。
  • 该模型在三个基准数据集(ShanghaiTech PartB、Mall和UCF_CC_50)上均优于现有方法,展现出一致的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。