Skip to main content
QUICK REVIEW

[论文解读] Attention to Head Locations for Crowd Counting

Youmei Zhang, Chunluan Zhou|arXiv (Cornell University)|Jun 27, 2018
Video Surveillance and Tracking Methods参考文献 26被引用 16
一句话总结

本文提出了一种基于注意力机制的卷积神经网络(AM-CNN),用于人群计数,通过可学习的概率图显式关注头部位置,以抑制背景和非头部区域。通过将注意力机制与多尺度特征提取及相对偏差损失相结合,该方法提升了对遮挡、尺度变化和非均匀分布的鲁棒性,在ShanghaiTech、UCF CC 50和WorldExpo’10数据集上实现了最先进性能,且MAE和MSE更低。

ABSTRACT

Occlusions, complex backgrounds, scale variations and non-uniform distributions present great challenges for crowd counting in practical applications. In this paper, we propose a novel method using an attention model to exploit head locations which are the most important cue for crowd counting. The attention model estimates a probability map in which high probabilities indicate locations where heads are likely to be present. The estimated probability map is used to suppress non-head regions in feature maps from several multi-scale feature extraction branches of a convolution neural network for crowd density estimation, which makes our method robust to complex backgrounds, scale variations and non-uniform distributions. In addition, we introduce a relative deviation loss to compensate a commonly used training loss, Euclidean distance, to improve the accuracy of sparse crowd density estimation. Experiments on Shanghai-Tech, UCF_CC_50 and World-Expo'10 data sets demonstrate the effectiveness of our method.

研究动机与目标

  • 解决现有基于CNN的人群计数方法未显式关注头部位置的局限性,因为头部是最具信息量的计数线索。
  • 通过注意力机制过滤非头部区域,提升对复杂背景、尺度变化和非均匀人群分布的鲁棒性。
  • 提升稀疏人群计数性能,该问题常因标准训练损失中密集人群样本占主导而被忽视。
  • 引入相对偏差损失,以平衡稀疏与密集人群场景的训练信号,提升泛化能力。

提出的方法

  • 将注意力模型集成到多列卷积神经网络(MCNN)中,生成指示头部可能性的空间概率图。
  • 利用注意力图在多尺度特征提取分支中抑制非头部区域的特征,使网络聚焦于头部位置。
  • 结合标准欧氏距离损失与相对偏差损失,以在训练过程中强调稀疏人群样本。
  • 端到端联合训练AM-CNN,使用两种损失以改善密度图估计,尤其在低密度场景中表现更优。
  • 利用多尺度分支处理尺度变化,同时注意力机制增强对不同尺寸头部的定位能力。
  • 将注意力图作为空间掩码,用于在密度图回归前优化特征表示。

实验结果

研究问题

  • RQ1一种聚焦于头部位置的注意力机制是否能提升复杂场景下的人群计数性能?
  • RQ2基于注意力的特征抑制如何影响对背景杂乱和非均匀人群分布的鲁棒性?
  • RQ3与标准欧氏距离损失相比,引入相对偏差损失在多大程度上提升了稀疏人群密度估计的准确性?
  • RQ4所提出的方法是否能在具有不同人群密度和环境条件的多样化数据集上实现良好泛化?

主要发现

  • 在ShanghaiTech Part A数据集上,AM-CNN实现了最低的MAE(17.2)和MSE(36.8),优于以往最先进方法。
  • 在UCF CC 50数据集上,AM-CNN的MAE为279.5,MSE为377.8,显著优于CP-CNN(MAE:295.8)及其他基线方法。
  • 对于稀疏人群(密度 < 3000),AM-CNN始终优于CP-CNN,表明其在低密度场景中表现更优。
  • 注意力模型成功在概率图中突出头部区域,头部位置得分更高,背景或身体其他部位得分较低。
  • 在密集人群场景中,注意力模型聚焦于人群整体区域而非单个头部,这与人类视觉注意力一致。
  • 相对偏差损失有效提升了稀疏人群预测性能,表现为在UCF CC 50和WorldExpo’10数据集中低密度图像区域的性能更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。