Skip to main content
QUICK REVIEW

[论文解读] Multi-Scale Attention Network for Crowd Counting

Rahul Rama Varior, Bing Shuai|arXiv (Cornell University)|Jan 17, 2019
Video Surveillance and Tracking Methods参考文献 38被引用 16
一句话总结

该论文提出了一种多尺度注意力网络,通过从CNN的多个层级生成密度图来处理人群计数中的尺度变化问题。通过引入尺度感知损失和软注意力机制,提升了精度,在UCF-QNRF数据集上实现了25%的误差降低,达到最先进性能。

ABSTRACT

In crowd counting datasets, people appear at different scales, depending on their distance from the camera. To address this issue, we propose a novel multi-branch scale-aware attention network that exploits the hierarchical structure of convolutional neural networks and generates, in a single forward pass, multi-scale density predictions from different layers of the architecture. To aggregate these maps into our final prediction, we present a new soft attention mechanism that learns a set of gating masks. Furthermore, we introduce a scale-aware loss function to regularize the training of different branches and guide them to specialize on a particular scale. As this new training requires annotations for the size of each head, we also propose a simple, yet effective technique to estimate them automatically. Finally, we present an ablation study on each of these components and compare our approach against the literature on 4 crowd counting datasets: UCF-QNRF, ShanghaiTech A & B and UCF_CC_50. Our approach achieves state-of-the-art on all them with a remarkable improvement on UCF-QNRF (+25% reduction in error).

研究动机与目标

  • 解决人群计数中的尺度变化问题,即由于相机距离不同导致人群个体大小差异显著。
  • 在密集人群场景中提升精度,尤其在存在严重遮挡和透视失真时。
  • 开发一种无需标注头部尺寸数据即可自动估计头部尺寸的方法。
  • 设计一个多分支网络,利用不同层级的层次化特征进行特定尺度的预测。
  • 在四个主要人群计数基准上实现最先进性能。

提出的方法

  • 提出一种多分支架构,从CNN的中间层和最终层生成密度图,利用感受野逐层扩展的层次特性。
  • 引入一种软注意力机制,学习门控掩码,基于预测的头部尺寸动态融合多尺度密度图。
  • 设计一种尺度感知损失函数,对每个分支进行正则化,使其专注于特定头部尺寸范围,提升泛化能力。
  • 开发一种自动头部尺寸估计技术,结合几何自适应与边界框自适应方法,生成伪尺寸标注。
  • 使用图像分辨率正则化处理极大型图像,尤其适用于UCF-QNRF数据集。
  • 在中间输出和最终输出上采用多监督策略进行端到端训练,增强特征学习能力。

实验结果

研究问题

  • RQ1来自网络不同层级的多尺度密度预测是否能在显著尺度变化下提升人群计数精度?
  • RQ2可学习的软注意力机制在融合多尺度预测时是否优于固定或加权融合策略?
  • RQ3尺度感知损失函数是否能有效引导每个网络分支专注于特定头部尺寸范围?
  • RQ4在缺乏真实尺寸标注的情况下,所提出的自动头部尺寸估计技术效果如何?
  • RQ5在大规模数据集(如UCF-QNRF)上进行预训练,对多个基准性能的提升程度如何?

主要发现

  • 所提方法在全部四个基准数据集(UCF-QNRF、ShanghaiTech A & B、UCF_CC_50)上均达到最先进性能。
  • 在UCF-QNRF上,与先前最先进方法相比,平均绝对误差(MAE)降低超过25%,全量训练下达到97.5的MAE。
  • 消融实验表明,加入尺度感知损失和注意力机制显著提升性能,MAE从109.7降至97.5。
  • 在UCF-QNRF上进行预训练可使所有数据集的性能进一步提升5%–10%,证明大规模预训练的优势。
  • 定性结果表明,与基线相比,生成的密度图更清晰、定位更准确,尤其在高密度区域表现更优。
  • 各网络层级在不同尺度范围内实现专业化:浅层聚焦小尺寸头部,深层聚焦大尺寸头部,经消融实验验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。