Skip to main content
QUICK REVIEW

[论文解读] Improving Dense Crowd Counting Convolutional Neural Networks using Inverse k-Nearest Neighbor Maps and Multiscale Upsampling

Greg Olmschenk, Hao Tang|arXiv (Cornell University)|Jan 31, 2019
Video Surveillance and Tracking Methods参考文献 23被引用 5
一句话总结

本文提出逆k近邻(ikNN)映射作为训练密集人群计数卷积神经网络的更优替代方案,相较于传统的高斯密度映射。通过在MUD-ikNN架构中结合ikNN标注与一种基于转置卷积的新型多尺度上采样模块,该方法在多个基准数据集上实现了最先进性能,显著提升了现有方法的计数准确性。

ABSTRACT

Gatherings of thousands to millions of people frequently occur for an enormous variety of events, and automated counting of these high-density crowds is useful for safety, management, and measuring significance of an event. In this work, we show that the regularly accepted labeling scheme of crowd density maps for training deep neural networks is less effective than our alternative inverse k-nearest neighbor (i$k$NN) maps, even when used directly in existing state-of-the-art network structures. We also provide a new network architecture MUD-i$k$NN, which uses multi-scale upsampling via transposed convolutions to take full advantage of the provided i$k$NN labeling. This upsampling combined with the i$k$NN maps further improves crowd counting accuracy. Our new network architecture performs favorably in comparison with the state-of-the-art. However, our labeling and upsampling techniques are generally applicable to existing crowd counting architectures.

研究动机与目标

  • 为解决传统基于高斯的密度映射标注在人群计数中的局限性,后者常未能充分利用空间梯度信息,且难以保留细粒度行人位置细节。
  • 通过引入一种新型标注方案——逆k近邻(ikNN)映射,提供更丰富的空间梯度,同时保持精确的行人定位,从而提升训练效率与模型准确性。
  • 设计一种可泛化的网络架构MUD-ikNN,利用转置卷积实现多尺度上采样,以在多个特征层级实现全分辨率监督。
  • 证明ikNN标注与多尺度上采样模块可无缝集成至现有最先进网络中,无需对网络结构进行大规模修改。
  • 验证所提技术在多样化真实世界人群数据集上显著提升计数性能。

提出的方法

  • 本文提出一种新颖的标注方案——逆k近邻(ikNN)映射,其中每个像素的值与到其第k个最近邻的距离成反比,从而生成空间信息丰富、梯度显著的人群分布表示。
  • ikNN映射的构建不依赖于高斯分布假设,而是强调局部密度对比度,即使在行人重叠情况下也能保持个体周围边界的清晰性。
  • MUD-ikNN网络将密集连接的卷积层与多尺度上采样模块相结合,后者利用转置卷积将中间特征图上采样至全真值分辨率,以实现直接监督。
  • 该上采样模块使端到端训练成为可能,所有层均可获得全分辨率监督,无需像先前方法那样使用额外的冗余分支。
  • 转置卷积上采样被参数化,以支持灵活的、任意尺度的上采样,确保模型可直接将特征与全分辨率的ikNN标签图进行比较。
  • 该框架设计为即插即用:现有人群计数网络可仅通过少量修改即可采用ikNN标注与上采样模块,从而在各类架构中提升性能。

实验结果

研究问题

  • RQ1将标准高斯密度映射替换为逆k近邻(ikNN)映射是否能提升深度卷积神经网络在人群计数中的准确性?
  • RQ2通过转置卷积实现的多尺度上采样是否能增强特征层级的监督并提升密集人群计数模型的性能?
  • RQ3ikNN标注与多尺度上采样模块在多大程度上可泛化至现有最先进的人群计数架构中?
  • RQ4所提出的MUD-ikNN网络在多样化真实世界人群数据集上与当前最先进方法相比表现如何?
  • RQ5ikNN标注与全分辨率多尺度上采样相结合是否能相比传统方法降低回归误差?

主要发现

  • 在UCF-QNRF数据集上,MUD-ikNN模型实现了104的平均绝对误差(MAE),优于先前最先进方法(Idrees et al., 2018)的132 MAE。
  • 在ShanghaiTech Part A上,MUD-ikNN实现了68.0的MAE,显著优于基线模型MUD-densityβ0.3(72.7 MAE)与先前最先进方法(132 MAE)。
  • 在ShanghaiTech Part B上,MUD-ikNN实现了13.4的MAE,优于先前最先进方法(10.6 MAE),在不同人群密度下均展现出强大的泛化能力。
  • 消融实验表明,仅将密度图替换为ikNN图即可使ShanghaiTech Part A的MAE从72.7降至70.8,证明该标注方案在独立于网络架构下仍具有效性。
  • 多尺度上采样模块实现了所有层级的全分辨率监督,通过促进更精确的梯度流动与特征与真实值的对齐,显著降低误差。
  • 该方法具有高度泛化能力:当应用于[9]的网络时,将原密度图替换为ikNN图后,MAE从132降至122,证实了该标注方案的广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。