Skip to main content
QUICK REVIEW

[论文解读] Adaptive Scenario Discovery for Crowd Counting

Xingjiao Wu, Yingbin Zheng|arXiv (Cornell University)|Dec 6, 2018
Video Surveillance and Tracking Methods参考文献 21被引用 5
一句话总结

该论文提出了一种用于人群计数的自适应场景发现(ASD)框架,采用具有不同感受野的两条并行卷积路径来捕捉多尺度人群密度,并通过可学习的离散化自适应分支动态校准其响应。该方法在ShanghaiTech和UCF_CC_50数据集上实现了最先进性能,相较于先前的SOTA模型,分别将MAE降低了2.6%和26.3%。

ABSTRACT

Crowd counting, i.e., estimation number of the pedestrian in crowd images, is emerging as an important research problem with the public security applications. A key component for the crowd counting systems is the construction of counting models which are robust to various scenarios under facts such as camera perspective and physical barriers. In this paper, we present an adaptive scenario discovery framework for crowd counting. The system is structured with two parallel pathways that are trained with different sizes of the receptive field to represent different scales and crowd densities. After ensuring that these components are present in the proper geometric configuration, a third branch is designed to adaptively recalibrate the pathway-wise responses by discovering and modeling the dynamic scenarios implicitly. Our system is able to represent highly variable crowd images and achieves state-of-the-art results in two challenging benchmarks.

研究动机与目标

  • 解决在密集人群计数中建模高度多变人群场景的挑战,例如不同的摄像机视角、背景杂乱和人群密度差异。
  • 克服多分支人群计数网络中固定权重融合或人工选择场景的局限性。
  • 通过可学习的离散化自适应分支实现隐式场景发现,动态校准路径响应。
  • 提升在多样化真实世界人群图像中预测行人数量的鲁棒性与准确性。
  • 在无需显式场景标注的情况下,实现在基准数据集上的最先进性能。

提出的方法

  • 基于VGG设计双路径卷积神经网络架构,其中一条路径使用更大的感受野以处理稀疏人群,另一条路径使用更小的感受野以处理密集人群。
  • 引入第三个自适应分支,利用可微分的离散化软注意力机制,学习动态分配两条路径输出的权重。
  • 通过全局平均池化和全连接层生成场景感知的融合权重,输出被离散化为有限数量的桶,以隐式建模不同的人群场景。
  • 使用标准密度图回归损失端到端训练整个网络,实现特征学习与场景感知融合的联合优化。
  • 在主干网络中使用空洞卷积以保持空间分辨率并捕捉多尺度上下文。
  • 采用可学习的融合策略,使模型能够根据输入图像特征自适应地强调最相关的路径。

实验结果

研究问题

  • RQ1深度学习模型是否能够在无需显式场景标注的情况下隐式发现并适应多样化的人群场景?
  • RQ2在人群计数中,与固定或人工选择的融合方式相比,多尺度特征的动态可学习融合有何优势?
  • RQ3对融合权重进行离散化在应对多变人群密度和成像条件时,能在多大程度上提升泛化能力?
  • RQ4所提出的自适应场景发现框架是否在标准基准上优于现有的多分支人群计数模型?
  • RQ5性能对离散化桶数和分组场景数的敏感程度如何?

主要发现

  • 所提出的ASD框架在ShanghaiTech Part A上的平均绝对误差(MAE)为65.6,优于CSRNet(MAE 68.2)和Switching-CNN(MAE 90.4)。
  • 在ShanghaiTech Part B上,该模型实现了报告的最佳MAE(8.5)和MSE(13.7),表明其在中等密度人群场景下具有强大的泛化能力。
  • 在极具挑战性的UCF_CC_50数据集上,ASD框架相较于先前的SOTA模型,将MAE降低了26.3%,MSE降低了31.8%,表明其在高密度场景下具有更强的鲁棒性。
  • 消融实验表明,采用15种场景的离散化可学习融合性能最佳(MAE 65.6),优于非离散化融合(MAE 69.4)和2桶离散化(MAE 74.4)。
  • 定性结果表明,该模型能够基于视角、背景和人群密度等视觉线索,将图像自动分组为不同的场景,如图5所示。
  • 该框架对网络架构变化具有鲁棒性,仅当同时使用两条路径和自适应融合分支时性能才显著提升,证实了完整架构的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。