Skip to main content
QUICK REVIEW

[论文解读] Locality-constrained Spatial Transformer Network for Video Crowd Counting

Yanyan Fang, Biyun Zhan|arXiv (Cornell University)|Jul 18, 2019
Video Surveillance and Tracking Methods参考文献 23被引用 7
一句话总结

本文提出了一种局部约束空间变换网络(LSTN),用于视频人群计数,通过局部约束空间变换模块显式建模相邻帧之间的时空依赖关系。通过将帧划分为块,并使用帧间块相似性加权变形误差,LSTN 在存在遮挡和运动的动态场景中提升了密度图估计性能,在多个数据集上实现了最先进性能,并引入了目前最大的视频人群计数数据集 FDST,包含 15,000 幅图像和 394,081 个标注的人头。

ABSTRACT

Compared with single image based crowd counting, video provides the spatial-temporal information of the crowd that would help improve the robustness of crowd counting. But translation, rotation and scaling of people lead to the change of density map of heads between neighbouring frames. Meanwhile, people walking in/out or being occluded in dynamic scenes leads to the change of head counts. To alleviate these issues in video crowd counting, a Locality-constrained Spatial Transformer Network (LSTN) is proposed. Specifically, we first leverage a Convolutional Neural Networks to estimate the density map for each frame. Then to relate the density maps between neighbouring frames, a Locality-constrained Spatial Transformer (LST) module is introduced to estimate the density map of next frame with that of current frame. To facilitate the performance evaluation, a large-scale video crowd counting dataset is collected, which contains 15K frames with about 394K annotated heads captured from 13 different scenes. As far as we know, it is the largest video crowd counting dataset. Extensive experiments on our dataset and other crowd counting datasets validate the effectiveness of our LSTN for crowd counting.

研究动机与目标

  • 解决由于运动、遮挡和视角变化导致的视频帧之间头部分布密度估计不一致的问题。
  • 通过显式建模相邻帧之间的时空一致性,而非依赖隐式的 RNN 方法,提升视频人群计数的鲁棒性。
  • 通过收集包含 13 种不同场景的大规模视频人群计数数据集,克服现有数据集规模小且缺乏逐帧标注的局限性。
  • 通过将变换估计限制在空间块内,使方法能够适应动态场景变化,如人员进出或被遮挡的情况。
  • 证明基于相似性的局部化密度图变形方法在视频人群计数中优于全局变换和隐式历史建模方法。

提出的方法

  • 使用卷积神经网络(CNN)回归每个视频帧的初始密度图。
  • 使用局部约束空间变换(LST)模块,通过分块空间变换将前一帧的密度图变形以预测当前帧的密度图。
  • 将每帧划分为非重叠的空间块,以实现变换估计的局部化,提升对局部场景变化的鲁棒性。
  • LST 模块使用学习到的相似性度量计算连续帧中对应块之间的相似性,该相似性用于加权变形密度图与真实值之间的差异。
  • 损失函数结合了各块上变形密度图与真实密度图之间的加权误差,实现端到端训练并实现时空对齐。
  • 通过联合损失函数进行端到端训练,强调在相邻帧间相似性较高的区域实现准确的密度预测。

实验结果

研究问题

  • RQ1与隐式的 RNN 方法相比,显式地对相邻帧之间进行分块空间变换是否能提升视频人群计数的准确性?
  • RQ2在存在遮挡以及人员进出场景的情况下,引入空间块之间的局部相似性如何影响密度图估计?
  • RQ3与全局空间变换或标准 ConvLSTM 相比,局部约束方法在建模人群计数的时序动态方面是否表现更优?
  • RQ4大规模、逐帧标注的视频人群计数数据集在多大程度上提升了模型评估与训练的性能?
  • RQ5所提出的方法能否在具有不同人群动态和摄像机视角的多样化真实场景中实现良好泛化?

主要发现

  • 所提出的 LSTN 模型在 FDST 数据集上实现了 3.35 的平均绝对误差(MAE),优于无 LST 的基线模型(MAE: 3.81)以及 SOTA 方法如 ConvLSTM(MAE: 4.48)。
  • 在 UCSD 数据集上,LSTN 实现了 1.07 的 MAE 和 1.39 的 MSE,优于 MCNN(MAE: 1.07,MSE: 1.35)和 ConvLSTM(MAE: 1.30,MSE: 1.79)。
  • 在 Mall 数据集上,LSTN 实现了最低的 MAE(2.00)和 MSE(2.50),优于双向 ConvLSTM(MAE: 2.10,MSE: 2.70)。
  • 消融研究证实,LST 模块中的相似性项在所有数据集上均持续提升性能,在 FDST 上包含该项时 MAE 相对降低 12.6%。
  • FDST 数据集包含 15,000 幅图像和 394,081 个标注的人头,涵盖 13 个场景,是迄今为止最大的视频人群计数数据集,具有逐帧标注,支持细粒度评估。
  • 与单图基线相比,该模型在 FDST 数据集上的性能显著更优,证明了显式时序建模在视频人群计数中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。