Skip to main content
QUICK REVIEW

[论文解读] Scene Invariant Crowd Segmentation and Counting Using Scale-Normalized Histogram of Moving Gradients (HoMG)

Parthipan Siva, Mohammad Javad Shafiee|arXiv (Cornell University)|Feb 1, 2016
Video Surveillance and Tracking Methods参考文献 21被引用 7
一句话总结

本文提出了一种基于新型低复杂度归一化梯度直方图(HoMG)特征的场景无关人群分割与计数方法,通过尺度归一化确保在不同摄像头视角下的鲁棒性。该方法实现每帧18ms的实时性能(约55 FPS),在七台摄像头的基准测试中,平均绝对误差(MAE)降低1.5倍,均方误差(MSE)降低2.25倍,显著优于当前最先进方法,展现出高精度与计算效率,适用于视频监控中的工业部署。

ABSTRACT

The problem of automated crowd segmentation and counting has garnered significant interest in the field of video surveillance. This paper proposes a novel scene invariant crowd segmentation and counting algorithm designed with high accuracy yet low computational complexity in mind, which is key for widespread industrial adoption. A novel low-complexity, scale-normalized feature called Histogram of Moving Gradients (HoMG) is introduced for highly effective spatiotemporal representation of individuals and crowds within a video. Real-time crowd segmentation is achieved via boosted cascade of weak classifiers based on sliding-window HoMG features, while linear SVM regression of crowd-region HoMG features is employed for real-time crowd counting. Experimental results using multi-camera crowd datasets show that the proposed algorithm significantly outperform state-of-the-art crowd counting algorithms, as well as achieve very promising crowd segmentation results, thus demonstrating the efficacy of the proposed method for highly-accurate, real-time video-driven crowd analysis.

研究动机与目标

  • 解决视频监控中在极少每台摄像头校准或标注条件下实现场景无关人群分割与计数的挑战。
  • 开发一种低复杂度、可扩展的特征描述符,确保在不同摄像头角度和透视失真下仍保持高精度。
  • 通过最小化计算开销并最大化精度,实现实时处理,以支持工业部署。
  • 利用扩展的13台摄像头数据集,验证方法在多样化摄像头视角下的鲁棒性与泛化能力。

提出的方法

  • 提出梯度运动直方图(HoMG),一种尺度归一化的时空特征,可自适应不同摄像头距离下的人体尺寸。
  • 利用摄像头校准信息进行尺度归一化,将图像区域重采样,使人体宽度恒定为w_p像素,同时保留形状并消除衣物差异的影响。
  • 采用滑动窗口HoMG特征与级联弱分类器的提升结构,实现实时人群区域分割。
  • 在人群区域的HoMG特征上应用线性SVM回归,以估计人群数量,利用累积梯度幅值与人数之间的线性关系。
  • 在特征提取前,对尺度归一化图像条带中的运动梯度进行处理,以确保尺度表示的一致性。
  • 使用C++实现该方法,并结合SSE优化,在标准CPU上实现每帧18ms(约55 FPS)的处理速度。

实验结果

研究问题

  • RQ1单一尺度归一化特征描述符是否能在无需每台摄像头训练的前提下,实现对多样化摄像头视角下人群分割与计数的高精度?
  • RQ2在运动梯度计算前进行尺度归一化,如何影响HoMG特征在人群计数中的线性与可靠性?
  • RQ3所提出的HoMG方法在精度与计算效率方面,相比当前最先进方法的优越程度如何?
  • RQ4当应用于更大、更丰富的数据集(包含多样化摄像头角度与场景配置)时,该方法是否仍保持鲁棒性?

主要发现

  • 在七台摄像头的基准测试中,所提出的HoMG方法相比当前最先进方法SIM3C,平均绝对误差(MAE)降低1.5倍,均方误差(MSE)降低2.25倍。
  • 尽管仅使用单一特征(HoMG),该方法仍优于SIM3C,后者依赖边缘、斑点和关键点等多种特征描述符。
  • 该方法实现了实时性能,平均处理时间为每帧18ms,相当于在标准Intel Core i7处理器上超过55 FPS。
  • 在运动梯度计算前进行尺度归一化至关重要:若省略此步骤,HoMG特征将失去与人群数量的线性关系,如图13所示的改进方法所证实。
  • 扩展的13台摄像头数据集验证了该方法对摄像头角度和透视变化的显著鲁棒性,证实其场景无关性。
  • 在低密度场景中,该方法的MDE(平均偏差误差)高于SIM3C,表明在人数较少时对噪声或拟合偏差较为敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。