Skip to main content
QUICK REVIEW

[论文解读] Depth Information Guided Crowd Counting for Complex Crowd Scenes

Mingliang Xu, Zhaoyang Ge|arXiv (Cornell University)|Mar 3, 2018
Video Surveillance and Tracking Methods参考文献 23被引用 9
一句话总结

本文提出 DigCrowd,一种基于深度引导的群体计数方法,通过将扩展景深(EDOF)图像分割为近景和远景区域,分别采用目标检测处理近景人群、密度图生成处理远景人群。该方法在多个数据集上达到最先进性能,包括一个包含1,000张图像的新机场数据集,展示了在复杂、非均衡人群场景下的卓越准确性。

ABSTRACT

It is important to monitor and analyze crowd events for the sake of city safety. In an EDOF (extended depth of field) image with a crowded scene, the distribution of people is highly imbalanced. People far away from the camera look much smaller and often occlude each other heavily, while people close to the camera look larger. In such a case, it is difficult to accurately estimate the number of people by using one technique. In this paper, we propose a Depth Information Guided Crowd Counting (DigCrowd) method to deal with crowded EDOF scenes. DigCrowd first uses the depth information of an image to segment the scene into a far-view region and a near-view region. Then Digcrowd maps the far-view region to its crowd density map and uses a detection method to count the people in the near-view region. In addition, we introduce a new crowd dataset that contains 1000 images. Experimental results demonstrate the effectiveness of our DigCrowd method

研究动机与目标

  • 解决由于深度变化导致的人员大小和遮挡程度显著差异,从而在扩展景深(EDOF)场景中造成计数不准确的问题。
  • 克服现有基于回归和基于检测的方法在高遮挡、尺度变化和非均匀人群分布下失效的局限性。
  • 开发一种混合方法,利用深度信息指导区域特定的计数策略,以提升准确性。
  • 提供一个新的大规模真实世界数据集(CIISR),包含1,000张来自机场环境的图像,以支持复杂人群计数研究。
  • 通过在基准数据集(Shanghaitech、Mall)上进行评估,证明方法的泛化能力,超越新数据集本身。

提出的方法

  • 利用深度图将输入图像根据深度特征中的局部像素相似性,分割为近景(靠近相机)和远景(远离相机)两个区域。
  • 在近景区域应用基于 YOLO 的目标检测框架,以高精度计数个体,最大限度减少因遮挡导致的漏检。
  • 使用深度卷积神经网络为远景区域生成人群密度图,实现在高密度和小目标尺寸下的回归式计数。
  • 采用空间上下文感知的融合策略整合两个区域的结果,减少重复检测并提升整体准确性。
  • 通过结合检测与密度估计目标的多任务损失端到端训练模型,实现联合优化。
  • 在外部数据集(如 Shanghaitech、Mall)上微调模型,以展示其在多样化人群场景中的迁移能力与鲁棒性。

实验结果

研究问题

  • RQ1能否有效利用深度信息将 EDOF 场景分割为近景与远景区域,以应对人群计数中因尺度与遮挡变化带来的挑战?
  • RQ2将基于检测的方法用于近景区域、基于密度估计的方法用于远景区域,是否相比单一方法能显著提升计数准确性?
  • RQ3所提出的 DigCrowd 方法在具有高遮挡与非均匀分布的现实世界复杂人群场景中表现如何?
  • RQ4尽管场景特征存在差异,该模型在 Shanghaitech 和 Mall 等现有基准数据集上的泛化能力如何?
  • RQ5一个大规模的机场人群场景新数据集能否支持更稳健、更真实的群体计数系统评估?

主要发现

  • 在 Shanghaitech Part B 数据集上,DigCrowd 的平均绝对误差(MAE)为 21.5,均方误差(MSE)为 32.3,优于现有方法(包括 MCNN 和 YOLO)。
  • 在新引入的 CIISR 数据集(1,000 张机场图像)上,DigCrowd 达到最先进性能,证明其在极端深度变化的真实 EDOF 场景中的有效性。
  • 在 Mall 数据集上,DigCrowd 的 MAE 为 3.21,MSE 为 16.4,优于先前方法(如 RR:MAE 3.59;CA-RR:MAE 3.43),即使在存在强烈透视畸变和反光的场景中也表现优异。
  • 模型展现出强大的泛化能力,在无需微调的情况下于多个数据集上取得具有竞争力的结果,表明其对不同光照、密度和场景条件的鲁棒性。
  • 基于深度的区域分割显著减少了近景区域的误报,并提升了遮挡情况下的检测准确性。
  • 消融研究证实,混合方法(近景用检测,远景用密度估计)在所有数据集上均优于单独使用任一方法的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。