Skip to main content
QUICK REVIEW

[论文解读] A Deeply-Recursive Convolutional Network for Crowd Counting

Xinghao Ding, Zhi-Rui Lin|arXiv (Cornell University)|May 15, 2018
Video Surveillance and Tracking Methods被引用 16
一句话总结

该论文提出DR-ResNet,一种用于人群计数的深度递归残差网络,通过递归重用残差块,在仅使用0.028百万个参数的情况下保持高精度——比当前最先进模型少500多倍——从而实现高效部署。该方法在ShanghaiTech和UCF_CC_50数据集上达到最先进性能,并在新构建的真实世界北京BRT数据集上表现出色,证明其在实际监控环境中对光照、阴影和尺度变化具有强大鲁棒性。

ABSTRACT

The estimation of crowd count in images has a wide range of applications such as video surveillance, traffic monitoring, public safety and urban planning. Recently, the convolutional neural network (CNN) based approaches have been shown to be more effective in crowd counting than traditional methods that use handcrafted features. However, the existing CNN-based methods still suffer from large number of parameters and large storage space, which require high storage and computing resources and thus limit the real-world application. Consequently, we propose a deeply-recursive network (DR-ResNet) based on ResNet blocks for crowd counting. The recursive structure makes the network deeper while keeping the number of parameters unchanged, which enhances network capability to capture statistical regularities in the context of the crowd. Besides, we generate a new dataset from the video-monitoring data of Beijing bus station. Experimental results have demonstrated that proposed method outperforms most state-of-the-art methods with far less number of parameters.

研究动机与目标

  • 为解决现有基于CNN的人群计数模型在计算和存储方面需求过高,特别是针对资源受限的嵌入式设备部署问题。
  • 开发一种轻量化但高精度的人群计数模型,即使在参数数量大幅减少的情况下仍能保持优异性能。
  • 提出一个新的、真实的基准数据集——北京BRT,专为智能交通应用设计,涵盖眩光、阴影和光照变化等具有挑战性的现实条件。
  • 证明通过递归重用残差块可加深网络深度而不增加参数量,从而增强特征学习与泛化能力。
  • 在多样化的数据集上验证模型的鲁棒性,包括稀疏、密集及真实场景。

提出的方法

  • 所提出的DR-ResNet采用递归残差块架构,通过多次重用同一残差块来增加网络深度,同时保持参数数量不变。
  • 每个残差块由两个卷积层组成,中间经过批归一化和ReLU激活,并通过短跳连接连接。
  • 在第二个残差模块中,通过在递归层之间共享权重,实现参数效率,同时增加有效深度。
  • 通过几何自适应高斯核生成密度图,用于密集人群;对稀疏场景则使用固定尺寸核,以提升定位精度。
  • 模型通过积分预测密度图来估计人群数量,使用公式 $ F(x) = \sum_{i=1}^{N} \delta(x - x_i) * G_{\sigma_i} $,其中 $ \sigma_i = \beta \bar{d}_i $,且 $ \beta = 0.3 $。
  • 对ShanghaiTech数据集应用随机裁剪和水平翻转等数据增强方法,以提升训练多样性。

实验结果

研究问题

  • RQ1递归残差网络架构是否能在显著减少参数量的前提下,实现与现有模型相当甚至更高的计数精度?
  • RQ2所提出的DR-ResNet在具有挑战性视觉条件(如阴影、眩光和光照变化)的真实监控数据上表现如何?
  • RQ3递归设计是否能有效捕捉多尺度与上下文特征,而无需增加模型复杂度?
  • RQ4DR-ResNet在ShanghaiTech和UCF_CC_50等基准数据集上的性能与当前最先进模型相比如何?
  • RQ5新提出的北京BRT数据集是否能为智能交通应用提供更具现实意义的评估基准?

主要发现

  • 在北京BRT数据集上,DR-ResNet的平均绝对误差(MAE)为1.39,均方误差(MSE)为2.00,优于MCNN(MAE: 2.24,MSE: 3.35)和FCN(MAE: 1.74,MSE: 2.43)。
  • 在ShanghaiTech Part_B数据集上,DR-ResNet的MAE为124.2,MSE为21.0,优于ResNet-14(MAE: 137.1,MSE: 27.8),且在某些场景下比CP-CNN更具鲁棒性。
  • 尽管仅使用0.028百万个参数,DR-ResNet的性能仍与参数量超过1500万的模型(如Switch-CNN,15.1M;CP-CNN,62.9M)相当或更优。
  • 模型在UCF_CC_50数据集上表现出极强泛化能力,仅CP-CNN的MAE(20.1)低于DR-ResNet(21.0),表明其对极端尺度和大小变化具有高度鲁棒性。
  • 所提出的北京BRT数据集包含1,280张图像,标注了16,795名行人,为智能交通应用提供了具有现实视觉挑战的真实基准。
  • 可视化结果表明,DR-ResNet在存在阴影和眩光的复杂场景中仍能准确估计人群数量,测试图像中真实值与预测值接近(如32 vs. 34,62 vs. 59)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。