Skip to main content
QUICK REVIEW

[论文解读] Revisiting Perspective Information for Efficient Crowd Counting

Miaojing Shi, Zhaohui Yang|arXiv (Cornell University)|Jul 5, 2018
Video Surveillance and Tracking Methods参考文献 53被引用 15
一句话总结

该论文提出了一种视角感知卷积神经网络(PACNN),通过将学习到的视角图整合到多尺度密度回归中,实现高效人群计数。通过生成真实标签视角图并将其作为可微分、可学习的加权层,PACNN 自适应地融合多尺度密度预测,在 ShanghaiTech、WorldExpo’10、UCF_CC_50 和 UCSD 数据集上实现了最先进(SOTA)的准确率与推理速度,UCSD 数据集上的 MAE 低至 0.89。

ABSTRACT

Crowd counting is the task of estimating people numbers in crowd images. Modern crowd counting methods employ deep neural networks to estimate crowd counts via crowd density regressions. A major challenge of this task lies in the perspective distortion, which results in drastic person scale change in an image. Density regression on the small person area is in general very hard. In this work, we propose a perspective-aware convolutional neural network (PACNN) for efficient crowd counting, which integrates the perspective information into density regression to provide additional knowledge of the person scale change in an image. Ground truth perspective maps are firstly generated for training; PACNN is then specifically designed to predict multi-scale perspective maps, and encode them as perspective-aware weighting layers in the network to adaptively combine the outputs of multi-scale density maps. The weights are learned at every pixel of the maps such that the final density combination is robust to the perspective distortion. We conduct extensive experiments on the ShanghaiTech, WorldExpo'10, UCF_CC_50, and UCSD datasets, and demonstrate the effectiveness and efficiency of PACNN over the state-of-the-art.

研究动机与目标

  • 为解决人群计数中的视角失真问题,该问题导致尺度剧烈变化,阻碍对小个体区域的准确密度回归。
  • 实现在无需依赖外部相机标定或场景几何标注的情况下,实现高效且准确的人群计数。
  • 在训练过程中端到端学习视角图,并将其作为网络中的自适应、可微分加权层使用。
  • 通过引入考虑个体尺度变化的视角感知注意力机制,改进多尺度密度图的融合。
  • 在保持快速推理速度的前提下,实现最先进(SOTA)的性能表现,尤其在存在严重视角失真的场景中。

提出的方法

  • 通过采样个体尺度关系并基于每张图像的视角几何关系拟合非线性函数,生成真实标签视角图。
  • 训练一个深度卷积神经网络,从输入图像端到端预测视角图,从而在测试时无需外部标注即可进行推理。
  • 引入两个视角感知加权层,其中像素级权重通过在不同分辨率下对预测的视角图进行非线性变换来学习。
  • 利用这些学习到的权重自适应地组合多尺度密度图,使最终的密度预测对视角失真具有鲁棒性。
  • 通过结合密度回归与视角图预测的多任务损失进行网络训练,以提升泛化能力。
  • 该方法支持基于图像的推理,实现快速推理(例如,1024×768 输入图像仅需 230ms),无需基于图像块的处理。

实验结果

研究问题

  • RQ1是否可以有效学习并整合视角信息到深度神经网络中用于人群计数,而无需依赖相机标定或场景几何信息?
  • RQ2在严重视角失真条件下,学习视角图如何改善多尺度密度融合?
  • RQ3视角感知加权机制是否能在准确率和推理速度方面优于标准的多尺度融合方法?
  • RQ4所提出的方法是否能在具有不同人群密度和视角失真的数据集之间实现良好泛化?
  • RQ5视角图的集成是否能以最小的计算开销实现最先进(SOTA)的性能表现?

主要发现

  • 在 UCSD 数据集上,PACNN 实现了最低的 MAE(0.89)和 MSE(1.18),优于所有先前方法。
  • 在 UCF_CC_50 数据集上,当与 [17] 主干网络结合时,PACNN 实现了 MAE 241.7 和 MSE 320.7,创下新的 SOTA 记录。
  • 在 WorldExpo’10 数据集上,PACNN 在全部五个场景中均实现了最低的平均 MAE(7.8),展现出对视角变化的强鲁棒性。
  • 在 ShanghaiTech 数据集上,PACNN 实现了 MAE 62.4 和 MSE 102.0,优于此前的 SOTA 方法,且采用基于图像的推理方式。
  • 对于 1024×768 的图像,推理时间仅为 230ms,显著快于基于图像块的方法(例如快 5 倍)。
  • 该方法在多种数据集上表现出良好的泛化能力,涵盖稀疏(UCSD)和密集(ShanghaiTech)人群场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。