Skip to main content
QUICK REVIEW

[论文解读] Crowd Scene Analysis by Output Encoding

Yao Xue, Siming Liu|arXiv (Cornell University)|Jan 27, 2020
Anomaly Detection Techniques and Applications参考文献 49被引用 4
一句话总结

该论文提出了一种基于压缩感知的输出编码(CSOE)框架,用于人群场景分析,将人群定位问题视为在压缩编码空间中的信号回归,显著提升了在高度拥挤场景中的定位精度。通过整合多空洞卷积分支(MDCB)与自适应感受野加权(ARFW),该方法有效处理了大规模变化,并在四个基准数据集上实现了最先进性能,尤其在密集人群场景中表现卓越。

ABSTRACT

Crowd scene analysis receives growing attention due to its wide applications. Grasping the accurate crowd location (rather than merely crowd count) is important for spatially identifying high-risk regions in congested scenes. In this paper, we propose a Compressed Sensing based Output Encoding (CSOE) scheme, which casts detecting pixel coordinates of small objects into a task of signal regression in encoding signal space. CSOE helps to boost localization performance in circumstances where targets are highly crowded without huge scale variation. In addition, proper receptive field sizes are crucial for crowd analysis due to human size variations. We create Multiple Dilated Convolution Branches (MDCB) that offers a set of different receptive field sizes, to improve localization accuracy when objects sizes change drastically in an image. Also, we develop an Adaptive Receptive Field Weighting (ARFW) module, which further deals with scale variation issue by adaptively emphasizing informative channels that have proper receptive field size. Experiments demonstrate the effectiveness of the proposed method, which achieves state-of-the-art performance across four mainstream datasets, especially achieves excellent results in highly crowded scenes. More importantly, experiments support our insights that it is crucial to tackle target size variation issue in crowd analysis task, and casting crowd localization as regression in encoding signal space is quite effective for crowd analysis.

研究动机与目标

  • 为解决在高密度人群场景中基于密度的方法无法准确定位个体对象的挑战。
  • 克服直接像素坐标回归方法在密集人群场景中因位置偏移和尺寸缩放误差导致的局限性。
  • 提升对单幅图像中人体头部尺寸大规模变化的鲁棒性。
  • 开发一种即使在物体密集堆积且被遮挡时仍能保持高定位精度的方法。
  • 验证将定位问题转化为编码信号空间中的回归任务,相较于直接坐标预测,在人群场景中更具有效性。

提出的方法

  • CSOE模块将稀疏的人群位置(头部质心)编码为压缩的密集信号向量,将定位任务转化为信号回归问题。
  • 使用CNN回归器预测压缩信号向量,并通过重建算法将其还原为稀疏的像素坐标。
  • 引入多空洞卷积分支(MDCB),提供多个固定感受野大小,增强对不同物体尺度的检测能力。
  • 自适应感受野加权(ARFW)动态强调感受野最适配于目标尺度的特征通道,提升模型泛化能力。
  • 模型采用端到端训练,损失函数为稀疏重建损失,通过压缩感知原理保留空间关系。
  • 应用中心池化以增强对象中心区域的特征学习,从而提升定位精度。

实验结果

研究问题

  • RQ1通过压缩感知压缩输出空间,是否能相比直接坐标回归显著提升在高度拥挤场景中的定位精度?
  • RQ2在单幅图像中,使用多空洞卷积分支处理人体头部尺寸大规模变化的效率如何?
  • RQ3基于尺度自适应加权感受野是否能提升复杂人群场景中的定位性能?
  • RQ4所提方法在多样化的数据集上,于计数与定位任务中,相较于现有最先进方法的性能提升程度如何?
  • RQ5CSOE、MDCB与ARFW三者结合是否具有协同增益效应,尤其在高密度场景中?

主要发现

  • 完整模型(CSOE + MDCB + CP + ARFW)在ShanghaiTech(Sh-A)数据集上取得0.831的最高F1分数,优于所有消融实验配置。
  • 该模型在ShanghaiTech(Sh-B)数据集上取得0.834的F1分数,展现出在不同人群密度下的强大泛化能力。
  • ARFW模块与MDCB结合后,相比无自适应加权的配置,F1分数提升0.027–0.045分,证实其在尺度处理方面的有效性。
  • MDCB+ARFW配置在所有双组件配置中取得最高F1分数,表明尺度变化是人群定位中的关键因素。
  • 消融实验表明,仅使用CSOE的单组件配置性能最佳,支持核心观点:信号空间回归比像素空间回归更有效。
  • 该模型在所有四个基准数据集(ShanghaiTech、UCF、WorldExpo)上均达到最先进性能,尤其在传统方法失效的高密度场景中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。