[论文解读] Crowd Counting on Images with Scale Variation and Isolated Clusters
本文提出SACANet,一种针对人群计数的尺度自适应、长程上下文感知网络,通过金字塔上下文模块、尺度自适应自注意力多分支架构和层级融合,解决大规模变化和孤立小簇群的问题。在VisDrone2019和ShanghaiTech基准上,SACANet实现了最先进的性能,且在极端人群条件下(具有多样尺度和分散簇群)的MAE显著降低。
Crowd counting is to estimate the number of objects (e.g., people or vehicles) in an image of unconstrained congested scenes. Designing a general crowd counting algorithm applicable to a wide range of crowd images is challenging, mainly due to the possibly large variation in object scales and the presence of many isolated small clusters. Previous approaches based on convolution operations with multi-branch architecture are effective for only some narrow bands of scales and have not captured the long-range contextual relationship due to isolated clustering. To address that, we propose SACANet, a novel scale-adaptive long-range context-aware network for crowd counting. SACANet consists of three major modules: the pyramid contextual module which extracts long-range contextual information and enlarges the receptive field, a scale-adaptive self-attention multi-branch module to attain high scale sensitivity and detection accuracy of isolated clusters, and a hierarchical fusion module to fuse multi-level self-attention features. With group normalization, SACANet achieves better optimality in the training process. We have conducted extensive experiments using the VisDrone2019 People dataset, the VisDrone2019 Vehicle dataset, and some other challenging benchmarks. As compared with the state-of-the-art methods, SACANet is shown to be effective, especially for extremely crowded conditions with diverse scales and scattered clusters, and achieves much lower MAE as compared with baselines.
研究动机与目标
- 解决人群计数中大规模变化的挑战,即相同物理尺寸的物体因视角和距离而呈现不同大小。
- 克服局部感受野在捕捉孤立小簇群长程上下文信息方面的局限性。
- 设计一种在多样化尺度和分散簇群下保持高精度的模型,尤其在极度拥挤场景中。
- 通过集成尺度自适应注意力和层级特征融合,提升密度图回归性能。
- 在具有极端尺度变化和孤立簇群的挑战性基准上,实现比现有方法更好的泛化能力与更低的误差(MAE/MSE)。
提出的方法
- 采用金字塔上下文模块,利用空洞卷积和多尺度特征聚合提取长程上下文特征,并扩展感受野。
- 引入尺度自适应自注意力机制,根据物体尺度动态选择最合适的卷积分支,增强对小尺寸和远距离簇群的敏感性。
- 采用多分支架构并结合组归一化,提升跨尺度的训练稳定性和特征表示能力。
- 实施层级融合模块,整合多层级自注意力特征,实现局部与全局上下文的有效融合。
- 在整个网络中应用组归一化,以改善训练过程中的优化与泛化能力。
- 使用密度图回归进行端到端训练,结合L1和L2损失,最小化MAE与MSE以实现计数估计。
实验结果
研究问题
- RQ1深度学习模型如何在不依赖固定卷积核大小的前提下,有效处理人群计数中的大规模变化?
- RQ2长程上下文建模在提升拥挤场景中孤立小簇群检测能力方面,能发挥多大作用?
- RQ3尺度自适应注意力机制是否能同时提升在多样化尺度下大、小物体的检测性能?
- RQ4多层级自注意力特征的层级融合如何提升整体计数精度?
- RQ5SACANet在具有极端尺度变化和分散簇群的基准上,是否比SOTA方法具有更好的泛化能力?
主要发现
- 在ShanghaiTech A数据集上,SACANet的MAE为64.4,在ShanghaiTech B上为7.8,优于先前SOTA方法SANet(MAE分别为67.0和8.4)。
- 在VisDrone2019 Vehicle数据集上,SACANet的MAE为11.3,显著低于MCNN的13.1,表明在极度拥挤场景中性能更优。
- 与SANet相比,SACANet在ShanghaiTech A上的MAE降低超过7%,在ShanghaiTech B上降低约4%,显示出显著的精度提升。
- 消融实验表明,金字塔上下文模块、尺度自适应自注意力和层级融合各组件均对性能提升有贡献,完整模型达到最佳效果。
- SACANet在所有尺度变化(CV)和孤立簇群(DVI)子集上均持续优于MCNN,具有更低的MAE与MSE,尤其在高CV和高DVI场景下表现更优。
- 组归一化的使用提升了训练的最优性,有助于在不同数据集上实现更好的收敛与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。