[论文解读] Crowd Counting via Hierarchical Scale Recalibration Network
本文提出了一种新型单列多尺度人群计数框架——分层尺度重校准网络(HSRNet),通过建模通道与空间依赖关系的尺度聚焦模块(SFM)增强特征表示,并利用自适应多尺度融合的尺度重校准模块(SRM)。该方法引入尺度一致性损失,将各尺度特定的预测与真实密度图对齐,实现在多个主流人群计数基准上的最先进性能,并在车辆计数任务中展现出良好的泛化能力。
The task of crowd counting is extremely challenging due to complicated difficulties, especially the huge variation in vision scale. Previous works tend to adopt a naive concatenation of multi-scale information to tackle it, while the scale shifts between the feature maps are ignored. In this paper, we propose a novel Hierarchical Scale Recalibration Network (HSRNet), which addresses the above issues by modeling rich contextual dependencies and recalibrating multiple scale-associated information. Specifically, a Scale Focus Module (SFM) first integrates global context into local features by modeling the semantic inter-dependencies along channel and spatial dimensions sequentially. In order to reallocate channel-wise feature responses, a Scale Recalibration Module (SRM) adopts a step-by-step fusion to generate final density maps. Furthermore, we propose a novel Scale Consistency loss to constrain that the scale-associated outputs are coherent with groundtruth of different scales. With the proposed modules, our approach can ignore various noises selectively and focus on appropriate crowd scales automatically. Extensive experiments on crowd counting datasets (ShanghaiTech, MALL, WorldEXPO'10, and UCSD) show that our HSRNet can deliver superior results over all state-of-the-art approaches. More remarkably, we extend experiments on an extra vehicle dataset, whose results indicate that the proposed model is generalized to other applications.
研究动机与目标
- 解决人群计数中极端尺度变化的挑战,即行人密度在图像内及图像间存在显著差异。
- 克服现有方法简单拼接或平均多尺度特征所导致的尺度混乱与噪声传播问题。
- 设计统一的网络架构,使每一层能自适应地聚焦于相关尺度,并生成一致且具备尺度感知能力的预测结果。
- 通过强制各尺度输出与对应真实密度图之间的一致性,提升模型的泛化能力。
- 在多样化数据集上验证模型的有效性,包括新引入的车辆计数数据集。
提出的方法
- 尺度聚焦模块(SFM)按顺序建模通道与空间维度的全局上下文:首先对空间特征进行压缩以生成通道权重,再对通道特征进行压缩以生成空间掩码,实现特征的自适应重校准。
- SFM 使用聚焦权重进行逐元素乘法操作,对特征图进行重校准,使每一层能够突出其感受野尺度范围内最相关的特征。
- 尺度重校准模块(SRM)沿通道维度切分特征图,提取与尺度相关的特征,再通过特定于尺度的融合策略进行融合,生成多尺度预测结果。
- 提出一种新型尺度一致性损失,通过在不同滤波器尺寸下进行平均池化生成对应的真实密度图,对每个尺度特定的输出进行监督。
- 网络采用两阶段训练:首先在主干网络每一层应用SFM以增强各尺度的特征表示;其次,通过SRM聚合这些特征以生成最终的密度图预测。
- 该架构端到端可训练,且在不依赖多列或多路径结构的前提下,保持了分层的尺度感知能力。
实验结果
研究问题
- RQ1在单列网络中,如何自适应地重校准深层特征,以在不同层强调相关尺度?
- RQ2按顺序建模通道与空间依赖关系,在极端尺度变化下是否能显著改善人群计数的特征表示?
- RQ3尺度一致性损失能否有效对齐多尺度网络输出与不同尺度下的真实密度图?
- RQ4所提出的HSRNet是否能超越人群计数任务,尤其在其他密度估计任务(如车辆计数)中实现良好泛化?
- RQ5与标准的多尺度特征拼接或平均方法相比,HSRNet的分层结构在准确率与鲁棒性方面表现如何?
主要发现
- HSRNet在四个基准人群计数数据集上达到最先进性能:ShanghaiTech Part A(62.3 MAE)、Part B(7.2 MAE)、MALL 和 WorldExpo’10。
- 消融实验表明,SFM中通道+空间的序列设计表现最佳(Part A 上为62.3 MAE),优于空间+通道与并行结构设计。
- 尺度一致性损失显著提升了各尺度输出与其对应真实密度图之间的对齐程度,如图5所示。
- HSRNet在ShanghaiTech Part A数据集上五档密度水平下均表现出优越的尺度不变性,优于MCNN与CSRNet,尤其在密集场景中优势明显。
- 该模型在其他任务中也展现出良好泛化能力,在新评估的车辆计数数据集上取得优异结果,表明其在人群计数之外具有广泛适用性。
- 通过具备尺度感知的特征重校准的分层设计,网络能自动选择性忽略噪声并聚焦于适当的群体尺度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。