[论文解读] FusionCount: Efficient Crowd Counting via Multiscale Feature Fusion
FusionCount 提出了一种高效的群体计数模型,通过利用来自多个编码器层的多尺度特征融合,而非依赖额外的多尺度模块,显著降低了计算成本,同时在 ShanghaiTech A 和 B 基准上实现了最先进性能,且 MAE 和 RMSE 均更低。
State-of-the-art crowd counting models follow an encoder-decoder approach. Images are first processed by the encoder to extract features. Then, to account for perspective distortion, the highest-level feature map is fed to extra components to extract multiscale features, which are the input to the decoder to generate crowd densities. However, in these methods, features extracted at earlier stages during encoding are underutilised, and the multiscale modules can only capture a limited range of receptive fields, albeit with considerable computational cost. This paper proposes a novel crowd counting architecture (FusionCount), which exploits the adaptive fusion of a large majority of encoded features instead of relying on additional extraction components to obtain multiscale features. Thus, it can cover a more extensive scope of receptive field sizes and lower the computational cost. We also introduce a new channel reduction block, which can extract saliency information during decoding and further enhance the model's performance. Experiments on two benchmark databases demonstrate that our model achieves state-of-the-art results with reduced computational complexity.
研究动机与目标
- 解决现有群体计数模型对浅层编码器特征利用不足且依赖昂贵多尺度模块的局限性。
- 在保持或提升准确率的同时,降低多尺度特征提取的计算复杂度。
- 通过引入一种新颖的通道缩减模块,在解码过程中提取显著性特征,从而提升模型性能。
- 在不使用额外模块的情况下,利用多个编码器阶段的特征实现全面的感受野覆盖(6 到 192)。
- 在相比现有基于 VGG 的模型显著减少浮点运算量的前提下,实现最先进性能。
提出的方法
- 使用 VGG-16 的前 17 层作为编码器,从多个阶段(从第 3 层开始)收集特征图,以捕捉不同大小的感受野。
- 通过将相同空间分辨率的特征分组并使用可学习权重进行融合,实现第一阶段的特征融合,生成多尺度表征。
- 引入基于对比特征的融合机制,从对比特征而非原始特征计算注意力权重,从而提升融合质量。
- 采用包含逐点卷积和级联空洞卷积的通道缩减模块,在保留显著信息的同时减少通道维度。
- 使用解码器,将第一阶段融合的多尺度特征与通道缩减后的特征进行融合,生成最终的密度图。
- 采用标准损失函数(MSE、MAE)进行训练,除融合与缩减模块外,无其他架构创新。
实验结果
研究问题
- RQ1是否可以通过利用多个编码器层的特征,在不引入额外模块的情况下有效捕捉多尺度特征表示?
- RQ2与仅使用最深层特征图相比,从多个编码器阶段融合特征在准确率和效率方面表现如何?
- RQ3所提出的基于对比特征的融合机制是否优于直接特征融合?
- RQ4通道缩减模块在解码过程中聚焦显著特征,能在多大程度上提升模型性能?
- RQ5模型是否能以显著降低的计算成本,实现相比现有最先进方法的群体计数最先进准确率?
主要发现
- 在 ShanghaiTech B 数据集上,FusionCount 实现了最低的 MAE(6.9)和 RMSE(11.8),优于所有对比模型,包括 CSRNet、CAN、BL 和 DM-Count。
- 在 ShanghaiTech A 上,FusionCount 实现了第二低的 MAE(13.4),尽管该数据集训练难度较高,仍表现出强劲性能。
- 使用原始特征而非对比特征的变体模型,其 MAE(7.6)和 RMSE(12.9)更高,证实了对比特征融合机制的有效性。
- 消融实验表明,通道缩减模块中的逐点卷积和空洞卷积层均不可或缺,移除任一者均导致 MAE 和 RMSE 上升。
- FusionCount 在显著降低计算复杂度的前提下实现了最先进结果,FLOPs 低于 CAN 和 CSRNet 等模型,证明了其高效性。
- 定性结果表明,即使在高度拥挤场景(如超过 1,600 人,相对误差 1.98%)和强尺度变化条件下,也能实现精确的密度估计,验证了模型的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。