[论文解读] Boosting Crowd Counting via Multifaceted Attention
本文提出多面注意力网络(MAN),通过引入可学习局部注意力、局部注意力正则化以及实例级注意力监督,提升在高度多样化场景下的人群计数性能。MAN在四个基准数据集上达到最先进性能,相较于基线方法,平均绝对误差(MAE)降低15.1%,均方误差(MSE)降低12.9%。
This paper focuses on the challenging crowd counting task. As large-scale variations often exist within crowd images, neither fixed-size convolution kernel of CNN nor fixed-size attention of recent vision transformers can well handle this kind of variation. To address this problem, we propose a Multifaceted Attention Network (MAN) to improve transformer models in local spatial relation encoding. MAN incorporates global attention from a vanilla transformer, learnable local attention, and instance attention into a counting model. Firstly, the local Learnable Region Attention (LRA) is proposed to assign attention exclusively for each feature location dynamically. Secondly, we design the Local Attention Regularization to supervise the training of LRA by minimizing the deviation among the attention for different feature locations. Finally, we provide an Instance Attention mechanism to focus on the most important instances dynamically during training. Extensive experiments on four challenging crowd counting datasets namely ShanghaiTech, UCF-QNRF, JHU++, and NWPU have validated the proposed method. Codes: https://github.com/LoraLinH/Boosting-Crowd-Counting-via-Multifaceted-Attention.
研究动机与目标
- 解决人群图像中大规模变化带来的挑战,此类变化会降低固定感受野卷积神经网络(CNN)与视觉变换器中固定尺寸注意力机制的性能。
- 通过用每个特征位置的动态可学习区域注意力替代标准视觉变换器中的刚性分块注意力,改进视觉变换器中的局部空间编码。
- 通过一种新颖的局部注意力正则化(LAR)方法,最小化不同特征位置间注意力权重的偏差,实现注意力分配的平衡。
- 通过引入动态实例注意力机制,在训练过程中仅聚焦于最可靠的实例,从而减轻噪声或稀疏点标注对人群计数的负面影响。
- 在多个标准人群计数基准上实现最先进性能,且计算开销极低。
提出的方法
- 提出可学习区域注意力(LRA),一种动态局部注意力机制,为每个特征位置学习独特的感受野,替代标准视觉变换器中的固定尺寸分块。
- 引入局部注意力正则化(LAR),一种训练损失,通过惩罚不同特征位置间注意力权重的偏差,促进注意力分配的平衡与高效。
- 设计实例注意力损失(IAL),通过仅聚焦于最一致的预测结果,在训练过程中动态抑制低质量或噪声点标注。
- 将LRA、LAR与IAL整合到统一的基于变换器的计数框架中,结合全局自注意力与自适应局部及实例级注意力。
- 使用CNN主干网络提取特征,随后通过带有LRA的变换器编码器,最后通过回归头预测密度图。
- 采用标准回归损失与所提出的IAL和LAR损失相结合的方式,端到端优化完整模型。
实验结果
研究问题
- RQ1可学习的动态局部注意力机制是否能改善视觉变换器在人群计数任务中的局部上下文编码?
- RQ2通过LAR对特征位置间注意力分布进行正则化,是否能带来更鲁棒且更均衡的注意力分配?
- RQ3动态实例级注意力是否能提升模型对人群计数中噪声或稀疏点标注的鲁棒性?
- RQ4结合全局、局部与实例级注意力机制是否能在多样化的主流人群计数基准上持续提升性能?
- RQ5与现有基于CNN和视觉变换器的人群计数模型相比,所提出的MAN在效率与准确性方面表现如何?
主要发现
- MAN在四个主要人群计数基准数据集(ShanghaiTech、UCF-QNRF、JHU++和NWPU)上达到最先进性能。
- 在UCF-QNRF数据集上,与基线方法BL相比,所提方法将MAE降低15.1%,MSE降低12.9%。
- 仅添加LRA即可使MAE提升2.7%,MSE提升3.5%;与IAL结合后性能进一步提升。
- 局部注意力正则化(LAR)显著稳定了训练过程并改善了注意力分布,实例注意力损失中δ=0.9时性能最优。
- 模型保持了较低的计算成本,FLOPs仅增加少量(58.2 GFLOPs),推理时间也仅略微延长(11.3秒/100张图像),相比ViT-B和VGG19+Trans。
- 可视化结果表明,LRA能自适应地缩小注意力区域以适应较小人群,表现出类人注意力效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。