[论文解读] Scene-Adaptive Attention Network for Crowd Counting
本文提出SAANet,一种用于人群计数的场景自适应注意力网络,其在Transformer主干网络中采用可变形注意力机制,以动态适应不同人群规模和场景布局的采样位置与注意力权重。该方法在现有CNN和Transformer模型中实现了最先进性能,在NWPU-Crowd基准上排名第一,且在准确率和效率方面均有提升。
In recent years, significant progress has been made on the research of crowd counting. However, as the challenging scale variations and complex scenes existed in crowds, neither traditional convolution networks nor recent Transformer architectures with fixed-size attention could handle the task well. To address this problem, this paper proposes a scene-adaptive attention network, termed SAANet. First of all, we design a deformable attention in-built Transformer backbone, which learns adaptive feature representations with deformable sampling locations and dynamic attention weights. Then we propose the multi-level feature fusion and count-attentive feature enhancement modules further, to strengthen feature representation under the global image context. The learned representations could attend to the foreground and are adaptive to different scales of crowds. We conduct extensive experiments on four challenging crowd counting benchmarks, demonstrating that our method achieves state-of-the-art performance. Especially, our method currently ranks No.1 on the public leaderboard of the NWPU-Crowd benchmark. We hope our method could be a strong baseline to support future research in crowd counting. The source code will be released to the community.
研究动机与目标
- 解决固定感受野CNN和窗口化注意力Transformer在处理人群计数中尺度变化和复杂场景时的局限性。
- 开发一种灵活的注意力机制,能够适应场景布局和目标尺度变化,且无需依赖真实边界框。
- 通过多层级特征融合与计数注意力特征增强模块,提升特征表示和密度估计性能。
- 在降低计算成本和模型参数量的前提下,实现最先进性能。
提出的方法
- 提出Deformer,一种新型Transformer主干网络,结合可变形注意力与全局注意力,通过可学习采样偏移量和动态注意力权重,学习自适应特征表示。
- 采用可变形注意力,实现空间自适应的特征聚合,从而更好地建模人群中的透视失真和尺度变化。
- 提出多层级特征融合(MFF)模块,利用可变形注意力在不同阶段间高效融合特征,提升定位和计数精度。
- 引入计数注意力特征增强(CAFE)模块,由堆叠的Transformer解码器层构成,并通过计数损失监督,利用学习到的注意力图重新校准特征。
- 在Deformer中采用混合注意力策略,交替使用局部可变形注意力与全局注意力,以平衡效率与表征能力。
- 使用标准密度回归头,结合L1/L2损失进行最终计数,与所提组件端到端联合训练。
实验结果
研究问题
- RQ1在Transformer主干网络中引入可变形注意力机制,是否能提升在大规模尺度变化和复杂场景下的人群计数特征表示?
- RQ2所提出的Deformer主干网络相较于固定窗口大小的注意力机制和标准自注意力机制,在适应性和性能方面表现如何?
- RQ3多层级特征融合与计数注意力特征增强在多大程度上提升了计数精度和定位能力?
- RQ4所提方法是否能在多样化的群体计数基准上实现良好泛化,且仅依赖最少的架构假设?
- RQ5与现有最先进方法相比,该模型是否在更低的计算成本和参数量下实现了最先进性能?
主要发现
- SAANet在NWPU-Crowd基准上表现最佳,其公开排行榜排名第一,平均绝对误差(MAE)为51.7,均方误差(MSE)为80.1。
- Deformer主干网络优于更大的模型(如Twins-large和Twins-base),展现出更优的参数效率和准确性。
- 与单层级基线相比,多层级特征融合(MFF)模块将MAE降低0.6,MSE降低2.1。
- 与基线相比,计数注意力特征增强(CAFE)模块进一步将MAE降低1.0,MSE降低3.1。
- MFF与CAFE的结合实现了最佳性能,相比基线将MAE降低2.1,MSE降低6.2。
- 可视化结果表明,即使在无真实边界框监督的情况下,可变形注意力的采样点与偏移量仍与目标尺度呈正相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。