[论文解读] SOFA-Net: Second-Order and First-order Attention Network for Crowd Counting
SOFA-Net 提出了一种新颖的深度学习框架用于人群计数,通过利用二阶和一阶统计特征来增强密集人群场景下的特征表示。通过引入一种统计感知卷积(Statistic-Wise Convolution)和多流注意力架构,该模型提升了密度图回归性能,在四个公开数据集上实现了最先进(SOTA)的性能表现,其在 ShanghaiTech Part A 数据集上的平均绝对误差(MAE)达到 57.5。
Automated crowd counting from images/videos has attracted more attention in recent years because of its wide application in smart cities. But modelling the dense crowd heads is challenging and most of the existing works become less reliable. To obtain the appropriate crowd representation, in this work we proposed SOFA-Net(Second-Order and First-order Attention Network): second-order statistics were extracted to retain selectivity of the channel-wise spatial information for dense heads while first-order statistics, which can enhance the feature discrimination for the heads' areas, were used as complementary information. Via a multi-stream architecture, the proposed second/first-order statistics were learned and transformed into attention for robust representation refinement. We evaluated our method on four public datasets and the performance reached state-of-the-art on most of them. Extensive experiments were also conducted to study the components in the proposed SOFA-Net, and the results suggested the high-capability of second/first-order statistics on modelling crowd in challenging scenarios. To the best of our knowledge, we are the first work to explore the second/first-order statistics for crowd counting.
研究动机与目标
- 为解决现有方法在高度密集且存在遮挡的场景中因特征表示能力差而失效的问题,提升人群计数的准确性。
- 探索二阶与一阶统计特征在建模复杂场景下人群模式的可行性和有效性。
- 设计一种多流注意力机制,整合二阶与一阶统计信息,以优化密度图预测。
- 通过定制化组件(如统计感知卷积、归一化掩码和尺度增强)提升密度图回归的质量。
- 通过实证验证二阶与一阶统计特征在增强特征判别力和空间选择性方面的互补性。
提出的方法
- 该模型采用多流架构,从特征图中学习二阶(SO)和一阶(FO)统计特征,以增强密集头部区域的表征能力。
- 提出一种统计感知卷积操作,将二阶与一阶统计量转化为可学习的注意力图,用于特征精炼。
- 二阶统计量保留了密集头部区域的空间选择性与高可能性,而一阶统计量则增强了头部区域的特征判别力。
- 通过端到端训练的归一化掩码对密度图进行缩放,并抑制非头部区域的冗余输出,从而提升回归精度。
- 网络采用三流权重共享机制,在不同特征流与任务间共享参数,实现特征学习与归一化过程的高效联合优化。
- 应用尺度增强与归一化策略,以提升生成密度图的质量,尤其在大规模人群场景中表现更优。
实验结果
研究问题
- RQ1二阶与一阶统计特征是否能提升在高度密集与遮挡场景下的人群表征能力?
- RQ2二阶与一阶统计特征在建模人群密度模式时如何实现互补?
- RQ3将二阶与一阶统计特征整合后,对密度图回归性能有何影响?
- RQ4所提出的统计感知卷积在将统计特征转化为注意力图方面效果如何?
- RQ5采用三流权重共享方案训练的归一化掩码是否相比非共享或全共享方案能更有效地提升密度图质量?
主要发现
- 所提出的 SOFA-Net 在具有挑战性的 ShanghaiTech Part A 数据集上实现了 57.5 的平均绝对误差(MAE),优于以往最先进方法。
- 二阶统计注意力对性能提升贡献最大,将 MAE 从无注意力时的 68.6 降低至 60.8。
- 二阶与一阶特征的结合取得了最佳结果,使 ShanghaiTech Part A 上的 MAE 降至 57.5,MSE 降至 92.1。
- 消融实验证实,采用三流权重共享方案训练的归一化掩码在性能上显著优于非共享或全共享方案。
- 定性结果表明,二阶特征保留了精确的头部区域可能性,一阶特征增强了边界判别能力,二者融合生成了最清晰且最准确的密度图。
- 该模型在极端场景下表现出强鲁棒性,即使在人群数量超过一千人的场景中,也能生成准确的密度图。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。