Skip to main content
QUICK REVIEW

[论文解读] Rethinking Global Context in Crowd Counting

Guolei Sun, Yun Liu|arXiv (Cornell University)|May 23, 2021
Video Surveillance and Tracking Methods参考文献 87被引用 9
一句话总结

该论文提出了一种基于视觉Transformer的群体计数方法,通过引入上下文标记(context token)和标记注意力模块(TAM)来增强全局上下文建模,以重新校准通道特征,同时利用回归标记模块(RTM)对总人群数量进行监督。该方法在多个基准数据集上实现了最先进(SOTA)的性能,相较于基线模型将平均绝对误差(MAE)降低了最多4.2。

ABSTRACT

This paper investigates the role of global context for crowd counting. Specifically, a pure transformer is used to extract features with global information from overlapping image patches. Inspired by classification, we add a context token to the input sequence, to facilitate information exchange with tokens corresponding to image patches throughout transformer layers. Due to the fact that transformers do not explicitly model the tried-and-true channel-wise interactions, we propose a token-attention module (TAM) to recalibrate encoded features through channel-wise attention informed by the context token. Beyond that, it is adopted to predict the total person count of the image through regression-token module (RTM). Extensive experiments on various datasets, including ShanghaiTech, UCF-QNRF, JHU-CROWD++ and NWPU, demonstrate that the proposed context extraction techniques can significantly improve the performance over the baselines.

研究动机与目标

  • 探究在缺乏显式几何或语义场景知识的情况下,全局上下文在群体计数中的作用。
  • 解决视觉Transformer在建模通道间特征交互方面的局限性,而这种交互对鲁棒的特征表示至关重要。
  • 通过引入上下文感知注意力机制和辅助监督,提升密度图预测和总人群数量回归的性能。
  • 证明通过专用上下文标记显式建模全局上下文可显著提升密集人群计数的性能。

提出的方法

  • 使用视觉Transformer从重叠图像块中提取全局特征,并在输入序列中添加一个专用上下文标记以表示全局图像上下文。
  • 标记注意力模块(TAM)通过基于上下文标记计算注意力权重,实现通道间的特征重校准,从而捕捉通道间依赖关系。
  • 回归标记模块(RTM)用于预测图像中的总人数,并提供辅助损失以指导上下文标记的训练。
  • 最终特征图通过两层转置卷积层上采样,生成预测的群体密度图。
  • 模型采用联合损失进行训练,结合像素级密度图损失和总人数回归损失,通过超参数λr控制损失权重。
  • 该方法在四个标准数据集(ShanghaiTech、UCF-QNRF、JHU-CROWD++和NWPU)上进行评估,使用MAE和MSE作为评价指标。

实验结果

研究问题

  • RQ1在缺乏显式几何或语义监督的情况下,带有专用上下文标记的视觉Transformer能否有效建模群体计数的全局场景上下文?
  • RQ2在视觉Transformer的背景下,所提出的标记注意力模块(TAM)与传统的通道注意力机制(如SE和CBAM)相比表现如何?
  • RQ3通过回归标记模块(RTM)引入的辅助监督是否能提升总人群数量预测和密度图估计的准确性?
  • RQ4控制回归损失贡献的超参数λr在较大取值范围内变化时,该方法的性能是否具有鲁棒性?
  • RQ5所提出的全局上下文建模技术带来的性能提升是否随数据集规模的增大而增强?

主要发现

  • 所提方法在ShanghaiTech A数据集上实现了53.1的平均绝对误差(MAE),相较于基线模型降低了4.2点。
  • 标记注意力模块(TAM)相比基线模型将MAE降低2.2、MSE降低2.8,通过上下文感知注意力机制优于SE和CBAM模块。
  • 将TAM与回归标记模块(RTM)结合后性能最佳,相比基线模型将MAE降低4.2、MSE降低6.8。
  • 模型对超参数λr具有鲁棒性,在0.01至1.0的广泛取值范围内性能下降极小。
  • 在大规模数据集(JHU-CROWD++和NWPU)上,该方法相比小规模数据集(ShanghaiTech和UCF-QNRF)表现出更显著的性能提升,表明数据规模影响全局上下文建模的有效性。
  • 失败案例主要源于训练数据中未充分涵盖的低质量或低对比度输入图像,表明在视觉条件较差时存在泛化挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。