[论文解读] Reinforcing Local Feature Representation for Weakly-Supervised Dense Crowd Counting
该论文提出了一种自适应特征相似性学习(SFSL)网络和全局-局部一致性(GLC)损失,以增强弱监督密集人群计数中的局部特征表示,其中仅可获得全局人群数量。通过学习无偏的特征估计并强制全局与局部预测之间的一致性,该方法在显著减少标注工作量的同时,实现了接近全监督方法的性能。
Fully-supervised crowd counting is a laborious task due to the large amounts of annotations. Few works focus on weekly-supervised crowd counting, where only the global crowd numbers are available for training. The main challenge of weekly-supervised crowd counting is the lack of local supervision information. To address this problem, we propose a self-adaptive feature similarity learning (SFSL) network and a global-local consistency (GLC) loss to reinforce local feature representation. We introduce a feature vector which represents the unbiased feature estimation of persons. The network updates the feature vector self-adaptively and utilizes the feature similarity for the regression of crowd numbers. Besides, the proposed GLC loss leverages the consistency between the network estimations from global and local areas. The experimental results demonstrate that our proposed method based on different backbones narrows the gap between weakly-supervised and fully-supervised dense crowd counting.
研究动机与目标
- 解决弱监督人群计数中局部监督有限的问题,其中仅可获得全局人群数量。
- 在缺乏实例级标注的情况下,提升局部特征的可区分性。
- 通过利用全局人群数量和自监督局部监督,减少对昂贵人工标注的依赖。
- 增强模型对人群感知式标注方法中常见的标注偏差的鲁棒性。
- 缩小弱监督与全监督人群计数方法之间的性能差距。
提出的方法
- 引入一种自适应特征相似性学习(SFSL)网络,该网络为正类(人员)维护一个无偏的特征估计向量作为聚类中心。
- 在训练过程中通过梯度下降更新特征估计向量,以自适应地优化人员特征的表示。
- 计算学习到的特征向量与主干网络特征之间的像素级特征相似性,生成用于密度估计的软二值分类图。
- 将相似性图输入线性回归头,以预测最终的人群计数。
- 提出一种全局-局部一致性(GLC)损失,强制全局预测与子图像的局部预测之间达成一致。
- 使用全局预测作为监督信号,以自监督方式训练局部回归,从而在极少标注下提升局部特征学习能力。
实验结果
研究问题
- RQ1在缺乏实例级标注的情况下,能否有效增强弱监督人群计数中的局部特征表示?
- RQ2如何利用全局人群数量来监督局部区域预测并提升特征可区分性?
- RQ3在自动化标注方法中常见的标注偏差下,模型的性能能保持多大程度的准确性?
- RQ4与全监督基线相比,该方法在性能和标注效率方面表现如何?
- RQ5该方法在不同人群密度、视角和目标尺度下,是否能跨多种主干网络实现良好泛化?
主要发现
- 所提方法在四个人群计数数据集上取得了具有竞争力的性能,显著缩小了弱监督与全监督方法之间的差距。
- 使用CNN主干时,该方法在ShanghaiTech Part A数据集上的平均绝对误差(MAE)为12.8,接近全监督基线。
- 模型对标注噪声表现出强鲁棒性:当高斯噪声标准差达到σ=0.1时,MAE仅增加3.5%,MSE仅增加0.9%。
- 当使用补丁级标签(标注量增加6倍)进行训练时,性能显著提升,表明在更多全局标签下仍有巨大优化潜力。
- 该方法在不同主干网络(包括CNN和视觉Transformer(ViT))上均表现出良好泛化能力,显示出广泛适用性。
- GLC损失通过强制全局与局部预测之间的一致性,有效提升了局部特征学习,即使在无显式局部监督的情况下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。