[论文解读] Towards Unsupervised Crowd Counting via Regression-Detection Bi-knowledge Transfer
本文提出了一种无监督人群计数方法,通过使用与场景无关的变换器,利用回归与检测模型之间的相互知识蒸馏,将标记源域中的双知识迁移至未标记目标域。该方法通过融合伪标签对两种模型进行迭代联合训练,在ShanghaiTech、UCF_CC_50和UCF_QNRF基准上实现了最先进性能,相较于先前方法在MAE和MSE指标上均有显著提升。
Unsupervised crowd counting is a challenging yet not largely explored task. In this paper, we explore it in a transfer learning setting where we learn to detect and count persons in an unlabeled target set by transferring bi-knowledge learnt from regression- and detection-based models in a labeled source set. The dual source knowledge of the two models is heterogeneous and complementary as they capture different modalities of the crowd distribution. We formulate the mutual transformations between the outputs of regression- and detection-based models as two scene-agnostic transformers which enable knowledge distillation between the two models. Given the regression- and detection-based models and their mutual transformers learnt in the source, we introduce an iterative self-supervised learning scheme with regression-detection bi-knowledge transfer in the target. Extensive experiments on standard crowd counting benchmarks, ShanghaiTech, UCF\_CC\_50, and UCF\_QNRF demonstrate a substantial improvement of our method over other state-of-the-arts in the transfer learning setting.
研究动机与目标
- 解决在目标域缺乏标注数据的跨域设置下无监督人群计数的挑战。
- 通过知识蒸馏,利用回归模型(适用于高密度人群)与检测模型(适用于低密度场景)的互补优势。
- 通过学习模型输出之间的相互变换,实现从有标注源域到无标注目标域的有效迁移学习。
- 开发一种自监督迭代联合训练框架,利用融合伪标签提升目标域上回归与检测模型的性能。
提出的方法
- 学习两个与场景无关的变换器:Reg-to-Det 和 Det-to-Reg,用于在回归与检测模型输出之间进行映射,从而实现相互知识蒸馏。
- 使用一种新颖的焦点MSE损失结合DMS-SSIM训练Reg-to-Det变换器,提升目标域中的定位精度。
- 应用迭代自监督学习:在每次迭代中,模型生成融合伪标签(密度图与边界框),并用于优化两个模型。
- 通过高斯卷积将检测结果转换为密度图,并通过类似反卷积的操作实现反向转换,完成回归与检测输出的融合。
- 采用双分支网络架构,使回归与检测头在另一模态生成的伪标签指导下联合优化。
- 在仅使用小部分源域数据的情况下,对Reg-to-Det变换器进行训练,验证其与场景无关的特性及泛化能力。
实验结果
研究问题
- RQ1在无监督域自适应设置下,能否有效迁移回归与检测模型之间的互补知识?
- RQ2如何形式化回归与检测模型异质输出之间的相互知识蒸馏?
- RQ3与场景无关的变换器在跨域模型间知识迁移中能发挥多大作用?
- RQ4使用融合伪标签的迭代自监督联合训练是否能提升在无标注目标数据上的性能?
主要发现
- 所提方法在无监督迁移学习设置下,于ShanghaiTech、UCF_CC_50和UCF_QNRF基准上实现了新的最先进性能。
- 在ShanghaiTech数据集(SHB → SHA)上,该方法将MAE降低至112.24,MSE降低至218.18,优于先前最先进方法。
- 仅使用源域30%数据训练的Reg-to-Det变换器在A→Q上达到0.406 mAP,在A→B上达到0.610 mAP,展现出强大的泛化能力与与场景无关特性。
- 消融实验证实,完整方法(含融合与自监督迭代)性能最佳,MAE为112.24,mAP为0.661,优于无融合或随机采样等变体。
- 迭代联合训练过程在4轮后趋于稳定,后续增益微小,表明方法收敛且鲁棒。
- 在Reg-to-Det变换器中使用焦点MSE与DMS-SSIM损失,在A→Q上实现0.448 mAP,显著优于标准MSE损失(0.347)与焦点交叉熵损失(0.399)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。