[论文解读] Few-Shot Scene Adaptive Crowd Counting Using Meta-Learning
本文提出了一种元学习方法,用于少样本场景自适应人群计数,仅需少量标注图像即可实现对新摄像头场景的快速适应。通过MAML学习可泛化的模型参数,该方法在仅使用少量标注数据的情况下,于跨场景适应任务中优于微调基线方法和先前的 SOTA 方法,表现出更优的准确性。
We consider the problem of few-shot scene adaptive crowd counting. Given a target camera scene, our goal is to adapt a model to this specific scene with only a few labeled images of that scene. The solution to this problem has potential applications in numerous real-world scenarios, where we ideally like to deploy a crowd counting model specially adapted to a target camera. We accomplish this challenge by taking inspiration from the recently introduced learning-to-learn paradigm in the context of few-shot regime. In training, our method learns the model parameters in a way that facilitates the fast adaptation to the target scene. At test time, given a target scene with a small number of labeled data, our method quickly adapts to that scene with a few gradient updates to the learned parameters. Our extensive experimental results show that the proposed approach outperforms other alternatives in few-shot scene adaptive crowd counting. Code is available at https://github.com/maheshkkumar/fscc.
研究动机与目标
- 解决在仅有限标注数据的情况下,将高精度人群计数模型部署于新摄像头场景的挑战。
- 克服现有方法依赖大规模、多样化训练数据以实现泛化的局限性。
- 通过元学习实现仅使用1–5张标注图像即可快速适应目标场景。
- 通过允许全部解码器参数的适应,而非仅最后几层,提升性能,优于标准微调方法。
- 在不同数据集之间实现泛化,验证方法在真实监控场景中对领域偏移的鲁棒性。
提出的方法
- 采用模型无关元学习(MAML)框架,学习可支持新场景快速适应的初始模型参数。
- 在元训练阶段,对来自场景分布的多个场景进行优化,每个场景均包含少量标注图像的支持集。
- 在测试阶段,使用目标场景支持集中的少量标注图像,通过梯度更新对元学习得到的模型进行微调。
- 采用先前SOTA人群计数方法(如[16])的主干网络作为密度图回归的基础模型。
- 应用元优化,以最小化在目标场景支持集上经过几步梯度更新后的期望损失。
- 引入ROI感知适应模块(Ours w/ ROI),以提升复杂场景中定位与计数的准确性。
实验结果
研究问题
- RQ1元学习能否在仅使用1–5张标注图像的情况下,有效实现人群计数模型对新摄像头场景的少样本适应?
- RQ2与标准微调相比,基于元学习的适应在准确率和收敛速度方面表现如何?
- RQ3所提方法是否能在不同数据集(如WorldExpo’10、Mall和UCSD)之间实现泛化?
- RQ4不同元学习框架(如MAML与[20]或[23])对适应性能有何影响?
- RQ5该方法能否在性能上超越先前工作[10](仅微调解码器最后两层)?
主要发现
- 所提方法在WorldExpo’10、Mall和UCSD数据集上全面优于所有基线方法,包括标准微调和先前SOTA方法。
- 在WorldExpo’10数据集上,该方法在5-shot适应下实现了12.4的平均绝对误差(MAE),显著低于基线预训练模型(MAE: 15.8)。
- 仅使用每场景1张标注图像时,该方法实现了14.2的MAE,展现出强大的少样本泛化能力。
- 消融研究显示,尽管训练复杂度更高,基于MAML的元学习仍优于[20]和[23]等替代框架。
- 可视化结果表明,与基线方法相比,该方法预测的密度图更接近真实值,尤其在人群密集和复杂场景中表现更优。
- 引入ROI感知适应模块(Ours w/ ROI)后性能进一步提升,表明空间感知适应具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。