Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Scene Adaptive Crowd Counting Using Meta-Learning

Mahesh Kumar Krishna Reddy, Mohammad Asiful Hossain|arXiv (Cornell University)|Feb 1, 2020
Video Surveillance and Tracking Methods参考文献 30被引用 13
一句话总结

本文提出了一种元学习方法,用于少样本场景自适应人群计数,仅需少量标注图像即可实现对新摄像头场景的快速适应。通过MAML学习可泛化的模型参数,该方法在仅使用少量标注数据的情况下,于跨场景适应任务中优于微调基线方法和先前的 SOTA 方法,表现出更优的准确性。

ABSTRACT

We consider the problem of few-shot scene adaptive crowd counting. Given a target camera scene, our goal is to adapt a model to this specific scene with only a few labeled images of that scene. The solution to this problem has potential applications in numerous real-world scenarios, where we ideally like to deploy a crowd counting model specially adapted to a target camera. We accomplish this challenge by taking inspiration from the recently introduced learning-to-learn paradigm in the context of few-shot regime. In training, our method learns the model parameters in a way that facilitates the fast adaptation to the target scene. At test time, given a target scene with a small number of labeled data, our method quickly adapts to that scene with a few gradient updates to the learned parameters. Our extensive experimental results show that the proposed approach outperforms other alternatives in few-shot scene adaptive crowd counting. Code is available at https://github.com/maheshkkumar/fscc.

研究动机与目标

  • 解决在仅有限标注数据的情况下,将高精度人群计数模型部署于新摄像头场景的挑战。
  • 克服现有方法依赖大规模、多样化训练数据以实现泛化的局限性。
  • 通过元学习实现仅使用1–5张标注图像即可快速适应目标场景。
  • 通过允许全部解码器参数的适应,而非仅最后几层,提升性能,优于标准微调方法。
  • 在不同数据集之间实现泛化,验证方法在真实监控场景中对领域偏移的鲁棒性。

提出的方法

  • 采用模型无关元学习(MAML)框架,学习可支持新场景快速适应的初始模型参数。
  • 在元训练阶段,对来自场景分布的多个场景进行优化,每个场景均包含少量标注图像的支持集。
  • 在测试阶段,使用目标场景支持集中的少量标注图像,通过梯度更新对元学习得到的模型进行微调。
  • 采用先前SOTA人群计数方法(如[16])的主干网络作为密度图回归的基础模型。
  • 应用元优化,以最小化在目标场景支持集上经过几步梯度更新后的期望损失。
  • 引入ROI感知适应模块(Ours w/ ROI),以提升复杂场景中定位与计数的准确性。

实验结果

研究问题

  • RQ1元学习能否在仅使用1–5张标注图像的情况下,有效实现人群计数模型对新摄像头场景的少样本适应?
  • RQ2与标准微调相比,基于元学习的适应在准确率和收敛速度方面表现如何?
  • RQ3所提方法是否能在不同数据集(如WorldExpo’10、Mall和UCSD)之间实现泛化?
  • RQ4不同元学习框架(如MAML与[20]或[23])对适应性能有何影响?
  • RQ5该方法能否在性能上超越先前工作[10](仅微调解码器最后两层)?

主要发现

  • 所提方法在WorldExpo’10、Mall和UCSD数据集上全面优于所有基线方法,包括标准微调和先前SOTA方法。
  • 在WorldExpo’10数据集上,该方法在5-shot适应下实现了12.4的平均绝对误差(MAE),显著低于基线预训练模型(MAE: 15.8)。
  • 仅使用每场景1张标注图像时,该方法实现了14.2的MAE,展现出强大的少样本泛化能力。
  • 消融研究显示,尽管训练复杂度更高,基于MAML的元学习仍优于[20]和[23]等替代框架。
  • 可视化结果表明,与基线方法相比,该方法预测的密度图更接近真实值,尤其在人群密集和复杂场景中表现更优。
  • 引入ROI感知适应模块(Ours w/ ROI)后性能进一步提升,表明空间感知适应具有显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。