Skip to main content
QUICK REVIEW

[论文解读] Point-Query Quadtree for Crowd Counting, Localization, and More

Chengxin Liu, Hao Lu|arXiv (Cornell University)|Aug 26, 2023
Video Surveillance and Tracking Methods被引用 4
一句话总结

该论文提出Point-Query Quadtree(PET),一种基于Transformer的新颖框架,用于人群计数与定位,将人群估计建模为可分解的点查询过程。通过使用数据相关的四叉树动态分割密集区域中的查询,并引入渐进式矩形窗口注意力机制以实现高效推理,PET在ShanghaiTech PartA数据集上实现了SOTA性能(MAE为49.34),同时支持统一建模多种学习范式,包括全监督计数、部分标注学习以及点标注优化。

ABSTRACT

We show that crowd counting can be viewed as a decomposable point querying process. This formulation enables arbitrary points as input and jointly reasons whether the points are crowd and where they locate. The querying processing, however, raises an underlying problem on the number of necessary querying points. Too few imply underestimation; too many increase computational overhead. To address this dilemma, we introduce a decomposable structure, i.e., the point-query quadtree, and propose a new counting model, termed Point quEry Transformer (PET). PET implements decomposable point querying via data-dependent quadtree splitting, where each querying point could split into four new points when necessary, thus enabling dynamic processing of sparse and dense regions. Such a querying process yields an intuitive, universal modeling of crowd as both the input and output are interpretable and steerable. We demonstrate the applications of PET on a number of crowd-related tasks, including fully-supervised crowd counting and localization, partial annotation learning, and point annotation refinement, and also report state-of-the-art performance. For the first time, we show that a single counting model can address multiple crowd-related tasks across different learning paradigms. Code is available at https://github.com/cxliu0/PET.

研究动机与目标

  • 将多种人群相关任务——如全监督计数、定位、部分标注学习与点标注优化——统一在单一、可解释的框架下。
  • 解决基于点的人群建模中查询数量固定的挑战,避免因查询过少导致的低估问题,以及因查询过多带来的计算成本上升。
  • 通过分层四叉树结构,实现对稀疏与密集人群区域的动态、数据依赖性处理。
  • 通过引入渐进式矩形窗口注意力机制,提升推理效率与表征学习能力,同时减少内存使用。
  • 提供直观、可调控且可解释的人群建模方式,使每个查询点在物理上对应一个人或背景

提出的方法

  • PET将人群计数建模为可分解的点查询过程,利用任意输入点预测每个点是否为人员及其位置。
  • 点查询四叉树结构支持数据依赖的分裂机制:在密集区域,每个查询点可动态分裂为四个新点,以适应局部密度变化。
  • 模型使用CNN主干网络提取图像特征,随后通过带有渐进式矩形窗口注意力机制的Transformer编码器,对局部空间窗口内的上下文进行编码。
  • Transformer解码器并行处理点查询,通过局部矩形窗口内的注意力计算,降低计算成本并提升效率。
  • 最终的预测头输出每个查询点的概率分数与边界框坐标,用于分类为“人员”或“背景”。
  • 渐进式矩形窗口注意力机制同时应用于编码器与解码器,相较于方形或全局注意力,矩形窗口因更符合人群场景中的透视先验而表现更优。

实验结果

研究问题

  • RQ1能否通过单一、可解释的框架,统一实现全监督、部分标注与点标注优化等多种学习范式下的人群计数?
  • RQ2基于点的查询机制如何在不预设查询数量的前提下,动态适应不同人群密度?
  • RQ3局部渐进式注意力机制对高分辨率人群场景下的推理效率与性能有何影响?
  • RQ4基于四叉树的结构能否在稀疏与密集人群区域之间有效平衡计算成本与精度?
  • RQ5点查询的可解释性在多大程度上提升了模型的透明度与任务适应能力?

主要发现

  • PET在ShanghaiTech PartA基准上实现了SOTA的平均绝对误差(MAE)49.34,优于先前方法。
  • 点查询四叉树结构在ShanghaiTech PartA上将MAE降低约4,在UCF-QNRF上降低约11,归因于对稀疏与密集区域更优的处理能力。
  • 渐进式矩形窗口注意力显著提升性能:仅在解码器中使用时MAE为51.93,同时在编码器与解码器中使用时MAE降至49.34,优于方形或全局注意力。
  • PET仅使用20.9M参数,在1024×1024输入下推理时间仅为0.097秒,相比P2PNet与CLTR等方法更具参数效率。
  • 注意力图可视化结果表明,模型能有效学习在矩形窗口内关注相似的人群模式,证实了局部上下文编码的有效性。
  • 该模型在多种学习范式下展现出强大的泛化能力,仅用单一架构即可成功处理全监督计数、部分标注学习与点标注优化任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。