Skip to main content
QUICK REVIEW

[论文解读] Detection, Tracking, and Counting Meets Drones in Crowds: A Benchmark

Longyin Wen, Dawei Du|arXiv (Cornell University)|May 6, 2021
Video Surveillance and Tracking Methods参考文献 42被引用 8
一句话总结

本文提出了DroneCrowd,一个大规模无人机拍摄视频基准数据集,包含112段视频、33,600帧图像以及480万个人头标注。同时提出了时空邻近感知网络(STNNet),一种统一的模型,用于在密集人群场景中联合完成目标检测、跟踪与计数。STNNet通过引入邻近上下文损失,利用多任务学习来强化对象关联的时序一致性,在密度估计、定位与跟踪任务上均达到当前最优性能。

ABSTRACT

To promote the developments of object detection, tracking and counting algorithms in drone-captured videos, we construct a benchmark with a new drone-captured largescale dataset, named as DroneCrowd, formed by 112 video clips with 33,600 HD frames in various scenarios. Notably, we annotate 20,800 people trajectories with 4.8 million heads and several video-level attributes. Meanwhile, we design the Space-Time Neighbor-Aware Network (STNNet) as a strong baseline to solve object detection, tracking and counting jointly in dense crowds. STNNet is formed by the feature extraction module, followed by the density map estimation heads, and localization and association subnets. To exploit the context information of neighboring objects, we design the neighboring context loss to guide the association subnet training, which enforces consistent relative position of nearby objects in temporal domain. Extensive experiments on our DroneCrowd dataset demonstrate that STNNet performs favorably against the state-of-the-arts.

研究动机与目标

  • 为解决无人机人群计数、检测与跟踪任务中缺乏大规模公开基准数据集的问题。
  • 开发一种统一的深度学习框架,联合完成无人机视频中密度图估计、目标定位与多目标跟踪。
  • 设计一种新颖的邻近上下文损失,通过强制相邻对象在时间维度上的相对位置保持一致,以提升跟踪精度。
  • 建立一个强大的基线模型(STNNet),使其在新的DroneCrowd基准数据集上超越当前最先进方法。

提出的方法

  • STNNet由一个使用双分支CNN的特征提取子网络构成,用于提取多尺度特征,并计算连续帧之间的时序相关性。
  • 该模型包含用于人群计数的密度图估计头,一个包含分类与回归分支的定位子网络,以及一个用于预测帧间运动偏移的关联子网络。
  • 引入邻近上下文损失,以惩罚相邻对象在时间维度上相对位置的不一致性,从而提升跟踪的时序一致性。
  • 邻近上下文损失中的循环策略同时考虑前向与后向运动偏移,以增强轨迹估计的鲁棒性。
  • 整个网络通过多任务损失与Adam优化器进行端到端训练,随后通过最小费用流或social-LSTM进行后处理,以生成更长的轨迹。

实验结果

研究问题

  • RQ1所提出的STNNet模型在联合解决无人机拍摄密集人群场景下的检测、跟踪与计数任务方面效果如何?
  • RQ2通过强制相邻对象在时空上保持一致,邻近上下文损失在多大程度上提升了定位与跟踪性能?
  • RQ3与仅依赖密度图的基线模型相比,引入定位与关联子网络对整体性能有何影响?
  • RQ4在邻近上下文损失中移除循环策略或关系约束后,对跟踪与定位精度有何影响?

主要发现

  • STNNet在人群定位任务上达到40.45%的L-mAP,比表现第二好的方法(DM-Count)高出22.28个百分点。
  • 与不包含定位子网络的基线相比,该模型将平均绝对误差(MAE)降低2.8,均方误差(MSE)降低3.5,证明了其在精度上的关键作用。
  • STNNet在跟踪任务上达到32.50%的T-mAP,比第二好的方法(DM-Count)高出15.49个百分点,验证了其卓越的跟踪性能。
  • 若移除关联子网络,T-mAP下降0.88个百分点(从32.50%降至31.44%),表明其在维持轨迹一致性方面的重要性。
  • 与无关系约束的变体相比,采用循环策略的邻近上下文损失使L-mAP提升0.22%,T-mAP提升0.24%,进一步证实了其有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。