[论文解读] A Large Scale Urban Surveillance Video Dataset for Multiple-Object Tracking and Behavior Analysis
本文介绍了城市监控视频数据集(USVD),这是一个大规模、真实世界的基准数据集,包含7个户外环境中的16个交通繁忙的城市场景,涵盖超过20万个标注帧、370万个边界框和7,100条轨迹。该数据集能够在真实、复杂的条件下对多目标跟踪和异常检测算法进行严格评估,展示了最先进方法在人群密集城市环境下面临的重大挑战。
Multiple-object tracking and behavior analysis have been the essential parts of surveillance video analysis for public security and urban management. With billions of surveillance video captured all over the world, multiple-object tracking and behavior analysis by manual labor are cumbersome and cost expensive. Due to the rapid development of deep learning algorithms in recent years, automatic object tracking and behavior analysis put forward an urgent demand on a large scale well-annotated surveillance video dataset that can reflect the diverse, congested, and complicated scenarios in real applications. This paper introduces an urban surveillance video dataset (USVD) which is by far the largest and most comprehensive. The dataset consists of 16 scenes captured in 7 typical outdoor scenarios: street, crossroads, hospital entrance, school gate, park, pedestrian mall, and public square. Over 200k video frames are annotated carefully, resulting in more than 3:7 million object bounding boxes and about 7:1 thousand trajectories. We further use this dataset to evaluate the performance of typical algorithms for multiple-object tracking and anomaly behavior analysis and explore the robustness of these methods in urban congested scenarios.
研究动机与目标
- 为解决当前缺乏大规模、真实且复杂的都市监控数据集以评估多目标跟踪与行为分析算法的问题。
- 提供一个能够反映真实都市拥堵、遮挡以及多样化物体交互行为的基准。
- 评估现有跟踪与异常检测方法在具有挑战性的现实都市场景下的鲁棒性。
- 支持开发更准确、更具泛化能力的计算机视觉模型,以服务于公共安全与智慧城市建设。
提出的方法
- 数据集从七个典型城市户外场景的真实监控摄像头中采集:街道、十字路口、医院入口、校门、公园、人行商业区和公共广场。
- 超过20万个视频帧被人工标注了边界框、物体类别、遮挡程度和轨迹身份。
- 引入了一种类别“群体”,用于表示至少两名行人以相似速度和方向共同移动的情况。
- 利用该数据集对多目标跟踪基线方法(如TC_ODAL、SORT、IOU)和异常检测基线方法(如HMOF、PT-HOF、SL-MHOF)进行了评估。
- 评估指标包括MOTA、EER、AUC和ROC曲线,用于评估跟踪精度与异常检测性能。
- 测试集包含10段序列,每段序列200帧,用于训练;另有10段用于测试,重点关注跑步、跳跃和骑自行车等行为。
实验结果
研究问题
- RQ1最先进多目标跟踪算法在大规模、真实世界的城市监控数据集上,面对高密度与遮挡时表现如何?
- RQ2现有异常检测方法在具有多样化与模糊行为的复杂真实城市场景中,其泛化能力如何?
- RQ3引入群体级别标注后,对密集城市环境中行人交互行为的建模能力有何提升?
- RQ4当前跟踪与异常检测系统在真实、大规模城市视频数据上的关键失效模式是什么?
主要发现
- USVD数据集包含16个场景、211,706个标注帧、3,758,821个边界框和7,173条唯一轨迹,是迄今为止最大且最全面的城市监控数据集。
- 基线跟踪方法如SORT和IOU在USVD上的表现相比简单基准有所下降,表明该数据集因遮挡与高密度而具有较高难度。
- 异常检测方法如HMOF与SL-MHOF取得了中等AUC与EER分数,但性能差距依然存在,凸显在真实城市场景中检测罕见或模糊行为的挑战。
- 图7中的ROC曲线显示,即使是最先进的方法在USVD上也难以实现高AUC与低EER,表明该数据集的真实感与难度。
- 群体标注的引入表明,建模集体行人运动可提升密集人群中的跟踪鲁棒性,提示未来方法需整合群体级动力学。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。