[论文解读] Improving Multiple Object Tracking with Optical Flow and Edge Preprocessing
本文提出了一种新颖的预处理方法,通过整合光流和边缘检测与背景减除技术,提升了城市场景中的多目标跟踪(MOT)性能。通过合并碎片化目标块、分离相向运动物体,并利用边缘处理优化目标边界,该方法在四个真实世界的城市视频数据集上显著提高了检测精度与跟踪性能。
In this paper, we present a new method for detecting road users in an urban environment which leads to an improvement in multiple object tracking. Our method takes as an input a foreground image and improves the object detection and segmentation. This new image can be used as an input to trackers that use foreground blobs from background subtraction. The first step is to create foreground images for all the frames in an urban video. Then, starting from the original blobs of the foreground image, we merge the blobs that are close to one another and that have similar optical flow. The next step is extracting the edges of the different objects to detect multiple objects that might be very close (and be merged in the same blob) and to adjust the size of the original blobs. At the same time, we use the optical flow to detect occlusion of objects that are moving in opposite directions. Finally, we make a decision on which information we keep in order to construct a new foreground image with blobs that can be used for tracking. The system is validated on four videos of an urban traffic dataset. Our method improves the recall and precision metrics for the object detection task compared to the vanilla background subtraction method and improves the CLEAR MOT metrics in the tracking tasks for most videos.
研究动机与目标
- 提升城市交通视频中的目标检测与分割性能,以增强下游多目标跟踪(MOT)任务的表现。
- 通过后处理手段解决背景减除技术的关键局限性,如目标块合并、碎片化、阴影伪影及过大的检测框。
- 开发一个鲁棒的预处理流水线,利用光流与边缘检测优化前景目标块,为跟踪器提供更优输入。
- 在多样化城市视频序列中,实现更高的目标检测精确率与召回率,以及更优的CLEAR MOT跟踪指标。
提出的方法
- 对每帧视频应用背景减除,生成初始前景目标块作为感兴趣区域(RoI)候选区域。
- 对每个目标块计算密集光流(块大小为8),分析运动一致性,合并具有相似光流向量的区域,以减少碎片化。
- 利用光流检测并分离因相向运动导致合并的前景目标块,尤其在遮挡情况下表现显著。
- 对前景目标块与背景图像同时应用Canny边缘检测器,提取目标边缘并消除背景噪声(如道路标线)。
- 利用边缘信息优化目标块边界,减少由阴影引起的过分割现象,提升目标尺寸估计精度。
- 通过融合基于运动的一致性合并、基于光流的分离机制以及基于边缘的边界调整,构建新的、优化的二值前景图像,以提升跟踪器的输入质量。
实验结果
研究问题
- RQ1光流与边缘处理能否有效减少背景减除后城市视频序列中的误报,并改善目标边界的估计?
- RQ2通过光流分析运动一致性,在多目标跟踪中在多大程度上可解决目标块合并与碎片化问题?
- RQ3基于边缘的优化处理在重叠或紧密排列的路网使用者场景中,如何影响目标检测与跟踪的准确性?
- RQ4所提出的预处理方法是否能在多样化城市交通场景中,带来标准MOT评估指标(如MOTA、MOTP、精确率、召回率)的可测量提升?
主要发现
- 在Sherbrooke数据集上,该方法将召回率从0.606(ViBe)提升至0.752,精确率从0.681提升至0.739,表明检测性能显著增强。
- 对于MKCF跟踪器,在Sherbrooke序列上MOTA从0.317提升至0.523,MOTP从0.553提升至0.576,展现出强大的跟踪性能提升。
- 在Rene-Levesque序列上,UT的MOTA提升了5%(从0.404增至0.690),MOTP提升了12%(从0.576增至0.590),凸显在密集、低分辨率场景中的有效性。
- 该方法显著减少了由阴影引起的过分割现象,并改善了目标尺寸估计,使调整跟踪器最小目标块尺寸阈值后,更小目标的跟踪更加准确。
- 在Rouen序列中,行人相向而行穿越场景下,MKCF的MOTA从0.501提升至0.629,MOTP从0.582提升至0.600,表明在复杂遮挡场景中具备强鲁棒性。
- 尽管在紧密排列的行人(如St-Marc中四人并排行走)场景下仍存在分离困难,但该方法仍使MKCF与UT的MOTA得到提升,表明其在多样化城市环境中的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。