[论文解读] Tracking Revisited using RGBD Camera: Baseline and Benchmark
本文提出一个包含100段视频的多样化RGBD跟踪基准,并设计了一种简单但高效的基线算法,通过利用深度数据显著提升了跟踪的鲁棒性。通过融合RGB特征、光流以及基于深度的遮挡建模,该基线算法在形变、遮挡和模型漂移等挑战性条件下,显著优于当前最先进(SOTA)的仅使用RGB的跟踪器。
Although there has been significant progress in the past decade,tracking is still a very challenging computer vision task, due to problems such as occlusion and model drift.Recently, the increased popularity of depth sensors e.g. Microsoft Kinect has made it easy to obtain depth data at low cost.This may be a game changer for tracking, since depth information can be used to prevent model drift and handle occlusion.In this paper, we construct a benchmark dataset of 100 RGBD videos with high diversity, including deformable objects, various occlusion conditions and moving cameras. We propose a very simple but strong baseline model for RGBD tracking, and present a quantitative comparison of several state-of-the-art tracking algorithms.Experimental results show that including depth information and reasoning about occlusion significantly improves tracking performance. The datasets, evaluation details, source code for the baseline algorithm, and instructions for submitting new models will be made available online after acceptance.
研究动机与目标
- 建立一个标准化基准,用于在真实、多样的条件下评估RGBD跟踪算法。
- 利用深度信息解决视觉跟踪中长期存在的模型漂移和遮挡挑战。
- 提供一个强大且简洁的RGBD跟踪基线,其性能优于现有仅使用RGB的SOTA方法。
- 通过发布大规模、多样化的数据集并附带真实标注,实现对跟踪算法的公平、定量比较。
- 通过在论文被接受后公开数据集、评估服务器和基线代码,推动可复现的研究。
提出的方法
- 构建一个包含100段高多样性RGBD视频的基准数据集,涵盖形变物体、运动相机以及多种遮挡场景。
- 提出一种基线跟踪算法,结合HOG特征、线性SVM分类、光流以及基于深度的置信度建模。
- 利用目标深度直方图估计的一维高斯深度分布,建模深度一致性并检测遮挡物。
- 通过使用深度分布对2D置信图(来自分类器和光流)进行阈值处理,构建3D置信图,从而提升定位精度。
- 通过识别与目标深度显著不同的深度值来识别遮挡物,并抑制遮挡区域的跟踪响应。
- 仅在目标被高置信度检测到的区域进行在线模型更新,从而减少模型漂移。
实验结果
研究问题
- RQ1与仅使用RGB的方法相比,深度信息在多大程度上提升了跟踪性能?
- RQ2一个强大且简洁的RGBD跟踪基线应如何设计,以利用深度信息应对遮挡和模型漂移?
- RQ3当在相同的RGBD基准上进行评估时,当前最先进(SOTA)的RGB跟踪算法表现如何?
- RQ4深度数据能否可靠地检测并补偿遮挡,特别是在部分遮挡或渐进式遮挡的情况下?
- RQ5深度信息在多大程度上缓解了由目标形变或外观变化引起的模型漂移?
主要发现
- 所提出的RGBD基线显著优于当前最先进(SOTA)的RGB跟踪器,在所有评估指标上均表现出更高的准确性。
- 在目标发生旋转或形变的视频中(如“stuffed bear”和“basketball player”序列),RGBD跟踪器保持了稳定跟踪,而RGB跟踪器因模型漂移而失败。
- 在部分遮挡情况下(如“human face”视频),RGBD跟踪器维持了更高的置信度,并减少了误报。
- 在完全遮挡情况下(如“sign”视频),RGBD跟踪器利用深度信息识别出遮挡物,并通过聚焦于邻近区域维持了跟踪,而RGB跟踪器则丢失了目标。
- 在渐进式遮挡场景中(如“student with bag”),RGBD跟踪器正确识别了遮挡物,并防止了因遮挡物导致的模型更新被污染。
- 定量结果表明,RGBD基线在该基准数据集上取得了34.2%的成功率(在10帧中有7帧的误差在20px以内),显著优于仅使用RGB的方法,如TLD(6.90%)和Semi-B(26.1%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。