[论文解读] Fast and Resource-Efficient Object Tracking on Edge Devices: A Measurement Study
本文提出 EMO,一种上下文感知的自适应帧跳过框架,用于在边缘设备上实现低资源消耗的实时多目标跟踪。通过根据运动可预测性和视觉相似性动态跳过帧,并使用卡尔曼滤波器进行位置估计,EMO 在保持接近基线跟踪精度(HOTA 损失 <0.5%)的同时,将计算量减少了 33–50%。
Object tracking is an important functionality of edge video analytic systems and services. Multi-object tracking (MOT) detects the moving objects and tracks their locations frame by frame as real scenes are being captured into a video. However, it is well known that real time object tracking on the edge poses critical technical challenges, especially with edge devices of heterogeneous computing resources. This paper examines the performance issues and edge-specific optimization opportunities for object tracking. We will show that even the well trained and optimized MOT model may still suffer from random frame dropping problems when edge devices have insufficient computation resources. We present several edge specific performance optimization strategies, collectively coined as EMO, to speed up the real time object tracking, ranging from window-based optimization to similarity based optimization. Extensive experiments on popular MOT benchmarks demonstrate that our EMO approach is competitive with respect to the representative methods for on-device object tracking techniques in terms of run-time performance and tracking accuracy. EMO is released on Github at https://github.com/git-disl/EMO.
研究动机与目标
- 解决在计算资源受限的边缘设备上以可变帧率实现实时多目标跟踪(MOT)的挑战。
- 识别固定周期帧跳过方法的局限性,例如在资源压力下性能不稳定和帧丢失。
- 提出一种动态的、上下文感知的帧跳过策略,根据运动和视觉相似性自适应调整,以优化资源使用。
- 在边缘硬件上最小化计算成本的同时保持高跟踪精度(例如 HOTA)。
- 通过减少对云处理的依赖,实现可扩展的、保护隐私的边缘视频分析。
提出的方法
- 引入一种上下文感知的跳过机制,通过归一化互相关(NCC)评估帧间相似性,并通过目标轨迹分析评估运动可预测性。
- 使用卡尔曼滤波器估计跳过帧中的目标位置,相比直接复用先前检测结果,可提高定位精度。
- 设计一个决策模块,基于视觉相似性和运动稳定性评估是否跳过帧,仅在安全时降低检测频率。
- 将 EMO 框架与现有的检测后跟踪流水线集成,支持 YOLOv3 和 Faster R-CNN 等模型。
- 通过最小化决策和估计的开销优化运行时性能,在 MOT-17 和 MOT-15 上,决策时间仅为检测时间的 1/9 至 1/20。
- 在不同帧率和运动条件下,于 MOTChallenge 基准测试集(MOT-15、MOT-17)上评估该方法。
实验结果
研究问题
- RQ1周期性帧跳过对计算资源受限的边缘设备上多目标跟踪的精度和性能有何影响?
- RQ2基于视觉相似性和运动可预测性的自适应帧跳过,能在多大程度上降低计算成本而不损害跟踪质量?
- RQ3在跳过帧中使用卡尔曼滤波进行位置估计,与直接复用检测结果相比,在定位精度方面表现如何?
- RQ4在具有不同运动动态的多样化视频序列中,帧跳过率与跟踪性能之间应如何实现最优平衡?
- RQ5在真实边缘部署场景中,EMO 框架与无跳过基线及基于启发式的跳过策略相比表现如何?
主要发现
- 与无跳过基线相比,EMO 框架在 MOT-15 上将总计算时间减少了 33%,在 MOT-17 上减少了 50%,分别实现了 38% 和 60% 的帧跳过率。
- 所提出的上下文感知跳过方法在高帧率视频(如 25 FPS)中,当运动稳定且视觉相似性高时,可跳过高达 60% 的帧。
- 在跳过帧中使用卡尔曼滤波进行位置估计,相比复用先前检测结果,显著提升了定位精度,尤其在低运动场景中表现更优。
- 基于 NCC 和运动可预测性判断是否跳过帧,仅导致 HOTA 得分下降 0.5%,表明精度损失极小。
- 帧决策的平均耗时仅为检测时间的 1/9 至 1/20,实际应用中开销可忽略不计。
- EMO 框架在显著降低资源消耗的同时保持了具有竞争力的跟踪精度,适用于计算和带宽受限的边缘设备部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。