[论文解读] Real-time Online Multi-Object Tracking in Compressed Domain
本文提出 OTCD,一种在压缩域中实时运行的在线多目标跟踪系统,通过仅处理关键帧进行检测与数据关联(利用联合训练的外观卷积神经网络),而非关键帧则通过运动矢量和残差使用跟踪卷积神经网络进行跟踪。该方法相较最先进在线跟踪器实现约6倍的加速,性能损失极小,可实现在自动驾驶等应用中的实时部署。
Recent online Multi-Object Tracking (MOT) methods have achieved desirable tracking performance. However, the tracking speed of most existing methods is rather slow. Inspired from the fact that the adjacent frames are highly relevant and redundant, we divide the frames into key and non-key frames respectively and track objects in the compressed domain. For the key frames, the RGB images are restored for detection and data association. To make data association more reliable, an appearance Convolutional Neural Network (CNN) which can be jointly trained with the detector is proposed. For the non-key frames, the objects are directly propagated by a tracking CNN based on the motion information provided in the compressed domain. Compared with the state-of-the-art online MOT methods,our tracker is about 6x faster while maintaining a comparable tracking performance.
研究动机与目标
- 解决现有方法中实时在线多目标跟踪(MOT)计算成本高的挑战。
- 利用视频压缩域特征——运动矢量与残差——减少计算量,而无需将所有帧恢复为RGB格式。
- 开发一个统一的跟踪器,联合优化检测与外观建模,以提升数据关联性能。
- 通过关键帧/非关键帧分离,最小化逐帧处理,实现实时性能。
- 通过融合外观特征与运动传播,在遮挡及目标重新出现时保持跟踪精度。
提出的方法
- 根据时间冗余性将视频帧划分为关键帧与非关键帧,仅将关键帧恢复为RGB以进行检测与外观特征提取。
- 引入外观卷积神经网络(A-CNN),与检测器共享特征,并通过联合训练提升数据关联的可靠性。
- 利用压缩域中的运动矢量(MVs)与残差提取运动线索,用于非关键帧中的目标传播。
- 部署跟踪卷积神经网络(T-CNN),以MVs与残差为输入,在非关键帧中预测目标边界框,无需检测。
- 仅在关键帧中应用IoU关联,而外观关联负责处理漏检或重新出现的目标。
- 通过选择K=3作为最优关键帧间隔,在性能与速度之间实现平衡,有效减少误报与身份切换。
实验结果
研究问题
- RQ1能否有效利用压缩域中的运动信息,在不进行完整帧重建的前提下,实现非关键帧间的目标轨迹传播?
- RQ2将外观卷积神经网络与检测器联合训练,如何提升在线MOT中的数据关联精度?
- RQ3在实时压缩域跟踪中,最优关键帧间隔(K)为何值时,可在速度与精度之间实现最佳平衡?
- RQ4通过仅处理关键帧,计算成本可降低多少,同时仍保持具有竞争力的MOTA得分?
- RQ5在使用相同检测流水线的前提下,所提出的跟踪器在速度与精度上相较于最先进在线MOT方法表现如何?
主要发现
- OTCD 的跟踪速度相比最先进在线MOT方法快约6倍,同时保持相近的MOTA得分。
- 在使用公开检测结果时,OTCD 在MOT16上比当时SOTA方法AMIR快17倍,MOTA仅下降1.0%。
- 在MOT17上,OTCD 3实现33.4 Hz的处理速度与37.8%的MOTA,尽管速度低于GM_PHD(38.4 Hz),但MOTA高出10.5个百分点。
- 联合训练的A-CNN显著改善了数据关联,减少了身份切换,提升了遮挡情况下的鲁棒性。
- 当K从1增至3时,IDS与Frag显著下降,表明因减少重新检测频率,身份一致性得到明显改善。
- 基于T-CNN的传播机制显著降低了非关键帧的计算成本,但当K增大时,因未处理目标出生/死亡及跟踪误差累积,性能出现下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。