[论文解读] CaTDet: Cascaded Tracked Detector for Efficient Object Detection from Video
CaTDet 是一种用于视频的级联式、追踪器增强型目标检测系统,通过利用时间相关性,在 KITTI 上将计算成本降低 5.1–8.7 倍,在 CityPersons 上降低 13.0 倍,同时保持几乎相同的 mAP,仅增加 0.3 帧的延迟。该系统引入了一种专为实时应用设计的新延迟度量(mD)。
Detecting objects in a video is a compute-intensive task. In this paper we propose CaTDet, a system to speedup object detection by leveraging the temporal correlation in video. CaTDet consists of two DNN models that form a cascaded detector, and an additional tracker to predict regions of interests based on historic detections. We also propose a new metric, mean Delay(mD), which is designed for latency-critical video applications. Experiments on the KITTI dataset show that CaTDet reduces operation count by 5.1-8.7x with the same mean Average Precision(mAP) as the single-model Faster R-CNN detector and incurs additional delay of 0.3 frame. On CityPersons dataset, CaTDet achieves 13.0x reduction in operations with 0.8% mAP loss.
研究动机与目标
- 解决自动驾驶等应用中实时视频目标检测的高计算成本问题。
- 利用视频中的时间与空间局部性,减少帧间冗余计算。
- 设计一种在保持高检测精度的同时,最小化延迟关键应用延迟的系统。
- 引入一种新的评估指标——平均延迟(mD),以更准确地反映时间敏感场景下的实际性能表现。
提出的方法
- 部署一个级联检测流水线,包含轻量级候选区域生成网络和高精度精炼网络。
- 集成一个追踪器,利用历史检测结果预测后续帧的感兴趣区域(RoIs)。
- 利用追踪器的输出来约束精炼网络的输入,从而减少需要昂贵推理的区域数量。
- 在候选区域生成网络的输出上应用一个阈值(C-thresh),以在检测灵敏度与计算负载之间取得平衡。
- 采用两阶段训练流程进行系统优化:先预训练候选区域生成网络和精炼网络,再微调级联系统。
- 使用 mAP 和所提出的 mD 指标联合评估性能,以衡量准确率与延迟之间的权衡。
实验结果
研究问题
- RQ1视频中的时间相关性是否能被有效利用,在不损失准确率的前提下减少目标检测的计算量?
- RQ2将追踪器集成到级联检测系统中,对检测延迟和 mAP 有何影响?
- RQ3所提出的平均延迟(mD)指标在多大程度上与召回率和精确率相关?
- RQ4该系统在分辨率和标注密度不同的数据集(如 KITTI 和 CityPersons)上表现如何?
- RQ5移除追踪器对系统性能有何影响,特别是在 mAP 和延迟方面的表现?
主要发现
- 在 KITTI 数据集上,CaTDet 将操作次数减少了 5.1–8.7 倍,mAP 无损失,仅增加 0.3 帧延迟。
- 在 CityPersons 数据集上,CaTDet 实现了 13.0 倍的操作减少,mAP 仅下降 0.8%。
- 未使用追踪器的级联系统性能显著劣于 CaTDet,尤其在 CityPersons 上,当移除追踪器后 mAP 下降超过 5%。
- 平均延迟(mD)指标与召回率高度相关,但行为不同,凸显了在实时系统中进行专用延迟感知评估的必要性。
- 该系统对候选区域生成网络和 C-thresh 的选择较为敏感,更高的阈值会导致延迟增加,因为处理的候选区域更少。
- 可视化结果证实,较小的物体(如行人)对延迟更为敏感,因为它们更难检测,且在早期帧中更可能被遗漏。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。