[论文解读] Learning Where to Focus for Efficient Video Object Detection
该论文提出可学习时空采样(LSTS),一种可微模块,可在无需依赖光流的情况下,学习视频帧中高层特征之间的精确时空对应关系。通过检测损失引导的反向传播,迭代优化采样位置,LSTS 实现了高效、实时的视频目标检测,mAP 达到 SOTA 水平(77.2%),模型参数量显著减少(64.5M),优于基于光流和非局部的方法。
Transferring existing image-based detectors to the video is non-trivial since the quality of frames is always deteriorated by part occlusion, rare pose, and motion blur. Previous approaches exploit to propagate and aggregate features across video frames by using optical flow-warping. However, directly applying image-level optical flow onto the high-level features might not establish accurate spatial correspondences. Therefore, a novel module called Learnable Spatio-Temporal Sampling (LSTS) has been proposed to learn semantic-level correspondences among adjacent frame features accurately. The sampled locations are first randomly initialized, then updated iteratively to find better spatial correspondences guided by detection supervision progressively. Besides, Sparsely Recursive Feature Updating (SRFU) module and Dense Feature Aggregation (DFA) module are also introduced to model temporal relations and enhance per-frame features, respectively. Without bells and whistles, the proposed method achieves state-of-the-art performance on the ImageNet VID dataset with less computational complexity and real-time speed. Code will be made available at https://github.com/jiangzhengkai/LSTS.
研究动机与目标
- 为解决光流在跨视频帧传播高层特征时的局限性,如参数量高、语义级别对应关系不准确以及计算开销大等问题。
- 开发一种可学习、可微的特征传播机制,避免对预计算光流的依赖,同时保持空间精度。
- 通过稀疏递归更新和密集聚合,建模长时序依赖关系并增强特征表示,从而提升视频目标检测性能。
- 在最小计算成本下实现 SOTA 准确率和实时推理速度,适用于边缘设备部署。
提出的方法
- LSTS 学习相邻帧之间采样特征位置的空间偏移量,将其视为可通过检测损失引导的反向传播更新的可训练参数。
- 该模块计算关键帧与非关键帧采样特征之间的相似性,然后利用学习到的权重聚合特征,生成优化后的传播特征。
- 稀疏递归特征更新(SRFU)通过稀疏的关键帧特征集合,递归更新非关键帧中的特征,高效建模长时序依赖关系。
- 密集特征聚合(DFA)通过聚合同一帧内的多尺度特征,增强每帧的特征表示,提升特征质量。
- 该框架为非关键帧使用轻量级网络,为关键帧使用更复杂的主干网络,从而在保持精度的同时显著降低整体 FLOPs。
- 采样位置通过均匀分布或高斯分布初始化,并通过检测监督进行端到端优化,实现数据驱动的时空对应关系学习。
实验结果
研究问题
- RQ1可学习的采样机制是否能在视频目标检测中超越手工设计或基于光流的特征传播方法?
- RQ2端到端学习空间偏移量相比固定或基于光流的变形,如何提升特征对齐效果?
- RQ3轻量级、可微模块在保持或提升检测精度的同时,能在多大程度上降低模型复杂度?
- RQ4所提出的架构是否能在不损失性能的前提下实现实时推理速度?
主要发现
- 所提方法在 ImageNet VID 数据集上达到 77.2% 的 mAP,优于 Non-Local 和 MatchTrans 基线模型(分别为 74.2% 和 75.5% 的 mAP)。
- 模型参数量为 64.5M,推理速度达 23.0 FPS,证明其具备实时推理能力,同时保持高精度。
- 可学习的采样位置使 mAP 相比固定高斯初始化提升 1.7 个百分点(75.5% → 77.2%),相比固定均匀初始化提升 1.3 个百分点(75.5% → 76.8%)。
- 消融实验表明,无论采用何种初始化方式,学习采样位置均能持续提升性能,验证了可微范式的有效性。
- 与基于光流的方法相比,该方法显著减小了模型尺寸并缩短了推理时间,后者需额外的光流网络,参数量增至 96.7M(ResNet101+RFCN)。
- LSTS 模块在所有设置下均优于基于光流的特征传播方法,证明学习到的对应关系比图像级光流更适用于高层特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。