[论文解读] AdaScale: Towards Real-time Video Object Detection Using Adaptive Scaling
AdaScale 通过对每个视频帧自适应选择输入图像尺度,在提升速度的同时提高视频对象检测的准确性,在 ImageNet VID 和 mini YouTube-BB 数据集上实现显著的 mAP 提升与加速。
In vision-enabled autonomous systems such as robots and autonomous cars, video object detection plays a crucial role, and both its speed and accuracy are important factors to provide reliable operation. The key insight we show in this paper is that speed and accuracy are not necessarily a trade-off when it comes to image scaling. Our results show that re-scaling the image to a lower resolution will sometimes produce better accuracy. Based on this observation, we propose a novel approach, dubbed AdaScale, which adaptively selects the input image scale that improves both accuracy and speed for video object detection. To this end, our results on ImageNet VID and mini YouTube-BoundingBoxes datasets demonstrate 1.3 points and 2.7 points mAP improvement with 1.6x and 1.8x speedup, respectively. Additionally, we improve state-of-the-art video acceleration work by an extra 1.25x speedup with slightly better mAP on ImageNet VID dataset.
研究动机与目标
- 为自治系统推动更快且更准确的视频对象检测。
- 研究降采样是否不仅能提升速度,还能提高检测准确性。
- 开发一种自适应尺度机制,能够为每帧预测最优输入尺度。
- 在 ImageNet VID 和 YouTube-BB 数据集上展示改进,并显示与现有视频加速方法的兼容性。
提出的方法
- 定义一个有限的输入尺度集合 S,并基于每张图像的检测损失构建度量,以为每张图像选择最优尺度 m_opt。
- 训练一个尺度回归器,接受深度 CNN 特征并输出一个相对尺度 t,取值在 [-1, 1],指示如何为下一帧调整输入尺度。
- 使用损失 L_scalereg(均方误差)来训练回归器,使其与来自每图像损失度量的真实最优尺度对齐。
- 通过假设连续视频帧具有相似的最优尺度来利用时间一致性。
- 在测试阶段应用 AdaScale,通过一个简单的解码步骤将回归得到的尺度映射回集合 S 中的实际图像尺度。
- 可选地将 AdaScale 与现有视频加速方法结合,以进一步提升速度。
- 训练在多尺度下对基于 R-FCN 的检测器进行细调,并在保持检测器固定的同时学习回归器权重。
实验结果
研究问题
- RQ1自适应图像缩放是否能在传统固定尺度测试之外同时提升视频对象检测器的速度和准确性?
- RQ2推理阶段的降采样是否有助于减少误检并增加真阳性?
- RQ3基于当前帧内容,学习到的回归器在多大程度上能有效预测下一帧的最优尺度?
- RQ4AdaScale 是否能与其他视频加速技术互补,以实现更优的速度-准确性帕累托边界?
主要发现
- AdaScale 在 ImageNet VID 上实现了 1.3 点 mAP 提升,速度提升 1.6x(MS/AdaScale vs SS/SS)。
- AdaScale 在 mini YouTube-BB 上实现了 2.7 点 mAP 提升,速度提升 1.8x(MS/AdaScale vs SS/SS)。
- 将 AdaScale 与最先进的视频加速方法结合,在 ImageNet VID 上还能获得约 25% 的额外加速,且 mAP 略有提升。
- 尺度回归器额外带来约 2 ms 的开销(约为 R-FCN 运行时间的 3%)。
- 自适应缩放相较固定尺度基线减少了假阳性,并在召回率变化不大的情况下提高了精确度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。