[论文解读] Fast Object Localization Using a CNN Feature Map Based Multi-Scale Search
本文提出了一种快速、实时的物体定位方法,通过在深度卷积神经网络特征图上进行多尺度和多长宽比的搜索,绕过区域建议。通过为不同子窗口尺寸和长宽比配置专用的全连接‘专家’单元,该方法实现了4 fps的推理速度,并在PASCAL VOC 12上相比先前方法提升了2.4%的mAP,在MSCOCO上提升了2.6%,同时显著减少了计算时间。
Object localization is an important task in computer vision but requires a large amount of computational power due mainly to an exhaustive multiscale search on the input image. In this paper, we describe a near real-time multiscale search on a deep CNN feature map that does not use region proposals. The proposed approach effectively exploits local semantic information preserved in the feature map of the outermost convolutional layer. A multi-scale search is performed on the feature map by processing all the sub-regions of different sizes using separate expert units of fully connected layers. Each expert unit receives as input local semantic features only from the corresponding sub-regions of a specific geometric shape. Therefore, it contains more nearly optimal parameters tailored to the corresponding shape. This multi-scale and multi-aspect ratio scanning strategy can effectively localize a potential object of an arbitrary size. The proposed approach is fast and able to localize objects of interest with a frame rate of 4 fps while providing improved detection performance over the state-of-the art on the PASCAL VOC 12 and MSCOCO data sets.
研究动机与目标
- 解决深度卷积神经网络中穷举多尺度物体定位带来的高计算开销问题。
- 在不依赖区域建议或缓慢的R-CNN式流水线的前提下,提升定位精度。
- 实现在视频或流媒体应用中物体定位的实时推理(4 fps)。
- 探索针对不同物体尺度和长宽比的形状特定专家网络的有效性。
- 在保持或提升检测性能的同时,相比现有基于CNN的定位方法显著减少计算时间。
提出的方法
- 该方法在预训练卷积神经网络最后一个卷积层的特征图上执行多尺度和多长宽比扫描。
- 为每个子窗口尺寸和长宽比配置独立的全连接‘专家’单元,每个单元专门训练以分类特定几何构型的物体。
- 从特征图中提取多个尺度的感兴趣子区域,窗口大小在6×6特征图上从4×4到6×6不等,最高可达13×13的窗口大小(在两级图像金字塔中)。
- 该方法利用两级图像金字塔(原始图像和双倍插值放大图像)以覆盖更广泛的物体尺度范围。
- 将所有专家单元的分类得分进行聚合,以识别每个物体类别中置信度最高的边界框。
- 每个空间位置的置信度得分通过计算包含该位置的所有检测结果的归一化得分的平均值得出,其中n=5用于抑制低置信度检测。
实验结果
研究问题
- RQ1在CNN特征图上采用多尺度和多长宽比扫描策略,是否能在不使用区域建议的情况下提升物体定位精度?
- RQ2为不同窗口形状配置专用的专家全连接层,是否比使用单一共享分类器带来更好的定位性能?
- RQ3该方法是否能在保持优于最先进方法的同时,实现实时推理(≥4 fps)?
- RQ4使用两级图像金字塔如何影响物体尺度的覆盖范围和定位性能?
- RQ5当增加金字塔层级数量时,精度与推理速度之间的权衡关系如何?
主要发现
- 所提方法实现了4 fps的帧率,显著快于RCNN(9.0 sec/im)和Fast-RCNN(2.1 sec/im),甚至快于Oquab15(1.3 sec/im)。
- 在PASCAL VOC 2012验证集上,该方法实现了75.4%的mAP,优于RCNN(74.8%)和Fast-RCNN(71.3%)。
- 使用三级图像金字塔时,相比两级版本,分类mAP提升2.6%,定位mAP提升2.4%,但推理时间增加至1.58 sec/im。
- 使用多个专家单元相比单一共享全连接层,将定位mAP提升了5.3个百分点(77.8% vs. 72.5%)。
- 该方法在定位精度上优于Oquab15与选择性搜索建议结合的结果,证明了基于子窗口方法的有效性。
- 采用n=5归一化方法的置信度得分聚合策略能有效抑制低置信度检测,提升定位鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。