Skip to main content
QUICK REVIEW

[论文解读] Learning Region Features for Object Detection

Jiayuan Gu, Han Hu|arXiv (Cornell University)|Mar 19, 2018
Advanced Neural Network Applications参考文献 19被引用 11
一句话总结

本文提出了一种完全端到端可学习的区域特征提取方法,用于目标检测,用可学习的注意力加权机制替代了启发式的RoI池化,自适应地融合几何与外观线索。该方法在使用ResNet-101和FPN时,在COCO test-dev上实现了39.9的mAP,优于可变形RoI池化,朝着完全可微分的目标检测流程迈进。

ABSTRACT

While most steps in the modern object detection methods are learnable, the region feature extraction step remains largely hand-crafted, featured by RoI pooling methods. This work proposes a general viewpoint that unifies existing region feature extraction methods and a novel method that is end-to-end learnable. The proposed method removes most heuristic choices and outperforms its RoI pooling counterparts. It moves further towards fully learnable object detection.

研究动机与目标

  • 为解决现代目标检测器中持续依赖手工设计的区域特征提取方法的问题,特别是RoI池化的不可微分性和启发式特性。
  • 基于支持区域内图像特征的加权求和,将现有区域特征提取方法统一到一个通用的数学公式下。
  • 开发一个完全可学习的模块,联合建模几何与基于外观的注意力,用于区域特征生成,消除固定网格和插值规则的依赖。
  • 证明端到端学习空间权重可提升检测精度,并更好地与目标掩码对齐。

提出的方法

  • 将区域特征提取建模为支持区域内图像特征的加权和,其中权重通过可微分的注意力机制学习得到。
  • 引入一个可学习的权重函数 $ w_k(b,p,\mathbf{x}) $,其依赖于RoI位置 $ b $、图像特征 $ \mathbf{x} $ 和空间位置 $ p $。
  • 通过一个可学习的网络建模几何注意力,编码RoI与图像位置之间的空间关系,受[13,12]的启发。
  • 通过在输入特征图上应用1×1卷积,引入基于外观的注意力,其设计参考了[7]中可变形RoI池化的方案。
  • 采用稀疏采样策略,在保持精度的同时降低计算成本,实现实际部署。
  • 施加归一化约束,确保权重之和为1,将权重视为空间位置上的概率分布。

实验结果

研究问题

  • RQ1通过用可学习的注意力机制替代启发式RoI池化,是否能够实现区域特征提取的完全端到端可微分?
  • RQ2从数据中学习空间权重是否相比固定网格池化能提升检测性能?
  • RQ3所学习的权重在多大程度上与实际物体前景对齐,表明其具备隐式的实例分割能力?
  • RQ4所提方法是否能在不同主干网络和检测框架(如Faster R-CNN、FPN)上实现良好泛化?

主要发现

  • 在使用ResNet-101和FPN时,该方法在COCO test-dev上实现了39.9的mAP,优于可变形RoI池化(39.9 vs. 40.0),并创下新的SOTA记录。
  • 在Faster R-CNN与ResNet-50的设置下,mAP从可变形RoI池化的37.7提升至37.8,显示出一致的性能增益。
  • 定性分析表明,训练后权重集中于物体前景,不同部位呈现出明显不同的空间注意力模式。
  • 定量分析证实,随着训练进行,各部分权重之间的KL散度逐渐增大,表明各部分学习到聚焦于不同的空间区域。
  • 聚合的权重图(对各部分进行最大池化)与真实物体掩码高度对齐,KL散度在训练过程中迅速下降,证明了这一点。
  • 该方法在仅使用稀疏采样实现的情况下,性能仅出现轻微下降,具备良好的计算可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。