[论文解读] Window-Object Relationship Guided Representation Learning for Generic Object Detections
本文提出了一种用于通用目标检测的表示学习框架,利用窗口-目标关系(如相对位置、尺度和邻近目标)作为监督信号,以提升特征学习效果。通过基于这些关系对候选窗口进行聚类,并结合多尺度、多旋转的上下文区域进行训练,该方法在 ILSVRC2014 上实现了 6.4% 的 mAP 提升,在 ILSVRC2014 测试集上达到 48.6% 的 mAP,优于先前的 SOTA 模型。
In existing works that learn representation for object detection, the relationship between a candidate window and the ground truth bounding box of an object is simplified by thresholding their overlap. This paper shows information loss in this simplification and picks up the relative location/size information discarded by thresholding. We propose a representation learning pipeline to use the relationship as supervision for improving the learned representation in object detection. Such relationship is not limited to object of the target category, but also includes surrounding objects of other categories. We show that image regions with multiple contexts and multiple rotations are effective in capturing such relationship during the representation learning process and in handling the semantic and visual variation caused by different window-object configurations. Experimental results show that the representation learned by our approach can improve the object detection accuracy by 6.4% in mean average precision (mAP) on ILSVRC2014. On the challenging ILSVRC2014 test dataset, 48.6% mAP is achieved by our single model and it is the best among published results. On PASCAL VOC, it outperforms the state-of-the-art result of Fast RCNN by 3.3% in absolute mAP.
研究动机与目标
- 解决现有目标检测方法通过 IOU 阈值简化窗口-目标关系所导致的空间和尺度上下文信息丢失问题。
- 通过将细粒度的窗口-目标关系(如相对位置、尺度和周围目标)融入监督信号,提升表示学习效果。
- 证明通过聚类和多尺度、多旋转数据增强建模上下文关系,可增强特征的判别能力与检测准确率。
提出的方法
- 该方法提出一种表示学习流程,利用窗口-目标关系作为监督信号,其中每个候选窗口根据其与真实目标的相对位置和尺度被分配一个子类别。
- 采用聚类方法将具有相似窗口-目标关系的候选窗口分组,使网络能够在每个簇内学习到更一致且解耦的特征。
- 针对每个簇,使用专用回归器预测相对位移和尺度变化,从而提升定位精度和表示质量。
- 框架引入多尺度和多旋转的数据增强策略,每个候选窗口在多种尺度和旋转设置下被裁剪和旋转,以捕获多样化的上下文配置。
- 网络被训练以同时预测簇标签和每个簇内的相对边界框回归,采用双流损失函数。
- 该方法进一步扩展以建模与其他类别邻近目标的关系,从而仅从图像区域中获得更丰富的上下文监督。
实验结果
研究问题
- RQ1将比简单 IOU 阈值更详细的窗口-目标关系纳入学习,是否能提升目标检测的表示学习效果?
- RQ2基于相对位置和尺度对候选窗口进行聚类,是否相比均匀分类能带来更具判别性的特征学习?
- RQ3多尺度和多旋转数据增强在多大程度上提升了模型捕捉目标检测中上下文关系的能力?
- RQ4建模与其他类别目标的上下文关系是否能进一步改善特征表示?
- RQ5所提出方法与 Fast R-CNN 和 GoogleNet 等 SOTA 方法在基准数据集上的表现相比如何?
主要发现
- 与基线方法相比,该方法在 ILSVRC2014 验证集上将平均平均精度(mAP)提升了 6.4%。
- 在 ILSVRC2014 测试集上,单模型结果达到 48.6% 的 mAP,是该研究发表时公布的最佳结果。
- 在 PASCAL VOC 2007 上,当在 VOC07 和 VOC12 的训练验证集上联合训练时,该方法比 Fast R-CNN 的绝对 mAP 提升了 3.3%。
- 使用窗口-目标关系聚类使 mAP 相比 Fast R-CNN 基线提升了 1.2%,证明了结构化监督的有效性。
- 采用为每种尺度独立设置网络参数的多尺度特征学习,相比共享参数的设置,mAP 提升了 3.4%,表明了尺度特定表示学习的优势。
- 引入旋转增强后,单尺度训练的 mAP 提升 2.0%,多尺度训练的 mAP 提升 0.3%,证实了旋转增强在捕捉空间不变性方面的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。