Skip to main content
QUICK REVIEW

[论文解读] RDSNet: A New Deep Architecture for Reciprocal Object Detection and Instance Segmentation

Shaoru Wang, Yongchao Gong|arXiv (Cornell University)|Dec 11, 2019
Advanced Neural Network Applications参考文献 30被引用 16
一句话总结

RDSNet 提出了一种统一的双流深度架构,通过相互特征融合联合优化目标检测与实例分割。通过交替利用像素级掩码优化边界框,并利用目标级线索提升掩码质量,RDSNet 在保持高分辨率掩码的同时显著减少定位误差,实现了最先进精度(32.1 mAP,32 fps),优于 YOLACT 等单阶段方法,并解决了 Mask R-CNN 等两阶段模型的关键局限。

ABSTRACT

Object detection and instance segmentation are two fundamental computer vision tasks. They are closely correlated but their relations have not yet been fully explored in most previous work. This paper presents RDSNet, a novel deep architecture for reciprocal object detection and instance segmentation. To reciprocate these two tasks, we design a two-stream structure to learn features on both the object level (i.e., bounding boxes) and the pixel level (i.e., instance masks) jointly. Within this structure, information from the two streams is fused alternately, namely information on the object level introduces the awareness of instance and translation variance to the pixel level, and information on the pixel level refines the localization accuracy of objects on the object level in return. Specifically, a correlation module and a cropping module are proposed to yield instance masks, as well as a mask based boundary refinement module for more accurate bounding boxes. Extensive experimental analyses and comparisons on the COCO dataset demonstrate the effectiveness and efficiency of RDSNet. The source code is available at https://github.com/wangsr126/RDSNet.

研究动机与目标

  • 为解决目标检测与实例分割之间的相互依赖关系,尽管两者关联紧密,但常被视作独立任务。
  • 克服现有方法的局限,如掩码分辨率低、对检测结果依赖过高以及边界框定位误差。
  • 设计一种统一的端到端架构,通过相互方式利用目标级与像素级特征以提升性能。
  • 在保持高精度的同时实现实时推理速度,尤其针对小尺寸与大尺寸目标。
  • 通过引入基于掩码的边界框精炼机制,减少对基于回归的边界框预测的依赖。

提出的方法

  • RDSNet 采用双流架构:目标流用于基于回归的检测,像素流用于使用全卷积网络(FCN)主干网络的高分辨率实例分割。
  • 引入相关性模块与裁剪模块,将目标流中的实例感知特征与平移不变特征传递至像素流,以实现精确的掩码生成。
  • 基于掩码的边界框精炼模块(MBRM)利用预测的实例掩码来优化边界框坐标,通过掩码的最小外接矩形减少定位误差。
  • 训练过程中采用扩展与对比策略以处理背景像素的多样性,同时使用 OHEM(在线难例挖掘)提升掩码质量。
  • 在两流之间交替进行特征融合,使目标流能受益于像素级上下文信息,同时像素流可进一步优化目标定位。
  • 模型采用多任务损失端到端训练,结合检测与分割目标,通过超参数调优实现最优边界框精炼。

实验结果

研究问题

  • RQ1通过相互特征学习联合优化目标检测与实例分割,是否能同时提升两者的性能?
  • RQ2如何在不依赖检测框质量的前提下提升掩码质量,尤其对大尺寸目标?
  • RQ3与单纯依赖回归相比,利用像素级掩码信息是否能显著提升边界框定位精度?
  • RQ4何种训练策略最有效以减少背景像素混淆并提升掩码泛化能力?
  • RQ5在不同物体尺度下,所提出的 MBRM 模块相较于直接的掩码到边界框映射,在定位精度上表现如何?

主要发现

  • RDSNet 在 COCO 实例分割数据集上,输入尺寸为 550 时达到 32.1 mAP,推理速度为 32 fps,相比 YOLACT 提升 1.1 mAP,且精度与更慢的两阶段模型相当。
  • 结合 OHEM 时,裁剪模块相比线性组合(LC)提升 1.1 mAP,相比 YOLACT 提升 1.9 mAP,证明其在掩码生成中的有效性。
  • MBRM 模块显著提升边界框定位性能,尤其对大尺寸目标,大物体的 AP_L^bb 提升 3.2 mAP,且在各尺度上保持稳定性能。
  • 模型显著降低定位误差:MBRM 平均提升 AP_bb 1.3 分,最大增益出现在大物体上(+3.2 mAP),凸显掩码引导精炼的价值。
  • 消融实验表明,OHEM 与合理的数据增强策略(如训练时扩展边界框)对性能至关重要,仅使用 OHEM 即可相较 YOLACT 提升 1.9 mAP。
  • 推理速度与基础检测器几乎一致(10.9 fps),表明附加模块引入的开销极小,且模型可轻松适配至更快的检测器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。