[论文解读] Single Pixel Reconstruction for One-stage Instance Segmentation
本文提出SPRNet,一种单阶段实例分割框架,通过专用的单像素重建(SPR)分支,直接从单个特征图像素重建实例掩码,实现了比Mask R-CNN等两阶段方法更快的推理速度,同时达到最先进精度。通过集成改进的门控FPN(GFPN)以实现更优的特征融合,SPRNet在COCO基准上优于RetinaNet和Mask R-CNN,尤其在小目标检测和速度方面表现突出。
Object instance segmentation is one of the most fundamental but challenging tasks in computer vision, and it requires the pixel-level image understanding. Most existing approaches address this problem by adding a mask prediction branch to a two-stage object detector with the Region Proposal Network (RPN). Although producing good segmentation results, the efficiency of these two-stage approaches is far from satisfactory, restricting their applicability in practice. In this paper, we propose a one-stage framework, SPRNet, which performs efficient instance segmentation by introducing a single pixel reconstruction (SPR) branch to off-the-shelf one-stage detectors. The added SPR branch reconstructs the pixel-level mask from every single pixel in the convolution feature map directly. Using the same ResNet-50 backbone, SPRNet achieves comparable mask AP to Mask R-CNN at a higher inference speed, and gains all-round improvements on box AP at every scale comparing with RetinaNet.
研究动机与目标
- 开发一种无需区域建议网络(RPN)的单阶段实例分割框架,实现高效率。
- 解决在无RoI的情况下,从单个特征图中区分并分割多个实例的挑战。
- 通过减少不同特征层级之间的梯度干扰,改进多尺度检测中的特征融合。
- 在显著快于两阶段检测器的前提下,实现具有竞争力的实例分割精度。
- 在单阶段框架中实现小目标检测的高性能。
提出的方法
- 引入单像素重建(SPR)分支,通过转置卷积从单个特征图像素生成32×32的掩码得分图。
- 在选定像素周围使用空洞卷积,以在掩码重建前收集足够的上下文信息。
- 采用改进的主干网络,增强特征表示能力,以支持基于单像素的精确掩码预测。
- 提出门控FPN(GFPN),在特征融合前引入门控机制,以抑制不同特征层级间的梯度泄漏。
- 通过可学习门控的逐元素加法操作,选择性地融合来自不同FPN层级的特征,提升特征质量与检测鲁棒性。
- 采用编码器-解码器架构,SPR分支与分类和回归头并行运行。
实验结果
研究问题
- RQ1单阶段实例分割模型能否在显著快于两阶段模型(如Mask R-CNN)的同时,达到可比的性能?
- RQ2能否在不依赖区域建议的情况下,仅从特征图中的单个像素有效启动掩码预测?
- RQ3在特征融合中引入门控机制,能否通过控制不同特征层级间的梯度流动,提升检测精度,特别是对小目标和大目标?
- RQ4所提出的SPRNet框架是否在所有目标尺度上均优于现有单阶段检测器(如RetinaNet)的精度与速度?
- RQ5SPRNet框架能否仅使用ResNet-50主干网络,在COCO实例分割基准上达到最先进性能?
主要发现
- SPRNet在使用ResNet-50时,COCO验证集上的掩码AP达到36.6,与使用ResNet-101和RoIAlign的Mask R-CNN相当,但推理速度更快。
- 在ResNet-50与GFPN的配合下,SPRNet在小目标上的AP_S达到20.2%,超越了使用ResNet-101的最佳两阶段方法。
- RetinaNet在引入GFPN后,AR_S提升2.4个百分点(从32.0提升至34.4),显著改善了小目标检测性能。
- SPRNet在使用ResNet-101与GFPN时,AR_S达到29.7%,AR_L达到68.0%,在两项指标上均优于使用ResNet-101-FPN的Mask R-CNN。
- GFPN模块减少了不同特征层级间的梯度干扰,从而在所有尺度上提升了检测性能,尤其对大目标效果显著。
- SPRNet框架在单阶段实例分割中实现了最先进性能,证明了在单阶段设计中高精度与高速度是兼容的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。