[论文解读] RefineMask: Towards High-Quality Instance Segmentation with Fine-Grained Features
RefineMask 提出了一种多阶段精细化框架,通过在掩码预测过程中迭代地整合细粒度特征,显著提升了边界精度。通过逐步上采样并结合边界感知的精细化策略,将高分辨率语义特征与 RoI 对齐特征融合,RefineMask 在 COCO、LVIS 和 Cityscapes 上相较于 Mask R-CNN 实现了 2.6–3.8 AP 的显著提升,其在 LVIS 2020 挑战赛测试集上的表现优于冠军模型 1.3 AP,达到新的 SOTA 水平。
The two-stage methods for instance segmentation, e.g. Mask R-CNN, have achieved excellent performance recently. However, the segmented masks are still very coarse due to the downsampling operations in both the feature pyramid and the instance-wise pooling process, especially for large objects. In this work, we propose a new method called RefineMask for high-quality instance segmentation of objects and scenes, which incorporates fine-grained features during the instance-wise segmenting process in a multi-stage manner. Through fusing more detailed information stage by stage, RefineMask is able to refine high-quality masks consistently. RefineMask succeeds in segmenting hard cases such as bent parts of objects that are over-smoothed by most previous methods and outputs accurate boundaries. Without bells and whistles, RefineMask yields significant gains of 2.6, 3.4, 3.8 AP over Mask R-CNN on COCO, LVIS, and Cityscapes benchmarks respectively at a small amount of additional computational cost. Furthermore, our single-model result outperforms the winner of the LVIS Challenge 2020 by 1.3 points on the LVIS test-dev set and establishes a new state-of-the-art. Code will be available at https://github.com/zhanggang001/RefineMask.
研究动机与目标
- 为解决类似 Mask R-CNN 的两阶段实例分割方法中因下采样和 RoI 池化导致的掩码质量粗糙问题。
- 通过在掩码预测过程中保留并整合高分辨率特征,提升实例分割的边界精度。
- 开发一种轻量级的多阶段精细化机制,在不依赖额外数据或复杂架构的前提下提升掩码质量。
- 在 LVIS 和 Cityscapes 等具有挑战性的基准上建立新的实例分割 SOTA 水平。
提出的方法
- 引入一种多阶段精细化头,从低分辨率特征图逐步上采样掩码预测,同时融合 FPN 中最高分辨率特征图(P2 层)的细粒度特征。
- 采用边界感知的精细化策略,通过关注边缘敏感特征,显式提升边界区域的掩码精度。
- 在每个精细化阶段,通过跳跃连接和拼接操作,将高分辨率语义特征(来自 FPN 的 P2 层)与实例特定特征融合。
- 采用改进的掩码头,通过多个阶段处理特征,每个阶段均利用上下文实例特征和细粒度空间细节对掩码预测进行精细化。
- 利用 RoIAlign 进行初始特征提取,但通过在每个精细化步骤中整合高分辨率特征,避免早期下采样。
- 采用标准交叉熵损失和 Dice 损失进行端到端训练,同时优化掩码质量和边界精度。
实验结果
研究问题
- RQ1通过使用细粒度特征进行迭代精细化,能否显著提升两阶段实例分割中的掩码质量?
- RQ2在多个阶段中整合高分辨率语义特征,与标准 RoI 方法相比,对边界精度的提升效果如何?
- RQ3在不使用额外数据或复杂检测头的前提下,多阶段精细化头在多大程度上能超越 PointRend 和 HTC 等 SOTA 方法?
- RQ4边界感知精细化策略是否在 LVIS 和 Cityscapes 等具有精细标注的数据集上带来可测量的性能提升?
- RQ5单模型 RefineMask 是否能在不使用额外人工标注数据的前提下,超越 LVIS 2020 挑战赛冠军?
主要发现
- 在 COCO val2017 上,RefineMask 相较于 Mask R-CNN 实现了 2.6 AP 的提升,分别在 LVIS 和 Cityscapes 上取得 3.4 和 3.8 AP 的增益,表明其在多个数据集上均具有一致的性能提升。
- 在 LVISv1.0 测试开发集上,RefineMask 优于 LVIS 2020 挑战赛冠军 1.3 AP,确立了新的 SOTA 水平。
- 在 LVIS 上,对于大尺寸物体,RefineMask 相较于 Mask R-CNN 实现了 6.0 AP 的显著提升,凸显其在处理复杂、细节丰富的区域方面的有效性。
- 在 Cityscapes 上,RefineMask 相较于 Mask R-CNN 实现了 3.8 AP 的增益,尤其在细粒度物体部件和边界等困难样本上表现突出。
- 定性结果表明,RefineMask 在某些情况下生成的掩码质量甚至超过真实标注,尤其是在锐利边界区域,提示需要更严格的评估指标。
- 该方法仅带来少量计算成本的增加,使其在实际部署中具备可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。