[论文解读] Mask Encoding for Single Shot Instance Segmentation
该论文提出 MEInst,一种新颖的单阶段实例分割框架,通过字典学习(如 PCA)将 2D 实例掩码编码为紧凑的、固定维度的向量,实现在 FCOS 等单阶段检测器中基于回归的高效掩码预测。该方法在使用单一 ResNeXt-101-FPN 模型和单尺度测试时,在 COCO 上实现了 36.9% 的掩码 AP,优于先前的单阶段方法,同时在小物体上表现出色,并保持了实时推理能力。
To date, instance segmentation is dominated by twostage methods, as pioneered by Mask R-CNN. In contrast, one-stage alternatives cannot compete with Mask R-CNN in mask AP, mainly due to the difficulty of compactly representing masks, making the design of one-stage methods very challenging. In this work, we propose a simple singleshot instance segmentation framework, termed mask encoding based instance segmentation (MEInst). Instead of predicting the two-dimensional mask directly, MEInst distills it into a compact and fixed-dimensional representation vector, which allows the instance segmentation task to be incorporated into one-stage bounding-box detectors and results in a simple yet efficient instance segmentation framework. The proposed one-stage MEInst achieves 36.4% in mask AP with single-model (ResNeXt-101-FPN backbone) and single-scale testing on the MS-COCO benchmark. We show that the much simpler and flexible one-stage instance segmentation method, can also achieve competitive performance. This framework can be easily adapted for other instance-level recognition tasks. Code is available at: https://git.io/AdelaiDet
研究动机与目标
- 为解决在单阶段实例分割中对实例掩码进行紧凑表示的挑战,该挑战导致其性能相比两阶段方法(如 Mask R-CNN)有所欠缺。
- 通过将 2D 掩码蒸馏为固定维度的表示向量,实现高效且准确的掩码预测,从而降低设计与计算复杂度。
- 证明仅通过掩码系数回归的简单单阶段框架即可实现具有竞争力的精度,而无需依赖复杂架构或多阶段流程。
- 表明通过字典学习(如 PCA)实现的掩码编码可生成鲁棒、抗噪声且易于重建的掩码表示。
- 建立一种可泛化的框架,兼容多种单阶段检测器,包括无锚点和有锚点范式。
提出的方法
- 该方法使用字典学习技术(如 PCA、稀疏编码或自编码器)将每个 2D 实例掩码编码为紧凑的、固定维度的向量。
- 掩码表示从实例掩码数据集中学习,利用自然掩码的低内在维度特性以减少冗余。
- 在单阶段检测器(如 FCOS)中添加并行掩码分支,用于回归固定维度的掩码系数,从而支持端到端训练。
- 通过使用学习到的字典对系数向量进行解码,获得重建掩码,实现高保真度的掩码重建。
- 该框架兼容有锚点和无锚点检测器,仅需极少的架构修改。
- 该方法避免了易受“空心衰减”伪影影响的轮廓基表示,尤其在不连通或复杂形状上表现更优。
实验结果
研究问题
- RQ1能否通过紧凑的、固定维度的向量表示实现单阶段检测器中具有竞争力的分割精度?
- RQ2与参数化轮廓基方法相比,通过字典学习(如 PCA)实现的掩码编码是否能提供更好的重建保真度和鲁棒性?
- RQ3仅通过掩码系数回归的简单单阶段实例分割框架,是否能在精度和推理速度上超越现有单阶段方法?
- RQ4与两阶段方法(如 Mask R-CNN)相比,该方法的性能如何,特别是在小物体和大物体上的表现?
- RQ5该掩码编码框架在不同单阶段检测器架构上的泛化能力如何?
主要发现
- MEInst 在使用单一 ResNeXt-101-FPN 模型和单尺度测试时,在 COCO 上实现了 36.9% 的掩码 AP,优于大多数先前的单阶段方法。
- 与 SOTA 轮廓基方法 ESE-Seg 相比,AP50 提升 11.8%,AP75 提升 16.5%,表明其在精度和细节保留方面具有显著优势。
- MEInst 在计算复杂度相近的情况下,精度超过 PolarMask,归因于更低的重建误差和更优的掩码表示能力。
- 对于小物体(面积 < 32²),MEInst 实现 38.0% 的掩码 AP,优于 Mask R-CNN 的 35.3%,表明在处理小实例方面具有显著优势。
- 对于大物体,MEInst 实现 46.7% 的掩码 AP,而 Mask R-CNN 为 53.5%,表明由于紧凑向量表示对高细节掩码的表达能力有限,存在性能差距。
- 通过数据增强(多尺度),MEInst 在 COCO test-dev 上达到 38.2% 的掩码 AP,展现出强大的可扩展性及进一步提升的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。