[论文解读] Object Detection Free Instance Segmentation With Labeling Transformations
本文提出了一种无需检测的实例分割框架,通过三种方法——基于像素的亲和力映射、基于超像素的亲和力学习以及基于边界的组件分割——绕过目标检测,利用标签变换实现。该方法采用全卷积网络,在以物体为中心(PASCAL VOC 2012)和以纹理为中心(Gland)的数据集上均实现了最先进性能,展示了卓越的泛化能力、透明度和效率,且无需依赖目标提议或边界框。
Instance segmentation has attracted recent attention in computer vision and existing methods in this domain mostly have an object detection stage. In this paper, we study the intrinsic challenge of the instance segmentation problem, the presence of a quotient space (swapping the labels of different instances leads to the same result), and propose new methods that are object proposal- and object detection- free. We propose three alternative methods, namely pixel-based affinity mapping, superpixel-based affinity learning, and boundary-based component segmentation, all focusing on performing labeling transformations to cope with the quotient space problem. By adopting fully convolutional neural networks (FCN) like models, our framework attains competitive results on both the PASCAL dataset (object-centric) and the Gland dataset (texture-centric), which the existing methods are not able to do. Our work also has the advantages in its transparency, simplicity, and being all segmentation based.
研究动机与目标
- 为解决实例分割中的根本挑战——由于商空间(即实例ID的排列)导致的标签模糊性,且不依赖目标检测。
- 开发一种仅分割的框架,避免目标提议与检测阶段带来的复杂性与局限性。
- 实现在以物体为中心和以纹理为中心的数据集上的有效实例分割,包括具有非刚性、形变物体的数据集。
- 通过消除检测头组件,提升模型的透明度、简洁性与计算效率。
提出的方法
- 提出三种无检测方法:基于像素的亲和力映射、基于超像素的亲和力学习以及基于边界的组件分割,以应对商空间问题。
- 使用全卷积神经网络(FCN)预测每个像素或每个超像素的亲和力,实现端到端的密集预测学习。
- 通过亲和力学习将模糊的实例标签问题转化为可学习的分类/回归任务,应用标签变换实现。
- 以语义分割生成的连通组件作为基线,并利用学习到的亲和力对它们进行细化,以分离不同实例。
- 引入一种变换策略,使实例ID可互换,使模型学习区域之间的相对关系而非绝对ID。
- 使用损失函数进行模型训练,该函数鼓励同一实例内像素间具有高亲和力,不同实例间具有低亲和力。
实验结果
研究问题
- RQ1是否可以在不使用目标检测或提议阶段的情况下实现实例分割,同时保持竞争力的性能?
- RQ2如何利用深度学习有效建模实例标签固有的模糊性(商空间)?
- RQ3一种完全卷积的、基于分割的框架是否能跨以物体为中心和以纹理为中心的数据集实现泛化?
- RQ4在实例分割中,基于像素、基于超像素和基于边界的亲和力学习各自具有哪些相对优势?
- RQ5在具有高度形变物体的数据集中,该方法与最先进检测方法相比表现如何?
主要发现
- 所提方法在MICCAI 2015年Gland分割数据集上达到最先进性能,Part A的F1得分为0.897,Object Dice为0.893,优于基于检测的方法如MNC和HyperColumn。
- 在PASCAL VOC 2012数据集上,该方法F1得分为0.897,Object Dice为0.893,尽管无检测阶段,仍与MNC和Xu等人[38]等基于检测的模型相当或更优。
- 基于边界的组件分割(方法3)在Gland数据集上表现最佳,Object Hausdorff得分达106.978,表明其形状相似性更优。
- 由于能够处理非刚性、高度形变的腺体结构(而矩形边界框无法捕捉),该方法在Gland数据集上优于基于检测的模型。
- 与复杂的基于检测的模型相比,该框架显著更简单、更透明,推理速度更快,训练更简便,同时保持高精度。
- 结果表明,无需目标检测的全卷积亲和力学习在以物体为中心和以纹理为中心的实例分割任务中均切实可行且高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。