Skip to main content
QUICK REVIEW

[论文解读] Learning to Cluster for Proposal-Free Instance Segmentation

Yen-Chang Hsu, Zheng Xu|arXiv (Cornell University)|Mar 17, 2018
Advanced Neural Network Applications被引用 6
一句话总结

本文提出了一种新颖的端到端学习目标,用于全卷积网络(FCNs)实现无提议实例分割,通过利用成对像素关系和图着色理论。该方法使网络能够直接为像素分配聚类索引,在不使用外部数据的情况下,Cityscapes数据集上达到15.1%的AP,并在2017年CVPR自动驾驶挑战赛车道检测竞赛中获得第二名。

ABSTRACT

This work proposed a novel learning objective to train a deep neural network to perform end-to-end image pixel clustering. We applied the approach to instance segmentation, which is at the intersection of image semantic segmentation and object detection. We utilize the most fundamental property of instance labeling -- the pairwise relationship between pixels -- as the supervision to formulate the learning objective, then apply it to train a fully convolutional network (FCN) for learning to perform pixel-wise clustering. The resulting clusters can be used as the instance labeling directly. To support labeling of an unlimited number of instance, we further formulate ideas from graph coloring theory into the proposed learning objective. The evaluation on the Cityscapes dataset demonstrates strong performance and therefore proof of the concept. Moreover, our approach won the second place in the lane detection competition of 2017 CVPR Autonomous Driving Challenge, and was the top performer without using external data.

研究动机与目标

  • 为解决在遮挡和对象数量变化的复杂场景中进行实例分割的挑战,特别是在提议生成不可行的情况下。
  • 通过训练全卷积网络实现端到端的像素级聚类,消除对目标提议的需求。
  • 通过学习目标中引入受图着色启发的策略,使网络能够泛化到任意数量的实例。
  • 提升在多类别和高遮挡数据集(如Cityscapes)上的性能,这些数据集上现有无提议方法表现不佳。
  • 展示无需依赖外部训练数据的实时推理能力和鲁棒性。

提出的方法

  • 使用成对像素关系作为监督信号,构建新颖的学习目标,使同一实例中的像素具有相似的特征。
  • 将图着色理论整合到损失函数中,允许在远距离对象间复用聚类索引,从而支持处理任意数量的实例。
  • 训练一个全卷积网络(FCN),采用多任务头:实例ID预测、语义分割和目标中心回归。
  • 采用采样策略,每类选择50个像素,并应用对比损失(公式8),边距为256像素,选取前8对正样本。
  • 通过连通组件提取进行后处理,随后将平均目标中心距离在20像素以内的区域进行合并。
  • 基于掩码大小分配置信度分数,较小的掩码获得较低置信度,以提升AP评估表现。

实验结果

研究问题

  • RQ1能否训练一个全卷积网络实现端到端的像素级聚类,以实现无提议的实例分割?
  • RQ2如何有效将图着色理论整合到深度学习目标中,以支持对任意数量实例的聚类?
  • RQ3与基于搜索的方法(如JGD)相比,数据驱动的聚类方法在实例分割基准测试中的表现如何?
  • RQ4语义分割质量在多大程度上影响无提议方法的最终实例分割AP得分?
  • RQ5所提方法能否在不使用外部训练数据的情况下实现竞争性性能并支持实时推理?

主要发现

  • 所提方法在Cityscapes数据集上达到15.1%的平均精度(AP),显著优于共享相似图标签思路的JGD方法(9.8% AP)。
  • 在Cityscapes的无提议方法中排名第四,并在2017年CVPR自动驾驶挑战赛车道检测竞赛中获得第二名,且未使用外部数据。
  • 当结合真实语义分割和最优置信度排序时,AP提升至38.4%,凸显了AP对语义分割质量的强依赖性。
  • 网络实现了约55 FPS的实时推理,证明了其在实际部署中的可行性。
  • 失败案例包括过度分割以及相邻物体被分配相同ID,但基于目标中心预测的合并策略有效缓解了这些问题。
  • 消融实验确认,语义分割质量是影响AP的主导因素,随着分割质量提升,AP从16.0%提升至28.4%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。