Skip to main content
QUICK REVIEW

[论文解读] Deep Extreme Cut: From Extreme Points to Object Segmentation

Kevis-Kokitsi Maninis, Sergi Caelles|arXiv (Cornell University)|Nov 24, 2017
Advanced Neural Network Applications参考文献 34被引用 15
一句话总结

DEXTR 提出了一种深度学习方法,通过使用极端点(最左、最右、最上、最下像素)作为输入,利用添加了高斯热图通道的卷积神经网络(CNN)生成精确的物体分割结果。该方法在交互式、视频和弱监督分割任务中均达到最先进性能,显著减少了用户输入量,在4次点击下相比使用边界框或涂抹线的方法,IoU最高提升10%。

ABSTRACT

This paper explores the use of extreme points in an object (left-most, right-most, top, bottom pixels) as input to obtain precise object segmentation for images and videos. We do so by adding an extra channel to the image in the input of a convolutional neural network (CNN), which contains a Gaussian centered in each of the extreme points. The CNN learns to transform this information into a segmentation of an object that matches those extreme points. We demonstrate the usefulness of this approach for guided segmentation (grabcut-style), interactive segmentation, video object segmentation, and dense segmentation annotation. We show that we obtain the most precise results to date, also with less user input, in an extensive and varied selection of benchmarks and datasets. All our models and code are publicly available on http://www.vision.ee.ethz.ch/~cvlsegmentation/dextr/.

研究动机与目标

  • 通过使用最少的用户输入来降低密集图像和视频分割中的标注成本。
  • 通过引入极端点监督而非边界框或涂抹线来提升分割精度。
  • 为训练监督模型提供高效且准确的掩码标注。
  • 统一并提升在交互式、视频和弱监督分割任务中的性能表现。

提出的方法

  • 该方法在 CNN 输入中增加一个高斯热图通道,每个极端点(左、右、上、下)对应一个高斯分布。
  • CNN 通过利用这些极端点热图提供的空间上下文信息,学习预测精确的物体掩码。
  • 模型在具有真实掩码的标注数据集上端到端训练,使用标准的分割损失函数。
  • 在交互式分割中,通过在误分类区域使用在线难例挖掘(OHEM)并添加额外的边界点击对网络进行微调。
  • 该方法可通过引入更多边界点击,将适用范围扩展至超过四个点,以进一步优化分割结果。
  • 预训练模型和代码已公开发布,以支持可复现性及在下游任务中的集成。

实验结果

研究问题

  • RQ1与基于边界框或涂抹线的方法相比,极端点监督是否能提升分割精度?
  • RQ2极端点引导在交互式和视频物体分割中的性能表现如何?
  • RQ3DEXTR 是否能生成与真实掩码匹配的高质量标注,以用于训练监督模型?
  • RQ4该方法是否在保持或提升模型性能的同时降低了标注成本?

主要发现

  • 在 PASCAL VOC 2012 验证集上,DEXTR 仅用 4 次点击即达到 91.5% 的 IoU,比表现第二好的方法(RIS-Net)高出 10.8 个百分点。
  • 在 GrabCut 数据集上,DEXTR 在 4 次点击下达到 94.4% 的 IoU,显著优于先前的交互式方法。
  • 在用于标注时,DEXTR 生成的掩码具有高精度,能够训练出性能与使用真实标注训练的模型相当的模型。
  • 在视频物体分割中,DEXTR 为 DAVIS 2016 和 DAVIS 2017 提供了更优的初始化,提升了跟踪精度。
  • 与完整像素级标注相比,该方法将标注成本降低了 10 倍,同时保持了最先进性能。
  • 在添加第五次点击时,在线难例挖掘(OHEM)对性能提升至关重要,因为它将训练重点集中在困难样本上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。