Skip to main content
QUICK REVIEW

[论文解读] Reviving Iterative Training with Mask Guidance for Interactive Segmentation

Konstantin Sofiiuk, Ilya A. Petrov|arXiv (Cornell University)|Feb 12, 2021
Advanced Image and Video Retrieval Techniques被引用 8
一句话总结

该论文提出了一种前馈式、迭代点击交互分割模型,利用前序步骤的预测掩码来提升准确性和稳定性,在无需推理时优化的情况下,于所有主要基准上实现了最先进性能。核心贡献是使用 COCO+LVIS 中高质量、多样化的标注数据,设计了一种简单但高效的迭代训练方案,显著提升了模型泛化能力,并支持新物体分割与外部掩码修正。

ABSTRACT

Recent works on click-based interactive segmentation have demonstrated state-of-the-art results by using various inference-time optimization schemes. These methods are considerably more computationally expensive compared to feedforward approaches, as they require performing backward passes through a network during inference and are hard to deploy on mobile frameworks that usually support only forward passes. In this paper, we extensively evaluate various design choices for interactive segmentation and discover that new state-of-the-art results can be obtained without any additional optimization schemes. Thus, we propose a simple feedforward model for click-based interactive segmentation that employs the segmentation masks from previous steps. It allows not only to segment an entirely new object, but also to start with an external mask and correct it. When analyzing the performance of models trained on different datasets, we observe that the choice of a training dataset greatly impacts the quality of interactive segmentation. We find that the models trained on a combination of COCO and LVIS with diverse and high-quality annotations show performance superior to all existing models. The code and trained models are available at https://github.com/saic-vul/ritm_interactive_segmentation.

研究动机与目标

  • 探究是否可在无需复杂推理时优化方案的情况下实现最先进交互分割性能。
  • 评估训练数据集质量与多样性对交互分割性能的影响。
  • 开发一种前馈模型,能够通过利用先前掩码输出迭代优化预测,支持新物体分割与外部掩码修正。
  • 证明在高质量、多样化数据集上训练的强大基线模型可超越更复杂的带优化机制模型。

提出的方法

  • 提出一种前馈模型,将前一次点击的分割掩码作为输入送入网络,实现无需反向传播的迭代优化。
  • 引入一种迭代训练流程,使模型在每一步均基于前序迭代的真值掩码预测更优的掩码。
  • 在 COCO+LVIS 数据集组合上进行训练,以利用多样化、高质量的实例标注,提升跨物体类别的泛化能力。
  • 采用 HRNet 作为主干网络(H18、H18s、H32),并引入 OCR(对象上下文表征)模块以增强特征表示。
  • 在训练期间使用标准的随机点采样模拟点击,避免使用复杂的数据增强或启发式点击模拟方法。
  • 采用多阶段推理过程,每次点击通过单次前向传播更新掩码预测,保持高效性。

实验结果

研究问题

  • RQ1是否一种简单的前馈模型配合迭代掩码引导,能够超越依赖复杂推理时优化的最先进方法?
  • RQ2训练数据集的选择——尤其是其多样性与标注质量——如何影响交互分割性能?
  • RQ3在 COCO+LVIS 上训练的模型能否实现更优的泛化能力,并同时处理新物体分割与掩码修正?
  • RQ4通过掩码反馈进行的迭代训练是否能提升模型稳定性,并防止额外点击后准确率下降?

主要发现

  • 所提出的迭代前馈模型(IT-M)采用 HRNet-18s+OCR 主干,在 Pascal VOC 上达到 NoC@90 为 4.70,优于所有先前方法。
  • 在 Berkeley 数据集上,H18s IT-M 变体达到 NoC@90 为 1.68,显著优于先前最先进方法的 3.07。
  • 在 GrabCut 上,COCO+LVIS 训练的模型达到 NoC@85 为 1.54,优于先前最先进方法的 2.60。
  • 该迭代模型在所有基准上均表现出稳定性能,任意点击后均无准确率下降,且一致收敛至更高 IoU 值。
  • 最小模型(H18s IT-M)性能与更大变体相当,支持在移动端和低算力设备上部署。
  • 消融实验确认,使用 COCO+LVIS 等高质量、多样化数据集进行训练至关重要,使用粗糙或较小数据集训练的模型性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。