Skip to main content
QUICK REVIEW

[论文解读] ScribbleSeg: Scribble-based Interactive Image Segmentation

Xi Chen, Yau Shing Jonathan Cheung|arXiv (Cornell University)|Mar 20, 2023
Visual Attention and Saliency Detection被引用 6
一句话总结

本文提出ScribbleSeg,一种新颖的基于涂鸦的交互式图像分割框架,通过利用多样化的涂鸦模拟进行训练以及采用确定性评估协议,其性能优于现有的点击式方法。该框架提出两个关键模块——原型自适应模块(PAM)与校正优化模块(CRM),以更有效地利用涂鸦提示,在基准数据集上实现了最先进性能,且交互次数显著减少。

ABSTRACT

Interactive segmentation enables users to extract masks by providing simple annotations to indicate the target, such as boxes, clicks, or scribbles. Among these interaction formats, scribbles are the most flexible as they can be of arbitrary shapes and sizes. This enables scribbles to provide more indications of the target object. However, previous works mainly focus on click-based configuration, and the scribble-based setting is rarely explored. In this work, we attempt to formulate a standard protocol for scribble-based interactive segmentation. Basically, we design diversified strategies to simulate scribbles for training, propose a deterministic scribble generator for evaluation, and construct a challenging benchmark. Besides, we build a strong framework ScribbleSeg, consisting of a Prototype Adaption Module(PAM) and a Corrective Refine Module (CRM), for the task. Extensive experiments show that ScribbleSeg performs notably better than previous click-based methods. We hope this could serve as a more powerful and general solution for interactive segmentation. Our code will be made available.

研究动机与目标

  • 建立基于涂鸦的交互式图像分割的标准化训练与评估协议,该领域相较于点击式方法仍缺乏系统探索。
  • 解决现有基于涂鸦的方法在基准一致性、多样化训练数据模拟以及公平评估指标方面的不足。
  • 开发一个鲁棒且可泛化的模型,有效利用涂鸦相较于点击所提供的更丰富信息。
  • 证明涂鸦作为交互格式可显著减少实现高精度分割所需的交互次数。

提出的方法

  • 设计多个元模拟器,用于生成多样且逼真的训练用涂鸦,包括在预测误差区域进行迭代优化。
  • 提出一种确定性涂鸦生成器用于评估,该生成器在真实标签与预测结果之间的最大差异区域上生成正样本与负样本涂鸦。
  • 引入原型自适应模块(PAM),根据用户提供的涂鸦动态更新分割模型的投影核,以更好地捕捉外观与空间线索。
  • 开发校正优化模块(CRM),从模型预测中估计误差区域,并对掩码进行精细化处理,以提升细节准确性。
  • 通过将图像与涂鸦掩码同时作为输入,对点击式方法的基线模型进行改进,增强特征表示能力。
  • 采用SegFormer-B3作为主干网络,在ADE20K、Berkeley、SBD与DAVIS数据集上进行评估,使用标准化指标如IoU 85/90时的交互次数(NoI)进行衡量。

实验结果

研究问题

  • RQ1如何设计一种多样化且逼真的数据模拟策略,用于训练基于涂鸦的交互式分割模型?
  • RQ2在与点击式基线方法比较时,应采用何种公平且一致的评估协议来比较基于涂鸦的方法?
  • RQ3如何有效利用涂鸦中超越点击所提供的丰富空间与外观信息?
  • RQ4专用模块如PAM与CRM在基于涂鸦的分割中能多大程度上提升性能?
  • RQ5基于涂鸦的方法是否能在交互效率与准确性方面超越最先进点击式方法?

主要发现

  • 在DAVIS数据集上,ScribbleSeg实现IoU 90时的交互次数(NoI)为1.35,优于最佳点击式方法(FocalClick-B3-S2)的NoI 1.92。
  • 在ADE20K基准上,ScribbleSeg-B3在复杂场景中仅使用8次涂鸦即达到94.9%的IoU,展现出在多样化类别上的强大泛化能力。
  • 完整版ScribbleSeg模型(含PAM与CRM)相比其基线模型将交互次数(NoI)减少了25%,验证了所提模块的有效性。
  • CRM模块显著提升性能,尤其在细节优化方面;消融实验表明,若从上一阶段解耦特征,准确率进一步提升。
  • 确定性评估协议使与点击式方法的公平比较成为可能,结果表明单次涂鸦常优于多次点击。
  • ScribbleSeg-B3在DAVIS数据集上实现IoU 90时的NoI为3.99,优于最佳点击式方法的4.90,证实了涂鸦交互格式的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。