Skip to main content
QUICK REVIEW

[论文解读] Towards Robust Referring Image Segmentation

Jianzong Wu, Xiangtai Li|arXiv (Cornell University)|Sep 20, 2022
Multimodal Machine Learning Applications被引用 9
一句话总结

本文提出了鲁棒指代图像分割(R-RIS)这一新任务,将标准指代图像分割扩展至处理错误或误导性文本描述,要求模型在目标对象不存在时输出空白掩码。作者提出RefSegformer模型,一种基于Transformer的模型,包含视觉-语言标记融合模块与空白标记设计,以提升鲁棒性,在标准与鲁棒RIS基准上均取得最先进性能,引入了rIoU与mRR等新指标。

ABSTRACT

Referring Image Segmentation (RIS) is a fundamental vision-language task that outputs object masks based on text descriptions. Many works have achieved considerable progress for RIS, including different fusion method designs. In this work, we explore an essential question, ``What if the text description is wrong or misleading?'' For example, the described objects are not in the image. We term such a sentence as a negative sentence. However, existing solutions for RIS cannot handle such a setting. To this end, we propose a new formulation of RIS, named Robust Referring Image Segmentation (R-RIS). It considers the negative sentence inputs besides the regular positive text inputs. To facilitate this new task, we create three R-RIS datasets by augmenting existing RIS datasets with negative sentences and propose new metrics to evaluate both types of inputs in a unified manner. Furthermore, we propose a new transformer-based model, called RefSegformer, with a token-based vision and language fusion module. Our design can be easily extended to our R-RIS setting by adding extra blank tokens. Our proposed RefSegformer achieves state-of-the-art results on both RIS and R-RIS datasets, establishing a solid baseline for both settings. Our project page is at \url{https://github.com/jianzongwu/robust-ref-seg}.

研究动机与目标

  • 为解决现有指代图像分割(RIS)模型在面对错误或误导性文本描述时缺乏鲁棒性的问题。
  • 提出一种新的任务范式——鲁棒RIS(R-RIS),明确处理不存在目标(非存在对象)的指代表达。
  • 通过在现有RIS数据集基础上添加多样化的否定句,构建三个新的R-RIS数据集。
  • 设计并评估新指标——鲁棒交并比(rIoU)与平均鲁棒召回率(mRR),以同时评估准确率与鲁棒性。
  • 开发RefSegformer模型,一种基于Transformer的模型,包含视觉-语言标记融合模块与空白标记机制,作为R-RIS的强基线。

提出的方法

  • 提出一种新任务范式R-RIS,要求模型对否定(不存在目标)的文本输入输出空白掩码,对正样本输入输出正确掩码。
  • 通过在RefCOCO、RefCOCO+和RefCOCOg上每条引用添加10个否定句,使用五种生成方法(随机替换、名称替换、目标对象变更、属性变更、关系变更)构建三个R-RIS基准。
  • 引入两种评估指标:用于像素级鲁棒性与准确率的鲁棒交并比(rIoU),以及用于评估否定输入下实例级鲁棒性的平均鲁棒召回率(mRR)。
  • 设计RefSegformer模型,一种基于Transformer的模型,包含视觉编码器、语言编码器,以及利用记忆标记动态选择相关语言特征的视觉-语言标记融合(VLTF)模块。
  • 在融合机制中引入空白标记,其不与语言特征交互,使模型能够将现有目标检测与非存在目标识别解耦。
  • 通过多头交叉注意力(MHCA)在VLTF模块中融合视觉与语言特征,使模型能够关注相关视觉与语言表征。

实验结果

研究问题

  • RQ1如何使指代图像分割模型对不存在于图像中的错误或误导性文本描述具备鲁棒性?
  • RQ2有哪些有效方法可用于生成多样且真实的否定指代表达,以用于鲁棒RIS模型的基准测试?
  • RQ3如何设计评估指标,以同时衡量分割准确率与对否定输入的鲁棒性?
  • RQ4像RefSegformer这样的统一Transformer架构能否有效处理标准RIS与新R-RIS任务,并实现性能提升?
  • RQ5在融合机制中引入空白标记相比标准融合模块,如何提升模型鲁棒性?

主要发现

  • RefSegformer在六个数据集上均取得最先进性能,涵盖标准RIS与新引入的R-RIS基准。
  • 所提出的VLTF融合模块在mRR与rIoU指标上优于PWAN + LP,展现出对否定输入更强的鲁棒性。
  • RefSegformer配合VLTF模块在R-RIS基准上实现46.08的rIoU与73.73的mRR,显著优于无法泛化至否定输入的基线模型。
  • 失败案例显示,模型在描述形状相似对象(如斑马被误认为天鹅)的否定句时表现不佳,表明需提升形状与上下文泛化能力。
  • 每个实例每条引用包含10个否定句的新R-RIS基准,相比单一对否定句的基准,对模型鲁棒性提供了更严格的测试。
  • rIoU与mRR指标有效捕捉了分割准确率与鲁棒性,为R-RIS模型提供统一的评估框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。