Skip to main content
QUICK REVIEW

[论文解读] Linguistic Structure Guided Context Modeling for Referring Image Segmentation

Tianrui Hui, Si Liu|arXiv (Cornell University)|Oct 1, 2020
Multimodal Machine Learning Applications参考文献 42被引用 10
一句话总结

本文提出了一种语言结构引导的上下文建模(LSCM)模块,通过使用依赖解析树抑制的词图(DPT-WG)实现‘收集-传播-分发’机制,对多模态上下文进行建模,从而提升指代图像分割的性能。该方法通过选择性聚合相关视觉与语言特征,同时抑制无关特征,实现了在四个基准测试上的最先进性能。

ABSTRACT

Referring image segmentation aims to predict the foreground mask of the object referred by a natural language sentence. Multimodal context of the sentence is crucial to distinguish the referent from the background. Existing methods either insufficiently or redundantly model the multimodal context. To tackle this problem, we propose a "gather-propagate-distribute" scheme to model multimodal context by cross-modal interaction and implement this scheme as a novel Linguistic Structure guided Context Modeling (LSCM) module. Our LSCM module builds a Dependency Parsing Tree suppressed Word Graph (DPT-WG) which guides all the words to include valid multimodal context of the sentence while excluding disturbing ones through three steps over the multimodal feature, i.e., gathering, constrained propagation and distributing. Extensive experiments on four benchmarks demonstrate that our method outperforms all the previous state-of-the-arts.

研究动机与目标

  • 解决指代图像分割中多模态上下文建模的噪声与冗余问题。
  • 通过利用语言结构引导选择性、上下文感知的特征聚合,提升指代定位精度。
  • 在多模态特征融合过程中,减少无关视觉或语言特征的干扰。
  • 开发一种高效且有效的机制,通过受约束的图传播建模有效、句子级别的多模态上下文。

提出的方法

  • 构建一种依赖解析树抑制的词图(DPT-WG),其中每个节点代表一个词,边受句法依赖关系约束。
  • 通过跨模态注意力执行‘收集’操作,将每个词与视觉上相关的图像区域关联,形成初始多模态特征。
  • 应用受DPT引导的边抑制的约束图卷积,实现词之间的上下文传播,排除语义上相距较远或无关的连接。
  • 通过‘分发’操作,将优化后的多模态特征回传至图像特征图,供分割头使用。
  • 将LSCM模块集成至分割框架中,并使用交叉熵损失和Dice损失进行端到端训练。
  • 使用可学习的树掩码及参数α,平衡直接连接与DPT约束传播,优化边权重以实现噪声抑制。

实验结果

研究问题

  • RQ1如何有效利用语言结构来建模相关多模态上下文,同时排除干扰特征?
  • RQ2在词图传播中,完全连接与句法约束之间的最优平衡是什么?
  • RQ3采用DPT抑制图传播的‘收集-传播-分发’框架是否能提升现有方法的分割精度?
  • RQ4图边权重选择(如树掩码中的α)如何影响模型抑制无关上下文的能力?

主要发现

  • LSCM模块在四个指代图像分割基准测试中均达到最先进性能,超越先前的SOTA方法。
  • 当树掩码中α = 0.1时,模型在UNC验证集上达到55.93%的IoU,较无DPT抑制的基线(α = 1)提升1.12%。
  • 仅使用一层图卷积(n=1)时性能最佳,表明更深的传播会引入噪声而非增益。
  • 消融实验证实,受约束的传播(通过DPT)至关重要,即使使用词级特征聚合,无此机制的模型性能仍较差。
  • 定性结果表明,该模型能准确定位复杂表达,如‘棕色外套’或‘粉色桌上的金毛犬’,即使存在多个实体和属性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。