Skip to main content
QUICK REVIEW

[论文解读] Few-shot Segmentation with Optimal Transport Matching and Message Flow

Weide Liu, Chi Zhang|arXiv (Cornell University)|Aug 19, 2021
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

本文提出CMNet,一种少样本分割模型,通过部分最优传输匹配在查询特征与支持特征之间建立密集且受约束的对应关系,同时利用信息流模块增强局部与全局特征表示。该方法在PASCAL VOC 2012、MS COCO和FSS-1000数据集上,在标准与弱监督设置下均实现了最先进性能。

ABSTRACT

We tackle the challenging task of few-shot segmentation in this work. It is essential for few-shot semantic segmentation to fully utilize the support information. Previous methods typically adopt masked average pooling over the support feature to extract the support clues as a global vector, usually dominated by the salient part and lost certain essential clues. In this work, we argue that every support pixel's information is desired to be transferred to all query pixels and propose a Correspondence Matching Network (CMNet) with an Optimal Transport Matching module to mine out the correspondence between the query and support images. Besides, it is critical to fully utilize both local and global information from the annotated support images. To this end, we propose a Message Flow module to propagate the message along the inner-flow inside the same image and cross-flow between support and query images, which greatly helps enhance the local feature representations. Experiments on PASCAL VOC 2012, MS COCO, and FSS-1000 datasets show that our network achieves new state-of-the-art few-shot segmentation performance.

研究动机与目标

  • 解决先前少样本分割方法依赖支持特征全局平均池化所导致的空间结构丢失及非判别性区域利用不足的问题。
  • 通过实现查询与支持特征之间的受约束多对多对应关系,克服先前方法中多对一匹配的问题。
  • 通过引入信息流模块增强局部特征表示,该模块在图像内部(内流)与图像之间(跨流)传播信息。
  • 在弱监督设置下(如边界框标注)提升少样本分割性能,通过有限标注类型维持高精度。
  • 通过验证失败案例并分析模型局限性,确保对模糊或外观相似物体的鲁棒性。

提出的方法

  • 提出部分最优传输(POT)匹配模块,基于真实标注中的物体尺寸施加最大匹配流量约束,实现查询与支持特征之间更均衡、更全面的对应关系。
  • 引入信息流模块,将查询与支持特征建模为图结构,沿边传播消息,通过内流(图像内部)与跨流(图像之间)机制优化局部表示。
  • 将位置编码整合到特征表示中,以提升空间对齐与对应关系的准确性。
  • 采用双分支编码器-解码器架构,结合交叉注意力与特征精炼机制,利用匹配与传播后的特征引导分割预测。
  • 在先前掩码预测后应用POT模块以精炼预测结果,避免因完整最优传输产生的噪声或错误对应关系导致的过拟合。
  • 通过将像素级支持标注替换为边界框,验证方法在弱监督设置下的性能,证明其对粗粒度监督的鲁棒性。

实验结果

研究问题

  • RQ1与全局池化或无约束匹配相比,受约束的多对多匹配机制(如部分最优传输)是否能提升少样本分割中的对应关系学习?
  • RQ2在局部与全局特征空间中传播信息如何提升分割精度,特别是对判别性较弱的物体部分?
  • RQ3引入位置编码是否能提升少样本设置下的空间对齐与分割性能?
  • RQ4当支持标注从像素级掩码简化为边界框时,所提方法是否仍能保持高性能?
  • RQ5模型的失败模式是什么?其与查询图像中视觉相似性或语义上下文缺失的关系如何?

主要发现

  • CMNet在PASCAL VOC 2012上达到新的SOTA性能,1-shot设置下mIoU达62.5%,优于先前方法(如PGNet的61.7% mIoU)。
  • 在MS COCO数据集上,该方法在1-shot与5-shot设置下均优于所有先前SOTA方法。
  • 在FSS-1000基准上,CMNet在1-shot与5-shot评估协议中均创下新SOTA结果。
  • 消融实验表明,位置编码使性能提升0.4 mIoU,PASCAL VOC 2012在1-shot评估下从62.1%提升至62.5%。
  • 使用完整最优传输匹配相比部分最优传输性能下降,表明受约束匹配可避免错误对应关系(如将背景区域错误匹配)。
  • 在弱监督设置下使用边界框支持时,CMNet在PASCAL VOC 2012与FSS-1000上均优于现有方法,证明其在监督信息减少条件下的强泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。