Skip to main content
QUICK REVIEW

[论文解读] Conterfactual Generative Zero-Shot Semantic Segmentation

Feihong Shen, Jun Liu|arXiv (Cornell University)|Jun 11, 2021
Domain Adaptation and Few-Shot Learning参考文献 36被引用 7
一句话总结

本文提出了一种用于零样本语义分割的反事实生成框架,通过建模因果关系而非虚假的统计相关性,减少了已见类与未见类之间的偏差。通过生成反事实特征并应用因果训练策略,该方法在未见类上将mIoU提升了24%,在已见类上提升了19%,优于基线生成模型,同时保持与GCN等辅助结构的兼容性。

ABSTRACT

zero-shot learning is an essential part of computer vision. As a classical downstream task, zero-shot semantic segmentation has been studied because of its applicant value. One of the popular zero-shot semantic segmentation methods is based on the generative model Most new proposed works added structures on the same architecture to enhance this model. However, we found that, from the view of causal inference, the result of the original model has been influenced by spurious statistical relationships. Thus the performance of the prediction shows severe bias. In this work, we consider counterfactual methods to avoid the confounder in the original model. Based on this method, we proposed a new framework for zero-shot semantic segmentation. Our model is compared with baseline models on two real-world datasets, Pascal-VOC and Pascal-Context. The experiment results show proposed models can surpass previous confounded models and can still make use of additional structures to improve the performance. We also design a simple structure based on Graph Convolutional Networks (GCN) in this work.

研究动机与目标

  • 解决生成式零样本语义分割模型中已见类与未见类之间严重的性能不平衡问题。
  • 缓解由已见类特征与词嵌入之间虚假统计相关性导致的预测偏差。
  • 开发一种基于因果性的训练策略,以提升泛化能力,且无需修改现有生成模型的核心架构。
  • 展示与GCN等辅助结构的兼容性,以进一步提升性能。
  • 为先前模型结构改进为何能提升性能提供理论基础解释。

提出的方法

  • 该方法引入了一种反事实推理框架,通过操纵真实特征和生成特征分布来生成反事实特征。
  • 使用独立的分类器对真实特征和生成特征进行分类,以实现独立优化。
  • 通过深度网络学习偏移方向,将生成特征和反事实特征重新定位至更准确的分布。
  • 训练策略应用因果调整,以减少特征生成过程中混淆因素的影响。
  • 该框架可与现有生成模型(如ZS3Net)兼容,并可扩展集成GCN等辅助结构。
  • 该方法采用全局优化目标,使生成特征和反事实特征与真实未见类特征分布对齐。

实验结果

研究问题

  • RQ1如何减少零样本语义分割模型中由已见类特征与词嵌入之间虚假统计关系引起的偏差?
  • RQ2反事实推理能否在不降低已见类性能的前提下,提升生成模型在未见类上的泛化能力?
  • RQ3为何先前模型中的结构改进(如GCNs)能提升性能?能否从因果角度进行解释?
  • RQ4基于因果性的训练策略在多大程度上可与现有模型架构解耦并保持兼容?
  • RQ5与基线生成模型相比,该方法在已见类和未见类上的mIoU表现如何进行定量比较?

主要发现

  • 与原始ZS3Net模型相比,所提出的反事实训练策略在Pascal-VOC和Pascal-Context数据集上,使未见类的mIoU提升了24%,已见类提升了19%。
  • 该方法有效缓解了已见类与未见类性能之间的不平衡,通过纠正由虚假相关性引起的数据分布偏移。
  • 与无GCN结构的模型相比,集成基于GCN的结构使整体mIoU提升了2%,尤其在Pascal-Context数据集上性能提升更显著。
  • 邻接矩阵的可视化显示,并非所有类别均能同等受益于GCN,表明性能提升取决于类别相似性和可用的训练信号。
  • 该框架成功解释了为何先前的架构改进(如GCNs)能提升性能,因为它们更符合特征分布学习的因果结构。
  • 该方法保持与现有生成模型的兼容性,可作为即插即用的训练策略,在无需架构重构的情况下提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。