[论文解读] Zero-Shot Semantic Segmentation
本文提出零样本语义分割(ZS3),这是一种新型任务,使分割模型能够在没有任何训练样本的情况下对未见过的物体类别进行像素分类。所提出的ZS3Net架构通过生成建模融合视觉与文本嵌入,以合成未见类别的特征,同时自训练和图上下文编码进一步提升性能,在Pascal-VOC和Pascal-Context数据集上实现了接近监督学习的准确率,支持最多10个未见类别。
Semantic segmentation models are limited in their ability to scale to large numbers of object classes. In this paper, we introduce the new task of zero-shot semantic segmentation: learning pixel-wise classifiers for never-seen object categories with zero training examples. To this end, we present a novel architecture, ZS3Net, combining a deep visual segmentation model with an approach to generate visual representations from semantic word embeddings. By this way, ZS3Net addresses pixel classification tasks where both seen and unseen categories are faced at test time (so called "generalized" zero-shot classification). Performance is further improved by a self-training step that relies on automatic pseudo-labeling of pixels from unseen classes. On the two standard segmentation datasets, Pascal-VOC and Pascal-Context, we propose zero-shot benchmarks and set competitive baselines. For complex scenes as ones in the Pascal-Context dataset, we extend our approach by using a graph-context encoding to fully leverage spatial context priors coming from class-wise segmentation maps.
研究动机与目标
- 解决语义分割模型在推理阶段无法泛化到新未见物体类别的问题。
- 仅使用语义描述而无需训练样本,实现对从未见过的物体类别的像素级分类。
- 通过使用未见类别中无标签像素的自训练,提升零样本分割性能。
- 通过图上下文编码利用空间上下文先验,提升复杂场景中的识别能力。
提出的方法
- ZS3Net将深度视觉分割主干网络与生成模型结合,将语义词嵌入映射到视觉特征空间,以生成未见类别的特征。
- 模型使用联合视觉-文本嵌入空间,其中语义相似性转化为空间接近性,实现零样本迁移。
- 自训练步骤在训练期间自动为未见类别中高置信度像素生成伪标签,提升泛化能力。
- 引入图上下文编码以建模物体类别之间的空间关系,提升复杂场景中的特征表示。
- 该框架支持广义零样本学习,即在测试时同时存在已见和未见类别。
- 模型训练结合了已见类别的监督损失与由生成的未见类别特征提供的合成监督信号。
实验结果
研究问题
- RQ1语义分割模型能否在训练过程中从未见过的物体类别上进行训练并实现识别?
- RQ2如何从语义词嵌入有效生成未见类别的视觉特征?
- RQ3使用未见类别中伪标签像素的自训练在多大程度上能提升零样本分割性能?
- RQ4空间上下文先验(如物体共现模式)在复杂场景中如何增强零样本分割性能?
主要发现
- 在Pascal-VOC数据集上,2个未见类别时,ZS3Net的平均IoU达到75.7,接近监督基线的76.1。
- 采用自训练(ZS5Net)后,在Pascal-VOC上2个未见类别时的整体调和平均IoU达到75.7,与监督性能持平。
- 在Pascal-Context数据集上,2个未见类别时,ZS5Net的调和平均IoU达到47.7,显著优于ZSL基线。
- 图上下文编码在Pascal-Context上所有未见类别划分中均一致提升了ZS3Net的mIoU性能。
- 在Pascal-VOC上使用25%高分未见像素、在Pascal-Context上使用75%未见像素进行自训练可获得最佳性能,未见类别mIoU最高提升达10%。
- 定性结果表明,ZS5Net成功分割了此前未训练过的物体如'motorbike'和'cow',而基线模型则将其误分类为已见类别的混合体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。