Skip to main content
QUICK REVIEW

[论文解读] Scaling Open-Vocabulary Image Segmentation with Image-Level Labels

Golnaz Ghiasi, Xiuye Gu|arXiv (Cornell University)|Dec 22, 2021
Multimodal Machine Learning Applications被引用 10
一句话总结

OpenSeg 提出了一种可扩展的开放词汇图像分割框架,利用图像级字幕训练模型以分割任意文本查询。该方法首先预测与类别无关的分割掩码,然后通过区域级特征将字幕中的词语与这些掩码对齐,利用弱监督的大规模字幕数据,在 PASCAL VOC 上相比 LSeg 实现了 19.9 mIoU 的性能提升。

ABSTRACT

We design an open-vocabulary image segmentation model to organize an image into meaningful regions indicated by arbitrary texts. Recent works (CLIP and ALIGN), despite attaining impressive open-vocabulary classification accuracy with image-level caption labels, are unable to segment visual concepts with pixels. We argue that these models miss an important step of visual grouping, which organizes pixels into groups before learning visual-semantic alignments. We propose OpenSeg to address the above issue while still making use of scalable image-level supervision of captions. First, it learns to propose segmentation masks for possible organizations. Then it learns visual-semantic alignments by aligning each word in a caption to one or a few predicted masks. We find the mask representations are the key to support learning image segmentation from captions, making it possible to scale up the dataset and vocabulary sizes. OpenSeg significantly outperforms the recent open-vocabulary method of LSeg by +19.9 mIoU on PASCAL dataset, thanks to its scalability.

研究动机与目标

  • 实现对封闭集类别之外任意文本查询的图像分割。
  • 克服 CLIP 和 ALIGN 等视觉-语言模型的局限性,这些模型由于依赖单图像特征表示而缺乏像素级定位能力。
  • 通过弱监督的图像级字幕而非昂贵的像素级标注,实现训练数据和词汇量的可扩展性。
  • 在中层视觉分组之后学习视觉-语义对齐,以提升定位精度。
  • 通过语言作为统一接口,实现在不同数据集之间的零样本迁移性能。

提出的方法

  • 该模型使用与类别无关的分割头,并通过区域到图像的交叉注意力机制预测一组候选分割掩码。
  • 通过基于掩码的特征池化,从每个预测掩码内的像素生成具有位置感知的区域特征。
  • 通过在区域嵌入和词嵌入上使用对比损失,学习将字幕中的词语与预测掩码进行匹配,实现视觉-语义对齐。
  • 该方法利用预训练的 CLIP/ALIGN 文本编码器,并从大规模 ALIGN 检查点初始化视觉主干网络,以获得更好的初始化效果。
  • 对字幕应用文本过滤,仅保留名词和形容词,以减少训练过程中的噪声。
  • 在推理阶段,将预测的掩码用作提议,通过特征图与词嵌入之间的点积来引导像素级分割。

实验结果

研究问题

  • RQ1能否从图像级字幕而非像素级标注中有效学习开放词汇分割的视觉-语义对齐?
  • RQ2在通过掩码提议实现的中层视觉分组之后学习视觉-语义对齐,是否相比在全局图像特征上进行端到端对齐,能提升定位精度?
  • RQ3通过图像字幕实现弱监督的可扩展性,如何影响模型在不同数据集上的性能与泛化能力?
  • RQ4文本过滤(例如仅保留名词和形容词)对模型鲁棒性与性能有何影响?
  • RQ5在大规模弱监督数据上进行训练的模型,能否在未见的分割基准上实现强大的零样本迁移性能?

主要发现

  • OpenSeg 在 PASCAL VOC 数据集上相比最强的 LSeg 模型实现了 19.9 mIoU 的性能提升,证明了其在零样本泛化方面的优越性。
  • 使用预训练的 ALIGN 视觉编码器进行初始化,性能优于随机初始化或 NoisyStudent 初始化,尽管差距较小。
  • 在推理阶段不使用掩码提议时,PC-59 上的 mIoU 下降了 10.0 分,表明掩码提议对准确的定位至关重要。
  • 若使用真实掩码作为提议,PC-59 上的 mIoU 提升至 49.3,表明当前的掩码预测仍不理想,是主要瓶颈。
  • 将字幕过滤为仅包含名词和形容词时性能最佳,相比使用所有词语,mIoU 提升最高达 1.1 分。
  • 该模型在未见数据集上泛化良好,证明了使用语言作为统一接口训练通用分割模型的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。