[论文解读] GroupViT: Semantic Segmentation Emerges from Text Supervision
GroupViT 提出一种分层视觉变换器,仅通过图像-文本对比学习监督,即可学习将图像区域分组为语义上合理的、任意形状的分割区域,实现零样本语义分割,在 PASCAL VOC 2012 上达到 52.3% 的 mIoU,在 PASCAL Context 上达到 22.4%,在某些情况下超越了完全监督方法,且无需任何像素级标注或微调。
Grouping and recognition are important components of visual scene understanding, e.g., for object detection and semantic segmentation. With end-to-end deep learning systems, grouping of image regions usually happens implicitly via top-down supervision from pixel-level recognition labels. Instead, in this paper, we propose to bring back the grouping mechanism into deep networks, which allows semantic segments to emerge automatically with only text supervision. We propose a hierarchical Grouping Vision Transformer (GroupViT), which goes beyond the regular grid structure representation and learns to group image regions into progressively larger arbitrary-shaped segments. We train GroupViT jointly with a text encoder on a large-scale image-text dataset via contrastive losses. With only text supervision and without any pixel-level annotations, GroupViT learns to group together semantic regions and successfully transfers to the task of semantic segmentation in a zero-shot manner, i.e., without any further fine-tuning. It achieves a zero-shot accuracy of 52.3% mIoU on the PASCAL VOC 2012 and 22.4% mIoU on PASCAL Context datasets, and performs competitively to state-of-the-art transfer-learning methods requiring greater levels of supervision. We open-source our code at https://github.com/NVlabs/GroupViT .
研究动机与目标
- 通过仅利用图像-文本监督,实现无需任何像素级标注的零样本语义分割。
- 将显式的视觉分组重新引入深度神经网络,超越标准 CNN 和 ViT 中端到端的隐式分组机制。
- 证明语义分割区域可从在大规模图像-文本数据上训练的分层分组机制中自然涌现。
- 仅使用文本监督,在语义分割基准上实现具有竞争力的性能,超越需要微调或密集标注的方法。
提出的方法
- 提出一种分层分组视觉变换器(GroupViT),用多阶段动态、不规则形状的区域分组替代基于网格的标记处理。
- 引入一个可学习的分组模块,利用自注意力机制和特征聚合,将较小的视觉标记合并为更大的语义一致的区域。
- 在大规模图像-文本数据集(如 Conceptual Captions、Flickr30k)上,通过对比学习联合训练 GroupViT 与文本编码器,使用图像级别的文本监督。
- 对最终分组特征进行平均池化,生成图像级嵌入,将其与文本嵌入对比,以对齐视觉区域与文本概念。
- 通过在共享嵌入空间中计算分组嵌入与类别标签文本嵌入之间的相似度,实现零样本分割。
- 采用多阶段架构,早期阶段学习中级概念(如眼睛、肢体),后期阶段形成高级概念(如人脸、身体)。

实验结果
研究问题
- RQ1仅通过文本监督,无需任何像素级标注,语义分割是否可以自然涌现?
- RQ2在视觉变换器中,分层分组机制是否能在无显式监督的情况下学习形成语义上合理的图像区域?
- RQ3在图像-文本对比学习上预训练的模型,在零样本语义分割任务上的泛化能力有多强?
- RQ4在零样本分割中,与完全监督和自监督迁移方法相比,基于文本监督和分组机制的模型性能如何?
主要发现
- GroupViT 在零样本语义分割中,于 PASCAL VOC 2012 上达到 52.3% 的 mIoU,在 PASCAL Context 上达到 22.4% 的 mIoU,且无需任何微调或像素级标注。
- 该模型在性能上大幅超越基于非参数化分组的 CLIP 基线方法,证明了其学习到的分层分组机制的优越性。
- GroupViT 在 PASCAL VOC 2012 上的零样本性能(52.3% mIoU)几乎与在分类和分割标签上微调的完全监督 ViT(53% mIoU)相当。
- 尽管仅使用图像级别的文本监督,GroupViT 仍能学习形成语义一致的分组——注意力图显示分组标记会关注特定概念,如“手”或“眼睛”。
- 该模型能泛化到未见类别和词汇,表明从文本监督到密集预测任务的零样本迁移能力极强。
- 在 PASCAL Context 上性能较低,主要原因是背景类别(如地面、道路)在文本描述中代表性不足,导致分组区域被错误分类。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。