[论文解读] ZegOT: Zero-shot Segmentation Through Optimal Transport of Text Prompts
ZegOT 提出了一种新颖的零样本语义分割框架,通过最优传输技术将多个可学习文本提示与冻结的 CLIP 图像嵌入对齐,使每个提示能够专注于不同的视觉属性。通过引入多提示最优传输(MPOT)求解器,ZegOT 在不微调视觉-语言模型的情况下,在 PASCAL VOC 2012 和 PASCAL Context 上实现了最先进性能。
Recent success of large-scale Contrastive Language-Image Pre-training (CLIP) has led to great promise in zero-shot semantic segmentation by transferring image-text aligned knowledge to pixel-level classification. However, existing methods usually require an additional image encoder or retraining/tuning the CLIP module. Here, we propose a novel Zero-shot segmentation with Optimal Transport (ZegOT) method that matches multiple text prompts with frozen image embeddings through optimal transport. In particular, we introduce a novel Multiple Prompt Optimal Transport Solver (MPOT), which is designed to learn an optimal mapping between multiple text prompts and visual feature maps of the frozen image encoder hidden layers. This unique mapping method facilitates each of the multiple text prompts to effectively focus on distinct visual semantic attributes. Through extensive experiments on benchmark datasets, we show that our method achieves the state-of-the-art (SOTA) performance over existing Zero-shot Semantic Segmentation (ZS3) approaches.
研究动机与目标
- 为解决在不微调视觉-语言模型的情况下实现零样本语义分割的挑战。
- 改善在像素级预测中多个文本提示与视觉特征之间的对齐。
- 使每个文本提示能够专注于图像的不同语义属性,避免提示坍缩。
- 仅使用可学习文本提示和解码器,同时保持 CLIP 冻结,实现最先进性能。
提出的方法
- 提出一种多提示最优传输(MPOT)求解器,以学习多个文本提示与冻结图像编码器特征之间的最优映射。
- 使用 Sinkhorn 算法实现可微分的一对多分配,使每个像素可部分关联到所有提示。
- 在已见类别上优化传输计划,并将其迁移用于已见和未见类别的得分图预测。
- 采用线性层进行全局文本嵌入对齐,以及可学习图像解码器进行像素级分割。
- 利用 CLIP 的视觉-语言对齐特性,而不重新训练或微调其图像或文本编码器。
- 应用最优传输技术以解耦提示之间的语义关注,防止收敛到相似特征。

实验结果
研究问题
- RQ1最优传输能否在零样本语义分割中有效对齐多个文本提示与视觉特征?
- RQ2通过最优传输实现的一对多分配是否优于一对一或基于注意力的匹配方式,在提示分布和分割精度方面表现更优?
- RQ3是否可以仅通过可学习文本提示和解码器,有效利用完全冻结的 CLIP 模型进行密集预测?
- RQ4与基线提示对齐方法相比,MPOT 在已见和未见类别上的性能提升如何?
主要发现
- 在 PASCAL VOC 2012 上,ZegOT 实现了 90.9 mIoU (U) 和 91.4 hIoU 的最先进性能,优于先前方法。
- 在 PASCAL Context 上,ZegOT 实现了 72.5 mIoU (U) 和 59.5 hIoU,展现出对未见类别的强大泛化能力。
- 消融实验中若不使用 MPOT,PASCAL VOC 2012 上 mIoU (U) 下降 5.5%,PASCAL Context 上下降 7.5%,证实了 MPOT 的关键作用。
- 基于 Sinkhorn 的最优传输在 PASCAL VOC 2012 上比二分匹配高出 5.7 hIoU,在 PASCAL Context 上高出 7.9 hIoU。
- 基于自注意力的匹配方式在 PASCAL VOC 2012 上比 ZegOT 低 6.5% mIoU (U),在 PASCAL Context 上低 13.2%,凸显了 OT 在保留冻结模型知识方面的优势。
- t-SNE 可视化结果表明,MPOT 能够实现分散且具有类别特异性的提示分布,而基线方法则呈现紧密聚集、缺乏区分性的提示分布。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。