Skip to main content
QUICK REVIEW

[论文解读] CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation

Monika Wysoczańska, Oriane Siméoni|arXiv (Cornell University)|Dec 19, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

CLIP-DINOiser 通过在 CLIP 的单次前向传播中应用两个轻量级卷积层,利用 DINO 的自监督定位先验,对 CLIP 的密集特征进行优化,从而提升其零样本开放词汇语义分割性能。该方法在 COCO、Pascal Context、Cityscapes 和 ADE20k 上实现了最先进性能,且无需任何标注或微调。

ABSTRACT

The popular CLIP model displays impressive zero-shot capabilities thanks to its seamless interaction with arbitrary text prompts. However, its lack of spatial awareness makes it unsuitable for dense computer vision tasks, e.g., semantic segmentation, without an additional fine-tuning step that often uses annotations and can potentially suppress its original open-vocabulary properties. Meanwhile, self-supervised representation methods have demonstrated good localization properties without human-made annotations nor explicit supervision. In this work, we take the best of both worlds and propose an open-vocabulary semantic segmentation method, which does not require any annotations. We propose to locally improve dense MaskCLIP features, which are computed with a simple modification of CLIP's last pooling layer, by integrating localization priors extracted from self-supervised features. By doing so, we greatly improve the performance of MaskCLIP and produce smooth outputs. Moreover, we show that the used self-supervised feature properties can directly be learnt from CLIP features. Our method CLIP-DINOiser needs only a single forward pass of CLIP and two light convolutional layers at inference, no extra supervision nor extra memory and reaches state-of-the-art results on challenging and fine-grained benchmarks such as COCO, Pascal Context, Cityscapes and ADE20k. The code to reproduce our results is available at https://github.com/wysoczanska/clip_dinoiser.

研究动机与目标

  • 在不依赖任何人工标注的分割数据的前提下,实现基于 CLIP 的零样本开放词汇语义分割。
  • 提升 CLIP 的密集特征的空间定位质量,这些特征本质上存在噪声且缺乏细粒度结构。
  • 通过避免微调或类特定原型构建,保留 CLIP 的原始开放词汇能力。
  • 仅通过一次 CLIP 前向传播和两个轻量级卷积层,实现极低计算开销的高性能。
  • 证明 CLIP 已经编码了可提取并借助自监督引导增强的有用定位先验。

提出的方法

  • 通过将 MaskCLIP 的全局自注意力层修改为卷积层,生成密集的 patch 级特征,同时保持视觉-语言对齐。
  • 引入一个可学习的卷积池化层,模仿 DINO 的 patch 相关性模式,从 CLIP 特征中生成概念感知的、局部化的特征池化结果。
  • 利用自监督的 DINO 特征作为蒸馏目标,指导池化权重的学习,而无需任何标注。
  • 引入第二个轻量级卷积层,从 CLIP 特征中学习目标度分数,模拟 DINO 的无监督目标度图(FOUND)。
  • 利用学习到的池化和目标度图,在 CLIP 的单次前向传播中生成高质量的分割掩码。
  • 采用双路径机制:一条用于概念感知定位,一条用于背景检测,两者均以 DINO 作为指导进行训练。

实验结果

研究问题

  • RQ1CLIP 的密集特征能否在不进行微调或标注的情况下被有效优化以提升定位性能?
  • RQ2自监督的 DINO 特征在多大程度上能引导 CLIP 生成对齐更好、更平滑的分割掩码?
  • RQ3能否仅通过轻量级可学习层,将 DINO 的目标度和 patch 相关性先验直接迁移至 CLIP 特征?
  • RQ4在零样本语义分割中,仅添加极少计算量的单次推理流水线是否优于多轮推理或基于原型的方法?
  • RQ5CLIP-DINOiser 是否能在保持开放词汇灵活性的同时,在细粒度和复杂基准上实现最先进性能?

主要发现

  • 在 COCO、Pascal Context、Cityscapes 和 ADE20k 上,CLIP-DINOiser 分别实现了 +6.7 mIoU、+5.1 mIoU、+5.0 mIoU 和 +2.2 mIoU 的性能提升,优于第二好的方法。
  • 在 Pascal VOC 上,该方法达到 60.1 mIoU,相比 MaskCLIP 提升 +6.4 mIoU,当使用基于不确定性的 FOUND 目标度图细化时,最高可达 62.1 mIoU。
  • 尽管 OVDiff 需要为每个概念构建原型,CLIP-DINOiser 在 Context 上仍优于其 +2.3 mIoU,在 Object 上优于 +0.2 mIoU。
  • 在 Cityscapes 和 ADE20k 等复杂场景中,CLIP-DINOiser 的定位精度和细粒度程度明显优于 CLIP-DIY 和 TCL。
  • 该方法保持了完整的开放词汇能力,仅在 CLIP 的单次前向传播中完成推理,额外增加两个轻量级卷积层,且计算开销极低。
  • 消融实验证实,性能提升主要来自概念感知池化和学习到的目标度图,其中后者显著改善了背景分割。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。