Skip to main content
QUICK REVIEW

[論文レビュー] ZegCLIP: Towards Adapting CLIP for Zero-shot Semantic Segmentation

Ziqin Zhou, Bowen Zhang|arXiv (Cornell University)|Dec 7, 2022
Domain Adaptation and Few-Shot Learning被引用数 9
ひとこと要約

ZegCLIPは、軽量なデコーダーを用いてCLIPの画像レベルゼロショット分類を直接ピクセルレベルの予測に拡張することで、1段階で効率的なゼロショットセマンティックセグメンテーションを実現する手法を提案する。VOC、COCO、Contextのデータセットにおいて最先端の性能を達成し、先行手法と比較して大幅に優れており、2段階ベースラインと比較して約5倍高速な推論を実現しながら、3つの鍵となる設計(ディーププロンプトチューニング、非排他的損失、関係記述子)により、未学習クラスへの強い汎化性能を維持する。

ABSTRACT

Recently, CLIP has been applied to pixel-level zero-shot learning tasks via a two-stage scheme. The general idea is to first generate class-agnostic region proposals and then feed the cropped proposal regions to CLIP to utilize its image-level zero-shot classification capability. While effective, such a scheme requires two image encoders, one for proposal generation and one for CLIP, leading to a complicated pipeline and high computational cost. In this work, we pursue a simpler-and-efficient one-stage solution that directly extends CLIP's zero-shot prediction capability from image to pixel level. Our investigation starts with a straightforward extension as our baseline that generates semantic masks by comparing the similarity between text and patch embeddings extracted from CLIP. However, such a paradigm could heavily overfit the seen classes and fail to generalize to unseen classes. To handle this issue, we propose three simple-but-effective designs and figure out that they can significantly retain the inherent zero-shot capacity of CLIP and improve pixel-level generalization ability. Incorporating those modifications leads to an efficient zero-shot semantic segmentation system called ZegCLIP. Through extensive experiments on three public benchmarks, ZegCLIP demonstrates superior performance, outperforming the state-of-the-art methods by a large margin under both "inductive" and "transductive" zero-shot settings. In addition, compared with the two-stage method, our one-stage ZegCLIP achieves a speedup of about 5 times faster during inference. We release the code at https://github.com/ZiqinZhou66/ZegCLIP.git.

研究の動機と目的

  • 既存のCLIPベースのゼロショットセマンティックセグメンテーション手法の2段階パイプライン(領域提案用とCLIP推論用の別々の画像エンコーダーを必要とする)を単純化すること。
  • ビジョンエンコーダーのファインチューニングを伴わずに、CLIPの画像レベルゼロショット分類能力をピクセルレベルのセグメンテーションに直接転送すること。
  • インダクティブおよびトランスダクティブなゼロショット設定の両方において、学習済みクラスの性能を維持するとともに、未学習クラスへの汎化性能を向上させること。
  • 過学習を防ぎつつ、CLIPが内蔵するゼロショット能力を保持する、軽量で効率的かつエンドツーエンドの1段階フレームワークを構築すること。

提案手法

  • CLIPのパッチ埋め込みと学習可能なデコーダーを用い、テキストプロンプトをピクセル単位の局所的画像特徴と直接マッチングする1段階フレームワークを提案する。
  • ビジョンエンコーダーの更新を避けてCLIPのゼロショット汎化能力を保持するため、CLIPのテキストエンコーダーをファインチューニングするディーププロンプトチューニング(DPT)を適用する。
  • 複数のクラスを独立して予測できるようにするため、シグモイド交差エントロピーを用いた非排他的損失(NEL)を導入し、長尾分布や新規クラスの性能を向上させる。
  • マッチングの前に、画像レベルの意味的事前知識をテキスト埋め込みに組み込むことで、学習済みクラスへの過学習を軽減する関係記述子(RD)を統合する。
  • 自己注意機構を備えた軽量デコーダーを用い、テキスト埋め込みとCLIPのパッチ特徴を比較することでピクセル単位の分類を実行する。
  • ビジョンエンコーダーを固定またはDPTでチューニングし、デコーダーを学習済みクラスのサブセット上でエンドツーエンドに訓練するハイブリッドトレーニング戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ12つの別々の画像エンコーダーを必要とせずに、CLIPの画像レベルゼロショット分類能力を1段階でピクセルレベルのセグメンテーションに直接拡張することは可能か?
  • RQ2CLIPをセマンティックセグメンテーションにナチュラルに1段階で拡張すると、なぜ未学習クラスへの汎化が失敗し、学習済みクラスへの過学習が生じるのか?
  • RQ3密度予測タスクのファインチューニングや適応処理において、CLIPの本質的ゼロショット汎化能力をどのように保持できるか?
  • RQ4どのようなアーキテクチャ的またはトレーニング上の変更が、学習済みクラスの性能を維持しながら、新規クラスへのゼロショット汎化性能を顕著に向上させられるか?
  • RQ51つの統合フレームワークが、トレーニング時に未学習クラス名を事前に知らなくても、インダクティブおよびトランスダクティブなゼロショットセマンティックセグメンテーションの両方を処理できるか?

主な発見

  • インダクティブ設定下でVOCデータセットにおいて、ZegCLIPは学習済みクラスで91.9%のmIoU、未学習クラスで77.8%のmIoUを達成し、先行SOTA手法を上回る。
  • COCOデータセットでは、未学習クラスで41.4%のmIoUを達成し、ベースラインの39.0%および前回SOTAの40.2%を大きく上回る。
  • 関係記述子(RD)単体でも、VOCおよびCOCOで未学習クラスのmIoUがほぼ10ポイント上昇し、過学習を防ぐ上で極めて重要な役割を果たしていることが示された。
  • 領域提案生成と別々のCLIPエンコーディングの必要がないため、ZegCLIPはzsseg や ZegFormer といった2段階手法と比較して約5倍高速な推論を実現した。
  • COCOからContextへのドメイン転送において、ZegCLIPは41.2%のmIoUと68.4%のmAccを達成し、ZegFormerの36.1%と64.0%を上回り、強力なクロスドメイン汎化性能を示した。
  • ディーププロンプトチューニング、NEL、RDの組み合わせにより、学習済みクラスで94.6%のピクセル精度と91.9%のmIoU、未学習クラスで77.8%のmIoUを達成し、全設計の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。