[論文レビュー] CLIP Is Also a Good Teacher: A New Learning Framework for Inductive Zero-shot Semantic Segmentation
本稿では、アーキテクチャを変更せずにCLIPを知識蒸留の教師として活用する、インダクティブなゼロショットセマンティックセグメンテーションのための新規フレームワークCLIPTeacherを提案する。グローバル学習モジュール(GLM)を導入してCLIPのCLSトークンと密度特徴を一致させるとともに、未注釈(無視)領域のための擬似アノテーションを生成するため、CLIPの密度トークンに対してマルチスケールK-meansを適用するピクセル学習モジュール(PLM)を提案し、画像コンテンツの完全な活用を可能にする。本手法は最先端の性能を達成し、PASCAL ContextでmIoUが8.8%向上、VOC 2012で2.2%向上、COCO-Stuff 164kで1.3%向上を達成した。
Generalized Zero-shot Semantic Segmentation aims to segment both seen and unseen categories only under the supervision of the seen ones. To tackle this, existing methods adopt the large-scale Vision Language Models (VLMs) which obtain outstanding zero-shot performance. However, as the VLMs are designed for classification tasks, directly adapting the VLMs may lead to sub-optimal performance. Consequently, we propose CLIP-ZSS (Zero-shot Semantic Segmentation), a simple but effective training framework that enables any image encoder designed for closed-set segmentation applied in zero-shot and open-vocabulary tasks in testing without combining with VLMs or inserting new modules. CLIP-ZSS consists of two key modules: Global Learning Module (GLM) and Pixel Learning Module (PLM). GLM is proposed to probe the knowledge from the CLIP visual encoder by pulling the CLS token and the dense features from the image encoder of the same image and pushing others apart. Moreover, to enhance the ability to discriminate unseen categories, PLM consisting of pseudo labels and weight generation is designed. To generate semantically discriminated pseudo labels, a multi-scale K-Means with mask fusion working on the dense tokens is proposed. In pseudo weight generation, a synthesizer generating pseudo semantic features for the unannotated area is introduced. Experiments on three benchmarks show large performance gains compared with SOTA methods.
研究の動機と目的
- 固定されたバックボーンに制限される既存のCLIPベースのゼロショットセマンティックセグメンテーション手法の限界を解消すること。
- 通常は破棄される注釈あり(見られた)および未注釈(無視された)領域を完全に活用し、性能を向上させること。
- CLIPのアーキテクチャを変更せず、マスクヘッドなどの追加コンponentを追加せず、任意のセグメンテーションモデルがゼロショットセグメンテーションを実行できるようにすること。
- CLIPのビジョン・ランゲージ整合性を活用してゼロショット一般化を向上させる、柔軟でプラグアンドプレイなフレームワークを開発すること。
提案手法
- セグメンテーションモデルの密度特徴とCLIPのCLSトークンを自己注意機構を用いて一致させるグローバル学習モジュール(GLM)を導入し、グローバルな知識蒸留を可能にする。
- CLIPの密度ビジョントークンに対してマルチスケールK-meansクラスタリングを適用し、未注釈領域における意味的に整合性のある領域を発見するピクセル学習モジュール(PLM)を提案する。
- 無視された領域から検出された潜在的オブジェクトと、正解の見られたカテゴリをマスク融合アルゴリズムで統合し、擬似ラベルを生成する。
- 変換器デコーダーを備えたビジョン・ランゲージアダプタ(VLA)を用いて、無視された領域で発見された擬似オブジェクトの分類器重みを生成する。
- 元のCLIPモデルをそのままであり、軽量なモジュールを2つだけ統合することで、任意のピクセル単位のセグメンテーションバックボーンと互換性を持つ。
- 明示的なマスクプロポーザーを回避し、CLIPのビジョンエンコーダーの微調整も不要である。
実験結果
リサーチクエスチョン
- RQ1アーキテクチャを変更せずに、CLIPを知識蒸留の教師として効果的に活用できるか?
- RQ2画像内の未注釈(無視)領域をどのように活用すれば、セマンティックセグメンテーションにおけるゼロショット一般化を向上させられるか?
- RQ3密度特徴を持つCLIPトークンを用いて、未注釈領域における未見のカテゴリの擬似アノテーションを発見・生成できるか?
- RQ4CLSトークンと密度特徴の間で自己注意ベースの一致が、未見カテゴリのゼロショット認識を向上させるか?
- RQ5変換器ベースのビジョン・ランゲージアダプタは、無視された領域で発見された擬似オブジェクトに対して信頼性の高い分類器重みを生成できるか?
主な発見
- CLIPTeacherは、最先端の手法と比較してPASCAL VOC 2012で2.2%のmIoU向上を達成した。
- COCO-Stuff 164kでは1.3%のmIoU向上を示し、大規模データセットにおける強力な一般化性能を実証した。
- PASCAL Contextでは顕著な8.8%のmIoU向上を達成し、多数のカテゴリを含む複雑なシーンにおける有効性を示した。
- アブレーションスタディでは、GLMを削除するとmIoUが32.2%低下(45.4%から13.2%に)し、未見カテゴリの認識におけるその重要性を裏付けた。
- 自己注意ベースのGLMは、最大プーリングと平均プーリングをそれぞれ9.9%および3.4%上回り、特徴の完全活用の重要性を確認した。
- マルチスケールK-meansとマスク統合を組み合わせたPLMは、MLPおよび原始的特徴ベースラインをそれぞれ0.2%および0.3%上回り、設計選択の妥当性を検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。