Skip to main content
QUICK REVIEW

[論文レビュー] CLIP is Also an Efficient Segmenter: A Text-Driven Approach for Weakly Supervised Semantic Segmentation

Yuqi Lin, Minghao Chen|arXiv (Cornell University)|Dec 16, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、微調整や追加の訓練を必要とせず、画像ラベルからの高品質な疑似マスクを生成するために凍結されたCLIPモデルを活用する、テキスト駆動型で弱教師ありセマンティックセグメンテーションフレームワークであるCLIP-ESを提案する。ソフトマックス正則化付きGradCAM、テキスト駆動型プロンプト戦略、クラスに依存するアテンションベースの類似度モジュール、および信頼度誘導損失を統合することで、CLIP-ESはPASCAL VOC 2012(73.9% mIoU)およびMS COCO 2014(45.4% mIoU)で最先端の性能を達成し、従来手法に比べて90%の時間短縮を実現した。

ABSTRACT

Weakly supervised semantic segmentation (WSSS) with image-level labels is a challenging task. Mainstream approaches follow a multi-stage framework and suffer from high training costs. In this paper, we explore the potential of Contrastive Language-Image Pre-training models (CLIP) to localize different categories with only image-level labels and without further training. To efficiently generate high-quality segmentation masks from CLIP, we propose a novel WSSS framework called CLIP-ES. Our framework improves all three stages of WSSS with special designs for CLIP: 1) We introduce the softmax function into GradCAM and exploit the zero-shot ability of CLIP to suppress the confusion caused by non-target classes and backgrounds. Meanwhile, to take full advantage of CLIP, we re-explore text inputs under the WSSS setting and customize two text-driven strategies: sharpness-based prompt selection and synonym fusion. 2) To simplify the stage of CAM refinement, we propose a real-time class-aware attention-based affinity (CAA) module based on the inherent multi-head self-attention (MHSA) in CLIP-ViTs. 3) When training the final segmentation model with the masks generated by CLIP, we introduced a confidence-guided loss (CGL) focus on confident regions. Our CLIP-ES achieves SOTA performance on Pascal VOC 2012 and MS COCO 2014 while only taking 10% time of previous methods for the pseudo mask generation. Code is available at https://github.com/linyq2117/CLIP-ES.

研究の動機と目的

  • 微調整や補助モデルの訓練を必要としない、弱教師ありセマンティックセグメンテーション(WSSS)の簡素化。
  • 画像ラベルのみを用いて、CLIPのゼロショット能力を活用してオブジェクトの局所化を実現すること。
  • テキスト駆動型およびアテンションベースの新規モジュールを導入することで、訓練コストを削減しながら、セグメンテーション精度を維持または向上させること。
  • 追加の監視信号やモデルの適応なしに、下流のセグメンテーションのための信頼性の高い疑似マスクを生成すること。

提案手法

  • クラス間の相互排他的な性質を強制し、背景や非ターゲットクラスの混同を抑えるために、GradCAMにソフトマックス正則化を導入する。
  • シャープネスに基づくプロンプト選択と同義語統合を提案し、クラス固有の活性化マップの向上を図る。
  • CLIP-ViTのマルチヘッド自己アテンションを活用して、リアルタイムかつクラスに依存するCAMの最適化を実現するクラスに依存するアテンションベースの類似度(CAA)モジュールを設計する。
  • 最終的なセグメンテーション訓練中に、疑似マスクの不確実な領域を軽減する信頼度誘導損失(CGL)を採用する。
  • バックボーンとして凍結されたCLIPを使用することで、微調整なしに新しいクラスやデータセットへのゼロショット転送を可能にする。
  • 分類モデルや類似度モデルを別々に訓練するのを避けるために、すべてのモジュールをエンドツーエンドのテキスト駆動型WSSSパイプラインに統合する。

実験結果

リサーチクエスチョン

  • RQ1微調整なしに、CLIPは画像ラベルのみを用いて高品質なセグメンテーションマスクを生成できるか?
  • RQ2CLIPベースのWSSSにおけるクラス固有の活性化マップを向上させるために、テキスト入力をどのように最適化できるか?
  • RQ3CLIPの内在的なアテンションメカニズムは、外部の類似度ネットワークに代わってCAMの最適化に利用できるか?
  • RQ4不確実な疑似マスクを用いた訓練において、信頼度誘導損失はセグメンテーション性能を向上させるか?
  • RQ5再訓練なしに、本フレームワークは新しいクラスやデータセットに一般化可能か?

主な発見

  • CLIP-ESはPASCAL VOC 2012のテストセットで73.9% mIoUを達成し、新たな最先端性能を樹立した。
  • MS COCO 2014では、バリデーションセットで45.4% mIoUを達成し、すべての先行手法を上回った。
  • GradCAMにソフトマックスを導入することで、全クラスでmIoUが9.2%向上し、「boat」と「water」のような類似カテゴリ間の混同も減少した。
  • 同義語統合により、「person」のmIoUが43.6%から51.6%に向上し、テキスト拡張の有効性が示された。
  • 視覚化結果から、CAAモジュールは単純なMHSAを上回るCAMの最適化を実現しており、より完全で正確なオブジェクト活性化が得られた。
  • CLIP-ESによる疑似マスク生成には、従来手法に比べて10%の時間しかかからず、大幅な訓練効率の向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。