[論文レビュー] Open-vocabulary Semantic Segmentation with Frozen Vision-Language Models
本論文では、自己教師付きモデルから得られる固定された視覚的・言語的特徴を整列させることで、ゼロショットオープンボキャラリィセマンティックセグメンテーションを可能にする、軽量でトランスフォーマー基盤の融合モジュール「Fusioner」を提案する。特徴量がすべて固定されているにもかかわらず、PASCAL-5iおよびCOCO-20iベンチマークで最先端の性能を達成し、ゼロショットおよびフェイシュット設定において、先行手法を著しく上回っている。
When trained at a sufficient scale, self-supervised learning has exhibited a notable ability to solve a wide range of visual or language understanding tasks. In this paper, we investigate simple, yet effective approaches for adapting the pre-trained foundation models to the downstream task of interest, namely, open-vocabulary semantic segmentation. To this end, we make the following contributions: (i) we introduce Fusioner, with a lightweight, transformer-based fusion module, that pairs the frozen visual representation with language concept through a handful of image segmentation data. As a consequence, the model gains the capability of zero-shot transfer to segment novel categories; (ii) without loss of generality, we experiment on a broad range of self-supervised models that have been pre-trained with different schemes, e.g. visual-only models (MoCo v3, DINO), language-only models (BERT), visual-language model (CLIP), and show that, the proposed fusion approach is effective to any pair of visual and language models, even those pre-trained on a corpus of uni-modal data; (iii) we conduct thorough ablation studies to analyze the critical components in our proposed Fusioner, while evaluating on standard benchmarks, e.g. PASCAL-5i and COCO-20i , it surpasses existing state-of-the-art models by a large margin, despite only being trained on frozen visual and language features; (iv) to measure the model's robustness on learning visual-language correspondence, we further evaluate on synthetic dataset, named Mosaic-4, where images are constructed by mosaicking the samples from FSS-1000. Fusioner demonstrates superior performance over previous models.
研究の動機と目的
- 事前に学習されたビジョンおよび言語モデルを用いて、未観測の新しいオブジェクトカテゴリに対してゼロショットセマンティックセグメンテーションを可能にすること。
- バックボーンモデルのファインチューニングを伴わずに、視覚的および言語的表現を統合するシンプルで効果的な融合メカニズムを開発すること。
- 単モodal(例:MoCo、DINO、BERT)およびマルチモーダル(例:CLIP)モデルを含む、多様な自己教師付き事前学習スキームに対して、手法の評価を行うこと。
- 新規に作成された合成ベンチマーク「Mosaic-4」を用いて、視覚的・言語的マッチングの耐性を評価すること。
- COCOからPASCAL VOCへのドメインシフトなど、ドメインシフトにわたるモデルの転送性を示すこと。
提案手法
- 視覚エンコーダー(例:MoCo、DINO)および言語エンコーダー(例:BERT、CLIP)を固定して、画像およびテキスト特徴量を抽出する。
- 軽量でトランスフォーマー基盤の融合モジュールが、クロスアテンションを用いて視覚的および言語的特徴量を反復的に更新し、マルチモーダル相互作用を実現する。
- 各カテゴリのセグメンテーションマスクは、L2正規化されたピクセル特徴量とテキスト埋め込みのコサイン類似度を計算することで生成される。
- 視覚デコーダーを用いて、融合特徴量をフル画像解像度にアップサンプリングし、マスク品質を向上させる。
- トレーニング中は、すべての視覚的および言語的モデルを固定し、融合モジュールおよびデコーダーのみを学習可能とする。
- 少数の画像セグメンテーションアノテーションのセットを用いてモデルを学習することで、未観測カテゴリへのゼロショット一般化が可能になる。
実験結果
リサーチクエスチョン
- RQ1シンプルな融合モジュールは、固定された視覚的および言語的表現を効果的に統合し、オープンボキャラリィセマンティックセグメンテーションを実現できるか?
- RQ2提案手法は、単モーダル(視覚のみ、または言語のみ)およびマルチモーダル(ビジョン・ランゲージ)モデルを含む多様な事前学習スキームに一般化可能か?
- RQ3ドメインシフトや複雑なシーン構成の下でも、モデルの視覚的・言語的マッチング能力はどれほど耐性があるか?
- RQ4バックボーンモデルのファインチューニングなしに、ゼロショットおよびフェイシュット設定で最先端の性能を達成できるか?
- RQ5COCOからPASCAL VOCへの一般化は、特に未観測カテゴリにおいてどれほど効果的か?
主な発見
- ViT-Lバックボーンを用いたCOCO-20iでは、Fusionerが56.5%のmIoUを達成し、ゼロショット設定で前回SOTAのLSegを24.8ポイントも上回った。
- PASCAL-5iでは、COCOからのゼロショット転送で44.4%のmIoUを達成し、前回SOTAのLSegを12.7ポイント上回った。
- アブレーションスタディでは、融合モジュールを除去すると性能が21%低下し、クロスモダリティ整列においてそのモジュールが果たす重要な役割が示された。
- 視覚デコーダーは顕著な寄与を示しており、直接アップサンプリングを行うと5%の性能低下が生じた。
- 合成ベンチマークMosaic-4では、Fusionerは視覚的特徴量をテキスト記述にマッチングする能力において優れた耐性を示し、先行モデルを上回った。
- MoCo v3、DINO、BERT、CLIPを含むさまざまな事前学習スキームにおいて、手法が効果的に一般化されることを示し、広範な適用可能性を実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。