Skip to main content
QUICK REVIEW

[論文レビュー] CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation

Seokju Cho, Heeseong Shin|arXiv (Cornell University)|Mar 21, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

CAT-Segは、オープンボリューム分類の能力を維持するため、CLIPの画像・テキスト類似度マップ(コストボリューム)を最適化することで、直接CLIP埋め込みを微調整するのではなく、新しいコスト集約フレームワークを提案する。埋め込みのガイドランスを用いて、空間的およびクラス別関係を統合するTransformerベースのモジュールにより、コストボリューム内で同時に集約することで、ADE20K、PASCAL VOC、PASCAL-Contextのすべてのベンチマークで最先端の性能を達成し、ADE20K-847では先行手法比で22%のmIoU向上を達成した。

ABSTRACT

Open-vocabulary semantic segmentation presents the challenge of labeling each pixel within an image based on a wide range of text descriptions. In this work, we introduce a novel cost-based approach to adapt vision-language foundation models, notably CLIP, for the intricate task of semantic segmentation. Through aggregating the cosine similarity score, i.e., the cost volume between image and text embeddings, our method potently adapts CLIP for segmenting seen and unseen classes by fine-tuning its encoders, addressing the challenges faced by existing methods in handling unseen classes. Building upon this, we explore methods to effectively aggregate the cost volume considering its multi-modal nature of being established between image and text embeddings. Furthermore, we examine various methods for efficiently fine-tuning CLIP.

研究の動機と目的

  • CLIPの画像レベルのビジョン・ランゲージ知識をピクセルレベルのセグメンテーションに転送する課題に取り組み、オープンボリューム能力を損なわずに実現すること。
  • 領域提案に依存する二段階手法の限界を克服し、グローバルな文脈理解を欠いていること。
  • 推論時に未学習の任意のカテゴリに対しても効果的かつ汎用的なセグメンテーションを可能にする手法を開発すること。
  • CLIPの事前学習済みオープンボリューム一般化能力を維持するため、画像埋め込みを直接微調整する代わりに、コストボリュームを最適化すること。
  • 既存の二段階手法に見られるバイアスを克服し、細分化された未学習カテゴリの部分レベルセグメンテーションを強化すること。

提案手法

  • CLIPの画像およびテキスト埋め込み間のコサイン類似度マップとして、密なコストボリュームを構築する。
  • 空間的およびクラス別成分に分解する、Transformerベースのコスト集約モジュールを設計する。
  • コスト集約中に視覚的およびテキスト的特徴の整合性を向上させるために、埋め込みガイドランスを導入する。
  • 集約されたコストボリュームからセグメンテーションマスクを再構築するための軽量なデコーダーを使用し、細部を保持する。
  • Transformer内のアテンション層のみを微調整することで、CLIP全体の微調整を回避し、事前学習済み知識を維持する。
  • コストボリュームを主な最適化ターゲットとして、エンドツーエンドで学習し、CLIPのオープンボリューム性能の劣化を最小限に抑える。
Figure 1: Teaser. For open-vocabulary semantic segmentation, we propose to aggregate a matching cost derived from dense image and text embeddings of CLIP [ 44 ] , resulting in state-of-the-art performance across all benchmarks.
Figure 1: Teaser. For open-vocabulary semantic segmentation, we propose to aggregate a matching cost derived from dense image and text embeddings of CLIP [ 44 ] , resulting in state-of-the-art performance across all benchmarks.

実験結果

リサーチクエスチョン

  • RQ1画像埋め込みを直接微調整する代わりに、CLIPの画像・テキスト類似度マップ(コストボリューム)を最適化することで、ピクセルレベルのセグメンテーションにおけるCLIPのオープンボリューム一般化能力を維持できるか?
  • RQ2空間的およびクラス別アテンションを用いたコスト集約は、既知および未知のカテゴリの両方のセグメンテーション性能をどのように向上させるか?
  • RQ3領域提案を用い、各領域を別々に分類する二段階手法と比較して、本手法はより優れた一般化性能を示すか?
  • RQ4本フレームワークは、『腕』や『鳥かご』のような細分化された未学習カテゴリを、トレーニング時に露出していない状態でも処理できるか?
  • RQ5バックボーンの能力が向上するに従って、モデルはどのようにスケーリングするか?また、効率性と性能向上を維持するか?

主な発見

  • CAT-Segは、ADE20K、PASCAL VOC、PASCAL-Contextのすべてのベンチマークで最先端の性能を達成し、ADE20K-847では先行手法比で22%のmIoU向上を達成した。
  • ADE20K-847では、ViT-Gバックボーンを用いてmIoUが44.9に達し、大規模なオープンボリュームセグメンテーションにおいて強力な性能を示した。
  • ADE20K-150において、ViT-BからViT-Gにスケーリングした際、mIoUが9.0%向上した。これは、良好なスケーリング特性を示している。
  • 推論速度は二段階ベースラインを上回っており、モデルサイズが大きくなるほど顕著に向上した。これは、クラス数に比例してスケーリングするコストボリュームベースの計算のおかげである。
  • モデルは部分セグメンテーションにおいても良好に一般化した:『腕』や『脚』のような未学習の細分化カテゴリを効果的にセグメンテーションしたが、二段階手法は提案バイアスのため失敗した。
  • アブレーションスタディにより、コストボリュームの最適化が、CLIP埋め込みの直接微調整とは異なり、オープンボリューム能力の劣化を防ぐことが確認された。
(c) Qualitative comparisons
(c) Qualitative comparisons

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。