[論文レビュー] ZegOT: Zero-shot Segmentation Through Optimal Transport of Text Prompts
ZegOTは、固定されたCLIP画像埋め込みと複数の学習可能なテキストプロンプトを最適輸送を用いてアライメントさせる、ゼロショットセマンティックセグメンテーションの新規フレームワークを提案する。これにより、各プロンプトが画像の異なる視覚的属性に焦点を当てる。複数プロンプト最適輸送(MPOT)ソルバを導入することで、視覚言語モデルを微調整せずにPASCAL VOC 2012およびPASCAL Contextで最先端の性能を達成した。
Recent success of large-scale Contrastive Language-Image Pre-training (CLIP) has led to great promise in zero-shot semantic segmentation by transferring image-text aligned knowledge to pixel-level classification. However, existing methods usually require an additional image encoder or retraining/tuning the CLIP module. Here, we propose a novel Zero-shot segmentation with Optimal Transport (ZegOT) method that matches multiple text prompts with frozen image embeddings through optimal transport. In particular, we introduce a novel Multiple Prompt Optimal Transport Solver (MPOT), which is designed to learn an optimal mapping between multiple text prompts and visual feature maps of the frozen image encoder hidden layers. This unique mapping method facilitates each of the multiple text prompts to effectively focus on distinct visual semantic attributes. Through extensive experiments on benchmark datasets, we show that our method achieves the state-of-the-art (SOTA) performance over existing Zero-shot Semantic Segmentation (ZS3) approaches.
研究の動機と目的
- 視覚言語モデルを微調整せずにゼロショットセマンティックセグメンテーションの課題に対処すること。
- ピクセル単位の予測において、複数のテキストプロンプトと視覚的特徴の間のアライメントを向上させること。
- 各テキストプロンプトが画像の異なる意味的属性に焦点を当てるようにすること。これによりプロンプトの崩壊を回避する。
- CLIPを固定したまま、学習可能なテキストプロンプトとデコーダーのみを用いて最先端の性能を達成すること。
提案手法
- 複数のテキストプロンプトと固定された画像エンコーダー特徴との間で最適なマッピングを学習するための複数プロンプト最適輸送(MPOT)ソルバを導入する。
- 微分可能な1対多の割り当てを可能にするSinkhornアルゴリズムを用いる。これにより、各ピクセルがすべてのプロンプトと部分的に関連付けられる。
- 学習済みクラスの輸送計画を最適化し、その計画を学習済みおよび未学習クラスのスコアマップ予測に転送する。
- グローバルなテキスト埋め込みアライメントに線形層を、ピクセル単位のセグメンテーションに学習可能な画像デコーダーを用いる。
- CLIPの視覚言語アライメントを再訓練や微調整なしに活用する。
- 最適輸送を用いてプロンプト間の意味的焦点を分離し、類似した特徴への収束を防ぐ。

実験結果
リサーチクエスチョン
- RQ1最適輸送は、ゼロショットセマンティックセグメンテーションにおいて、複数のテキストプロンプトと視覚的特徴を効果的にアライメントできるか?
- RQ2最適輸送による1対多の割り当ては、1対1またはアテンションベースのマッチングに比べ、プロンプト分布とセグメンテーション精度で優れているか?
- RQ3完全に固定されたCLIPモデルを、学習可能なテキストプロンプトとデコーダーのみで、密度予測に効果的に活用できるか?
- RQ4MPOTは、ベースラインのプロンプトアライメントと比較して、学習済みおよび未学習クラスの両方で性能をどのように向上させるか?
主な発見
- PASCAL VOC 2012では90.9 mIoU (U) および 91.4 hIoUを達成し、先行手法を上回る最先端の性能を示した。
- PASCAL Contextでは72.5 mIoU (U) および 59.5 hIoUを達成し、未学習クラスへの一般化性能が優れていた。
- MPOTを除いたアブレーション実験では、PASCAL VOC 2012でmIoU (U) が5.5%低下し、PASCAL Contextでは7.5%低下した。これによりMPOTの重要性が確認された。
- Sinkhornベースの最適輸送は、PASCAL VOC 2012で5.7 hIoU、PASCAL Contextで7.9 hIoUの優位性を示し、二部マッチングを上回った。
- 自己アテンションベースのマッチングは、PASCAL VOC 2012で6.5% mIoU (U)、PASCAL Contextで13.2% mIoU (U) 低下し、OTが固定モデルの知識を効果的に保持できることを示した。
- t-SNE可視化により、MPOTは分散し、クラスに特化したプロンプト分布を実現している一方、ベースラインは密に凝集し、判別性に欠けるプロンプト分布を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。