[論文レビュー] Open-Vocabulary Semantic Segmentation with Mask-adapted CLIP
本稿では、画像・キャプションデータセットから弱教師ありで多様なマスク・カテゴリペアを抽出し、CLIPのファインチューニングに用いることで、オープンボリュームセマンティックセグメンテーションのためのMask-adapted CLIPを提案する。同時に、CLIPの重みを更新せずにマスクされた画像入力を処理できるマスクプロンプトチューニングを導入している。このアプローチにより、ADE20K-150で29.6%のmIoUを達成し、先行SOTAを+8.5%上回り、データセット固有の適応なしに専門家モデルと同等の性能を発揮する。
Open-vocabulary semantic segmentation aims to segment an image into semantic regions according to text descriptions, which may not have been seen during training. Recent two-stage methods first generate class-agnostic mask proposals and then leverage pre-trained vision-language models, e.g., CLIP, to classify masked regions. We identify the performance bottleneck of this paradigm to be the pre-trained CLIP model, since it does not perform well on masked images. To address this, we propose to finetune CLIP on a collection of masked image regions and their corresponding text descriptions. We collect training data by mining an existing image-caption dataset (e.g., COCO Captions), using CLIP to match masked image regions to nouns in the image captions. Compared with the more precise and manually annotated segmentation labels with fixed classes (e.g., COCO-Stuff), we find our noisy but diverse dataset can better retain CLIP's generalization ability. Along with finetuning the entire model, we utilize the "blank" areas in masked images using a method we dub mask prompt tuning. Experiments demonstrate mask prompt tuning brings significant improvement without modifying any weights of CLIP, and it can further improve a fully finetuned model. In particular, when trained on COCO and evaluated on ADE20K-150, our best model achieves 29.6% mIoU, which is +8.5% higher than the previous state-of-the-art. For the first time, open-vocabulary generalist models match the performance of supervised specialist models in 2017 without dataset-specific adaptations.
研究の動機と目的
- 事前学習済みCLIPがマスクされた画像領域においてドメインシフトの影響を受けて性能が低下するという性能ボトルネックを解消すること。
- 閉じたセットのアノテーションに過剰適合することを避ける一方で、CLIPのオープンボリューム一般化能力を維持しつつ、マスク入力に適応すること。
- CLIPの重みをファインチューニングせずに、パラメータ効率の高い軽量な適応手法を開発し、マスク画像におけるCLIPの性能を向上させること。
- 再トレーニングやデータセット固有の適応なしに、任意のユーザー定義テキストクエリに対してゼロショットセグメンテーションを可能にすること。
- 一般化モデルがデータセット固有の適応なしに、教師あり専門家モデルと同等の性能を達成できることを示すこと。
提案手法
- 画像・キャプションデータセット(例:COCO Captions)から、キャプションに含まれる名詞を抽出し、セグメンテーションモデルが生成するカテゴリに依存しないマスク候補と照合することで、学習データを抽出する。
- CLIPを用いて各名詞と最も類似したマスク領域候補をマッチングさせることで、弱教師ありのマスク・カテゴリペアを構築し、多様でオープンボリュームに整合した学習信号を生成する。
- 推論時にマスク(ゼロ)トークンを学習可能なプロンプトトークンに置き換えるマスクプロンプトチューニングを導入し、ドメインシフトの影響を軽減しながらCLIPのパラメータを更新しない。
- CLIPの重みを凍結したプロンプトのみのチューニングと、プロンプトとCLIPの両方を同時にファインチューニングする方法を可能とし、前者が顕著な性能向上を示す。
- 最終的なモデルは弱教師ありデータ上でエンドツーエンドに訓練され、未学習のテキストクエリに対するゼロショット推論によって評価される。
- 本手法はADE20K-150およびPascal-Contextで評価され、多様でオープンエンドのクエリに対し顕著なゼロショット一般化性能を示している。

実験結果
リサーチクエスチョン
- RQ1事前学習済みCLIPモデルは、重みをファインチューニングせずに、マスクされた画像領域をオープンボリュームセマンティックセグメンテーションで効果的に分類できるか?
- RQ2画像キャプションから得た弱教師ありで多様なマスク・カテゴリペアを用いることで、手動アノテーションによる閉じたセットのセグメンテーションラベルに比べ、CLIPのオープンボリューム一般化能力がよりよく保たれるか?
- RQ3マスクされた(ゼロ)トークンを学習可能なプロンプトに置き換えるマスクプロンプトチューニングは、CLIPのパラメータを変更せずに、マスク画像におけるCLIPの性能を顕著に向上させられるか?
- RQ4弱教師ありデータとマスクプロンプトチューニングの組み合わせにより、一般化モデルが教師あり専門家モデルと同等の性能を達成できるか?
- RQ5トレーニング中に見られなかったユーザー定義のオープンエンドのテキストクエリに対して、モデルはどのように一般化するか?
主な発見
- 提案手法はADE20K-150で29.6%のmIoUを達成し、先行SOTAを+8.5%上回った。
- マスクプロンプトチューニング単体でも、ベースラインからADE20K-150で4.7%、Pascal-Contextで4.0%のmIoU向上を達成し、CLIPの重みを一切更新していない。
- マスクプロンプトチューニングと完全なファインチューニングを組み合わせた場合、完全にファインチューニングされたCLIPよりも0.8%のmIoU向上を示し、本手法が補完的効果を発揮していることを示している。
- 1枚の画像に対して1つのキャプションのみを用いてデータマイニングを行うと最適な性能(ADE20K-150で28.8% mIoU)が得られ、5つのキャプションを用いる場合と比べ5倍速く、冗長性が最小限に抑えられている。
- 「Saturn V」や「Oculus」、「golden gate」のようなユーザー定義のクエリに対しても、これらの概念についてのトレーニングなしに正しくセグメンテーションを実行でき、顕著なゼロショット一般化性能を示している。
- 本手法はADE20K-150において、教師あり専門家モデルと同等の性能を達成し、データセット固有の適応なしに一般化モデルが専門家レベルの精度に到達した最初の事例である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。