[論文レビュー] Simpler is Better: Few-shot Semantic Segmentation with Classifier Weight Transformer
本論文は、事前学習されたエンコーダデコーダバックボーンを凍結したまま、メタラーニングを分類器ヘッドに限定するより単純な少数ショットセマンティックセグメンテーション手法を提案する。クエリ画像ごとに分類器重みを動的に適応させるための分類器重み変換器(CWT)を導入することで、COCO-20およびPASCAL-20ベンチマークで最先端の性能を達成した。モデルの複雑さが低減されているにもかかわらず、先行手法を大きく上回った。
A few-shot semantic segmentation model is typically composed of a CNN encoder, a CNN decoder and a simple classifier (separating foreground and background pixels). Most existing methods meta-learn all three model components for fast adaptation to a new class. However, given that as few as a single support set image is available, effective model adaption of all three components to the new class is extremely challenging. In this work we propose to simplify the meta-learning task by focusing solely on the simplest component, the classifier, whilst leaving the encoder and decoder to pre-training. We hypothesize that if we pre-train an off-the-shelf segmentation model over a set of diverse training classes with sufficient annotations, the encoder and decoder can capture rich discriminative features applicable for any unseen classes, rendering the subsequent meta-learning stage unnecessary. For the classifier meta-learning, we introduce a Classifier Weight Transformer (CWT) designed to dynamically adapt the supportset trained classifier's weights to each query image in an inductive way. Extensive experiments on two standard benchmarks show that despite its simplicity, our method outperforms the state-of-the-art alternatives, often by a large margin.Code is available on https://github.com/zhiheLu/CWT-for-FSS.
研究の動機と目的
- 新しいクラスに対して1枚または数枚のアノテート済みサポート画像しか入手できないという、最小限の監視のもとでの少数ショットセマンティックセグメンテーションの課題に対処すること。
- 事前学習済みのエンコーダデコーダバックボーンを凍結することで、モデル適応の複雑さを低減し、メタラーニングを分類器に限定すること。
- サポート画像とクエリ画像間のオブジェクト外観のクラス内変動を、動的な分類器重み適応によって克服すること。
- 事前学習された強力でクラスに依存しない特徴抽出器が、バックボーンに対するメタラーニングなしでも優れた少数ショット一般化を可能にすることを示すこと。
提案手法
- 本手法は、多様なトレーニングクラス上でセグメンテーションバックボーン(例:ResNet-50)を事前学習し、クラスに依存しない判別性の高い特徴を学習する。
- 推論時、学習されたプロジェクションヘッドを用いてサポートセット特徴から初期分類器重みを生成する。
- 分類器重み変換器(CWT)は、クエリ特徴に注目することで、各クエリ画像に対して初期重みを動的に適応させ、帰納的に分類器重みを修正する。
- CWTは自己注意メカニズムを用い、クエリ特徴をクエリとして、サポートセット特徴をキーおよびバリューとして用い、クエリ固有の分類器重みを生成する。
- モデル全体はエピソード形式で訓練され、メタラーニングは分類器ヘッドおよびCWTモジュールにのみ適用される。
- エンコーダおよびデコーダはメタトレーニングおよび推論時に凍結され、最適化の複雑さが顕著に低減される。
実験結果
リサーチクエスチョン
- RQ1事前学習済みのエンコーダおよびデコーダを凍結したまま、分類器ヘッドのメタラーニングのみで最先端の少数ショットセマンティックセグメンテーション性能を達成できるか?
- RQ2微調整なしで、事前学習済みのエンコーダデコーダバックボーンが未学習クラスに一般化する効果はどの程度か?
- RQ3クエリに適応する分類器ヘッド(例:CWT)は、少数ショットセグメンテーションにおけるクラス内変動を効果的に緩和できるか?
- RQ4静的分類器適応と比較して、クエリ画像固有の適応を明示的にモデル化することでどの程度の性能向上が得られるか?
主な発見
- 提案手法は、1ショット設定下でCOCO-20データセットで32.9%の平均mIoUを達成し、前回のSOTAを大きく上回った。
- メタラーニングなしでバックボーンを事前学習し、サポートセット上で分類器を学習する単純なベースラインも28.6%のmIoUを達成し、PPNetを2.9%上回った。
- CWTモデル全体はベースライン比で4.3%の性能向上を示し、クエリ固有の分類器適応の有効性を裏付けた。
- CWTにおけるクエリ画像条件付けを削除(すなわち、注意機構にサポート特徴のみを用いる)すると、mIoUが14.0ポイント低下し、クエリに依存する適応の必要性を実証した。
- 失敗事例の主な原因は、極端な外観変化(例:部分的視認、ポーズ変化、隠蔽)であり、空間的および外観的変動のより良いモデリングの必要性を示唆している。
- 本手法はドメイン間少数ショットセグメンテーションにも良好に一般化され、ドメインシフトに対して頑健であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。