[論文レビュー] Boosting Few-shot Semantic Segmentation with Transformers
本論文は、トランスフォーマーを用いたグローバルコンテキストモデリングと畳み込みを用いたローカル特徴の最適化を統合する、新しい少数ショットセマンティックセグメンテーションフレームワークであるTRFSを提案する。トランスフォーマー・ブロックに基づくグローバルエナーブルメントモジュール(GEM)と畳み込みを用いたローカルエナーブルメントモジュール(LEM)を組み合わせることで、PASCAL-5iおよびCOCOベンチマークで最先端の性能を達成し、少数ショットセグメンテーションにおいてグローバル情報とローカル情報が補完的であることを示した。
Due to the fact that fully supervised semantic segmentation methods require sufficient fully-labeled data to work well and can not generalize to unseen classes, few-shot segmentation has attracted lots of research attention. Previous arts extract features from support and query images, which are processed jointly before making predictions on query images. The whole process is based on convolutional neural networks (CNN), leading to the problem that only local information is used. In this paper, we propose a TRansformer-based Few-shot Semantic segmentation method (TRFS). Specifically, our model consists of two modules: Global Enhancement Module (GEM) and Local Enhancement Module (LEM). GEM adopts transformer blocks to exploit global information, while LEM utilizes conventional convolutions to exploit local information, across query and support features. Both GEM and LEM are complementary, helping to learn better feature representations for segmenting query images. Extensive experiments on PASCAL-5i and COCO datasets show that our approach achieves new state-of-the-art performance, demonstrating its effectiveness.
研究の動機と目的
- 既存の少数ショットセマンティックセグメンテーション手法が単一のローカル受容野に依存するという制限を解消する。これにより、長距離のコンテキスト的関係が欠落する。
- 少数のアノテート済みサポート画像しか利用できない少数ショットセグメンテーションにおいて、トランスフォーマーによるグローバルコンテキストモデリングの有効性を調査する。
- グローバル(トランスフォーマーに基づく)とローカル(畳み込みベース)の特徴最適化を組み合わせることで、単独で使用する場合よりも優れた性能が得られることを実証する。
- PASCAL-5iおよびCOCOを含む標準的な少数ショットセグメンテーションベンチマークで最先端の性能を達成する。
提案手法
- 2本のブランチアーキテクチャを提案:トランスフォーマー・ブロックにおけるマルチヘッド自己注意を用いて、クエリ特徴とサポート特徴の間で長距離依存関係をモデリングするグローバルエナーブルメントモジュール(GEM)。
- 標準的な畳み込み層を適用してピクセル単位の特徴を最適化するローカルエナーブルメントモジュール(LEM)を導入。これにより、局所的な空間的詳細が保持される。
- クエリ特徴、サポートプロトタイプ特徴、および事前マスクを組み合わせ、$ H \times W \times (2C+1) $ の形状を持つ1つの特徴マップを作成。このマップをGEMとLEMが並列で処理する。
- スケール {60, 30, 15, 8} でのアダプティブ平均プーリングを用いてマルチスケール特徴処理を実施し、異なる解像度における特徴表現のロバスト性を向上させる。
- クエリセグメンテーション予測に対して交差エントロピー損失を用いて、正解マスクからの監視のもとでモデルをエンドツーエンドで訓練する。
- 特徴抽出のためのバックボーンネットワークとしてResNet-50を用い、その後に特徴の連結とGEMおよびLEMによる最適化を実施する。
実験結果
リサーチクエスチョン
- RQ1少数のサポート画像しか利用できない状況下で、トランスフォーマーによるグローバルコンテキストモデリングが少数ショットセグメンテーションの性能を向上させることができるか?
- RQ2少数ショットセグメンテーションにおいて、トランスフォーマーが捉えるグローバル情報と畳み込みで抽出されるローカル特徴は、補完的であるか?
- RQ3トランスフォーマー層の数とマルチスケール処理の有無が、新規クラスにおけるモデルの性能と一般化能力に与える影響は何か?
- RQ4グローバルおよびローカル特徴最適化を組み合わせることで、単独で使用する場合よりも高いセグメンテーション精度が得られるか?
主な発見
- 提案されたTRFSモデルは、PASCAL-5iデータセットの1ショット設定で平均mIoUが61.9を達成し、以前の最先端手法を上回った。
- アブレーションスタディの結果、GEMのみまたはLEMのみを用いた場合の平均mIoUはそれぞれ60.6および60.8であったが、両者の組み合わせでは61.9に上昇し、それらが補完的であることを証明した。
- 3つのトランスフォーマーブロック(L=3)を用いたモデルが最良の性能を示し、深層ネットワークがベースクラスに過学習を起こし、新規クラスでの性能を低下させる可能性があることを示唆した。
- マルチスケール処理は性能を段階的に向上させる:単一スケール(58.6)から4スケール(61.9)にまで向上し、報告されたすべての結果で全スケール集合{60, 30, 15, 8}が使用された。
- 定性的な結果から、TRFSは1枚のサポート画像とそのマスクしか与えられていない状況でも、未学習の新規クラスに対して正確なセグメンテーションマスクを生成できることを示した。
- COCOデータセットでもTRFSは最先端の性能を達成し、PASCAL-5iベンチマークを越えた一般化能力を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。