Skip to main content
QUICK REVIEW

[論文レビュー] Cost Aggregation Is All You Need for Few-Shot Segmentation

Sunghwan Hong, Seokju Cho|arXiv (Cornell University)|Dec 22, 2021
Advanced Neural Network Applications被引用数 9
ひとこと要約

本稿では、少数のサポート画像と照合する際の高次元相関マップを効率的に処理するため、4次元畳み込みと4次元スウィン変換器を組み合わせた新規なコスト集約ネットワークであるボリュメトリックアグリゲーション・トランスフォーマー(VAT)を提案する。ピラミッド型エンコーダーとボリューム埋め込み、ボリュームトランスフォーマーモジュールを用いることで、すべての標準的少数ショットセグメンテーションベンチマークで最先端性能を達成するとともに、アーキテクチャの変更なしに、意外にもセマンティックコアポンダエンスのタスクでも最先端結果を達成した。

ABSTRACT

We introduce a novel cost aggregation network, dubbed Volumetric Aggregation with Transformers (VAT), to tackle the few-shot segmentation task by using both convolutions and transformers to efficiently handle high dimensional correlation maps between query and support. In specific, we propose our encoder consisting of volume embedding module to not only transform the correlation maps into more tractable size but also inject some convolutional inductive bias and volumetric transformer module for the cost aggregation. Our encoder has a pyramidal structure to let the coarser level aggregation to guide the finer level and enforce to learn complementary matching scores. We then feed the output into our affinity-aware decoder along with the projected feature maps for guiding the segmentation process. Combining these components, we conduct experiments to demonstrate the effectiveness of the proposed method, and our method sets a new state-of-the-art for all the standard benchmarks in few-shot segmentation task. Furthermore, we find that the proposed method attains state-of-the-art performance even for the standard benchmarks in semantic correspondence task although not specifically designed for this task. We also provide an extensive ablation study to validate our architectural choices. The trained weights and codes are available at: https://seokju-cho.github.io/VAT/.

研究の動機と目的

  • ラベル付きデータが限られるセマンティックセグメンテーションの課題に対処し、わずか数個のサポートサンプルでの少数ショットセグメンテーションを可能にすること。
  • 外観および幾何的変化に耐性を持つピクセル単位の対応関係を重視することで、少数ショットセグメンテーションをセマンティックコアポンダエンスタスクに再定式化し、マッチング精度を向上させること。
  • 従来の手法が生の相関マップや局所的畳み込みに依存するのを克服し、グローバルで注意に基づくコスト集約メカニズムを導入すること。
  • 少数ショット学習における高次元相関マップに対して、畳み込みのインダクティブバイアスと自己注意メカニズムを統合する有効性を検証すること。
  • 少数ショットセグメンテーションモデルが、それ自体がそれらのタスクに特化して設計されていなくても、セマンティックコアポンダエンスタスクに一般化できるかどうかを検討すること。

提案手法

  • 本手法は、相関マップの次元を削減するとともに畳み込みのインダクティブバイアスを注入するために、4次元畳み込みを用いたボリューム埋め込みモジュールを備えたピラミッド型エンコーダーを導入する。
  • ボリュームトランスフォーマーモジュールは、変換された相関マップ上で4次元スウィン変換器を適用し、空間的およびチャネル次元にわたり長距離相互作用を実現するグローバルコスト集約を実行する。
  • エンコーダーは複数スケールの特徴を処理し、粗いスケールでの集約スコアが細かいスケールでの学習をガイドすることで、補完的なマッチングスコア学習を促進する。
  • アフィニティに配慮したデコーダーは、投影された外観特徴とアフィニティマップを用いて、集約されたコスト特徴を精緻化し、セグメンテーションマスク予測を向上させる。
  • 標準的な少数ショットセグメンテーションベンチマーク上で、サポート-クエリ監視に基づく標準的な学習-学習パラダイムを用いて、モデルはエンドツーエンドで訓練される。
  • わずかなアーキテクチャの変更により、出力解像度の調整と特徴投影の再定義により、同じモデルをセマンティックコアポンダエンスベンチマークでも評価可能となる。

実験結果

リサーチクエスチョン

  • RQ1生の相関マップや4次元畳み込みに依存する従来手法と比較して、ハイブリッド畳み込み-変換器アーキテクチャによるコスト集約が、少数ショットセグメンテーション性能を顕著に向上させられるか。
  • RQ2ピクセル単位の対応関係を求めるという共通の課題を有するにもかかわらず、少数ショットセグメンテーションモデルがセマンティックコアポンダエンスタスクにどの程度一般化できるか。
  • RQ34次元特徴空間において畳み込みのインダクティブバイアスと自己注意メカニズムを統合することで、クラス内変動に対してより良い一般化と耐性が得られるか。
  • RQ4異なるバックボーンアーキテクチャ(CNN対ビジョン変換器)が少数ショットセグメンテーションの性能に与える影響は何か。また、それらの間には性能ギャップが存在するか。
  • RQ5HSNet や CATs などの既存手法と比較して、提案手法のコスト集約メカニズムは、曖昧なパターンや背景の雑音に対してより効果的か。

主な発見

  • VATは、PASCAL-Part、COCO-Part、LVIS を含むすべての標準的少数ショットセグメンテーションベンチマークで最先端性能を達成し、従来手法を上回った。
  • SPair-71k ベンチマークでは54.2 PCKを達成し、新記録を樹立。これには CATs(49.9) や PMNC(50.4) が含まれ、それらを上回った。
  • PF-PASCAL では92.3 PCKを達成し、CHM(91.6)に次ぐ2位であったが、他の手法と顕著な差を示し、優れた一般化性能を示した。
  • PF-WILLOW では81.0 PCK を達成し、CATs(79.2) や PMNC(79.4) を上回り、幾何的変化に対して高い耐性を示した。
  • アーキテクチャの変更なしに、セマンティックコアポンダエンスタスクでも最先端性能を達成した。これは、コスト集約が視覚タスク間で転送可能な主要な要因であることを示唆している。
  • アブレーションスタディの結果、ボリューム埋め込みとボリュームトランスフォーマーの組み合わせが不可欠であることが確認された。線形およびファストフォーマーの変種でも同程度の性能を示し、アーキテクチャタイプよりもグローバル注意がより重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。