Skip to main content
QUICK REVIEW

[論文レビュー] Cost Aggregation with 4D Convolutional Swin Transformer for Few-Shot Segmentation

Sunghwan Hong, Seokju Cho|arXiv (Cornell University)|Jul 22, 2022
Advanced Neural Network Applications被引用数 10
ひとこと要約

本稿では、少数ショットセグメンテーションにおけるコスト集約のための新規な4次元畳み込みSwin Transformer、Volumetric Aggregation with Transformers (VAT) を提案する。局所的コンテキストとインダクティブバイアスを保持するため、Swin Transformerの前段階に小カーネル畳み込みを統合し、階層的ピラミッド構造とアピアランスに配慮したデコーディングを採用することで、VATはすべての主要な少数ショットセグメンテーションベンチマークおよびセマンティック対応タスクで最先端の性能を達成した。

ABSTRACT

This paper presents a novel cost aggregation network, called Volumetric Aggregation with Transformers (VAT), for few-shot segmentation. The use of transformers can benefit correlation map aggregation through self-attention over a global receptive field. However, the tokenization of a correlation map for transformer processing can be detrimental, because the discontinuity at token boundaries reduces the local context available near the token edges and decreases inductive bias. To address this problem, we propose a 4D Convolutional Swin Transformer, where a high-dimensional Swin Transformer is preceded by a series of small-kernel convolutions that impart local context to all pixels and introduce convolutional inductive bias. We additionally boost aggregation performance by applying transformers within a pyramidal structure, where aggregation at a coarser level guides aggregation at a finer level. Noise in the transformer output is then filtered in the subsequent decoder with the help of the query's appearance embedding. With this model, a new state-of-the-art is set for all the standard benchmarks in few-shot segmentation. It is shown that VAT attains state-of-the-art performance for semantic correspondence as well, where cost aggregation also plays a central role.

研究の動機と目的

  • 標準的なビジョントランスフォーマーがパッチベースのトークン化に起因して局所的コンテキストの喪失やインダクティブバイアスの低下を引き起こすという、コスト集約における少数ショットセグメンテーションの限界を是正すること。
  • Swin Transformerの前段階に小カーネル4次元畳み込みを統合することで、空間的構造を保持し、局所的特徴表現を強化し、コスト集約の性能を向上させること。
  • 粗いレベルでの集約が細かいレベルの処理をガイドする階層的ピラミッドアーキテクチャを導入することで、特徴の精練を向上させること。
  • クエリ固有の埋め込みを活用することで、より正確なセグメンテーション予測が得られるように、トランスフォーマー出力のノイズを低減するアピアランスに配慮したデコーダーを導入すること。
  • 少数ショットセグメンテーションにとどまらず、セマンティック対応タスクにおいても優れた一般化性能を示すことで、提案手法のコスト集約法の汎用性を実証すること。

提案手法

  • 4次元相関マップ(バッチ、チャネル、H、W)を処理できるようにSwin Transformerのパッチエンベッディングモジュールを拡張した4次元畳み込みSwinトランスフォーマーを提案し、マッチングコストボリューム全体にわたるグローバル自己自己注意を可能にする。
  • パッチ境界での不連続性問題を緩和するため、トランスフォーマーの前段階に重複する小カーネル4次元畳み込みの系列を導入し、局所的コンテキストとインダクティブバイアスを注入する。
  • 粗い解像度レベルからの集約コストマップを細かい解像度レベルへの追加入力として連結する階層的ピラミッドアーキテクチャを設計し、マルチスケールガイドを実現する。
  • アフィニティに配慮したデコーダーを実装し、クエリのアピアランス埋め込みを用いて最終的な集約コストボリュームを精練することで、空間的詳細を向上させ、ノイズを低減する。
  • バックボーンネットワーク(例:ResNet)を用いて特徴抽出を行い、サポート-クエリペアに対して標準的なセグメンテーション損失(例:交差エントロピー)を用いてエンドツーエンドでモデルを訓練する。
  • 4次元空間的相関マップに適応した学習可能な位置エンコーディングを導入し、自己注意計算中に空間的関係を保持する。

実験結果

リサーチクエスチョン

  • RQ14次元畳み込みSwinトランスフォーマーは、局所的コンテキストとインダクティブバイアスを保持しつつ、少数ショットセグメンテーションにおけるコストボリュームの集約を効果的に行えるか?
  • RQ2複数スケールにわたる階層的集約は、少数ショットセグメンテーションにおけるコストボリューム精錬のロバスト性と正確性を向上させるか?
  • RQ3提案されたコスト集約メカニズムは、少数ショットセグメンテーションを越えて、セマンティック対応のような他のマッチングタスクにも一般化可能か?
  • RQ4デコーダーにおけるアピアランス埋め込みの統合は、標準的なトランスフォーマー基盤の集約と比較して、セグメンテーション品質をどのように向上させるか?
  • RQ5標準的な4次元畳み込みをハイブリッド畳み込み-トランスフォーマー手法に置き換えることで、曖昧またはごみだらけの入力においてノイズをどれほど低減し、性能を向上させられるか?

主な発見

  • VATは、PASCAL-5i、COCO-20i、FSS-1000を含むすべての標準的少数ショットセグメンテーションベンチマークで最先端の性能を達成し、COCO-20i(5ショット)では平均mBAが54.9、PASCAL-5i(5ショット)では54.8を記録した。
  • セマンティック対応タスクのSPair-71kベンチマークでは、VATが平均正答率55.5を達成し、以前の最先端手法(CATs:49.9、PMNC:50.4)を上回った。
  • アブレーションスタディにより、4次元畳み込みスタムが境界アーチファクトを低減し、繰り返しテクスチャを持つ領域での局所的コンテキストの強化により、性能が顕著に向上することが確認された。
  • 階層的ピラミッド構造は特徴精錬に寄与し、非ピラミッドバージョンと比較して1.5–2.0%のmBA向上がアブレーションで示された。
  • アピアランスに配慮したデコーダーは、最終的なコストボリュームのノイズを低減し、特に背景ごみが多い困難なケースにおいて、より鋭く正確なセグメンテーションマスクを生成した。
  • モデルはセマンティック対応タスクに対しても良好に一般化し、効果的なコスト集約が、少数ショットセグメンテーションと対応タスクの両方における主要なボトルネックであることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。