Skip to main content
QUICK REVIEW

[論文レビュー] CATrans: Context and Affinity Transformer for Few-Shot Segmentation

Shan Zhang, Tianyi Wu|arXiv (Cornell University)|Apr 27, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

CATransは、少数ショット画像セグメンテーションのための新しいコンテキストおよびアフィニティトランスフォーマーを提案し、関係誘導コンテキスト(RCT)モジュールと関係誘導アフィニティ(RAT)モジュールを統合して、クロス画像特徴マッチングを向上させます。サポート特徴からのグローバルコンテキストと、アテンションに適応したアフィニティに加え、自己アフィニティ正則化を活用することで、CATransは、PASCAL-5iで最大+2.8% mIoU、COCO-20iで最大+2.1% mIoUのSOTA性能を達成しました(ResNet-101を用いて)。

ABSTRACT

Few-shot segmentation (FSS) aims to segment novel categories given scarce annotated support images. The crux of FSS is how to aggregate dense correlations between support and query images for query segmentation while being robust to the large variations in appearance and context. To this end, previous Transformer-based methods explore global consensus either on context similarity or affinity map between support-query pairs. In this work, we effectively integrate the context and affinity information via the proposed novel Context and Affinity Transformer (CATrans) in a hierarchical architecture. Specifically, the Relation-guided Context Transformer (RCT) propagates context information from support to query images conditioned on more informative support features. Based on the observation that a huge feature distinction between support and query pairs brings barriers for context knowledge transfer, the Relation-guided Affinity Transformer (RAT) measures attention-aware affinity as auxiliary information for FSS, in which the self-affinity is responsible for more reliable cross-affinity. We conduct experiments to demonstrate the effectiveness of the proposed model, outperforming the state-of-the-art methods.

研究の動機と目的

  • 少数ショットセグメンテーション(FSS)におけるクラス内での顕著な外見的・幾何的変動に対処するため、サポート画像とクエリ画像間の特徴マッチングを改善すること。
  • 従来のトランスフォーマー基盤のFSS手法がコンテキストまたはアフィニティにのみ依存するという限界を克服し、よりロバストな表現学習のため、両者を統合的にモデル化すること。
  • 識別的なサポート特徴を活用することで、関係誘導コンテキストトランスフォーマー(RCT)を用いて、サポート画像からクエリ画像へのコンテキスト伝達を強化すること。
  • 自己アフィニティを補助信号として組み込むことで、ピクセル単位の対応関係のノイズを低減し、クロスアフィニティ推定を向上させること。
  • マルチスケールのコンテキストとアフィニティマップを統合する階層的アーキテクチャを設計し、セグメンテーション精度を向上させること。

提案手法

  • 関係誘導コンテキストトランスフォーマー(RCT)は、ハイレベルなサポート特徴に条件付けられたトランスフォーマーブロックを用いて、サポート画像からクエリ画像への意味的コンテキストを伝達し、外見のばらつき下でも特徴の整合性を向上させます。
  • 関係誘導アフィニティトランスフォーマー(RAT)は、サポート特徴とクエリ特徴間のアテンションに適応したクロスアフィニティを計算し、自己アフィニティマップを正則化子として用いることで、ノイズの多い相関関係を抑制します。
  • CATransは、階層的アーキテクチャにRCTとRATを統合し、複数レベルの相関マップをスタックすることで、特徴階層全体にわたる局所的およびグローバルな関係を捉えます。
  • 高解像度のクエリ特徴を低解像度の相関マップと連結することで、デコーダーをガイドし、セグメンテーションにおける空間的精度を向上させます。
  • 双方向の特徴エンコーダー(例:ResNetまたはSwin-T)を用い、RCTおよびRATで共有されたアテンション機構を採用することで、パラメータ効率を維持します。
  • モデルは、クロスエントロピー損失とDice損失を用いてエンドツーエンドで訓練され、少数ショットのサポートマスクを前提としたクエリ画像におけるピクセル単位のセグメンテーションを最適化します。

実験結果

リサーチクエスチョン

  • RQ1顕著な外見的変動下でも、トランスフォーマー基盤のアーキテクチャにおいて、コンテキストとアフィニティ情報を効果的に統合する方法は何か?
  • RQ2自己アフィニティマップは、FSSにおけるサポート-クエリマッチングのクロスアフィニティ推定の信頼性を向上させ得るか?
  • RQ3マルチスケールのコンテキストとアフィニティ表現の階層的統合は、単一スケールまたは非階層的設計に比べ、より優れたセグメンテーション性能をもたらすか?
  • RQ4関係誘導コンテキスト伝達によってサポート特徴表現を強化することで、少数ショット設定における一般化性能はどの程度向上するか?
  • RQ5提案されたRCTおよびRATモジュールは、既存のアテンションベースのマッチング機構と比較して、ロバスト性および精度の面で優れているか?

主な発見

  • Swin-Tをバックボーンとして用いた1ショットPASCAL-5iベンチマークでは、CATransが67.6% mIoUを達成し、以前のSOTAであるDGPNetを+2.8%上回りました。
  • COCO-20iでは、Swin-Tを用いた5ショット設定で60.1% mIoUを達成し、DGPNetを+2.0%上回りました。
  • アブレーションスタディの結果、RCTとRATモジュールを併用することで、ベースラインから+5% mIoUの向上が得られ、RCT単体でも1ショットPASCAL-5iで最大+7.7%の性能向上が確認されました。
  • マルチスケール特徴統合により、PASCAL-5iで1.4%、COCO-20iで1.8%のmIoU向上が得られ、デコーダーにおける高解像度ガイドの利点が示されました。
  • 異なるバックボーンアーキテクチャ(ResNet-50およびResNet-101)に対しても一貫した向上が得られ、モデル容量の変化に対して強いロバスト性を示しました。
  • 定性的な結果から、RATは形状や色の類似性に起因する誤検出(偽陽性)を低減しているのに対し、RCTは顕著な外見的変動がある困難なケースにおいて、コンテキストに配慮したセグメンテーションを向上させています。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。