Skip to main content
QUICK REVIEW

[論文レビュー] Pyramid Fusion Transformer for Semantic Segmentation

Zipeng Qin, Jianbo Liu|arXiv (Cornell University)|Jan 11, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、マルチスケール特徴の統合をクロススケール相互クエリアテンションにより強化することで、1/8、1/16、1/32解像度のピラミッド特徴を利用した、1マスクごとのセマンティックセグメンテーション向けのマルチスケール変換器デコーダーであるピラミッドファージョントランスフォーマー(PFT)を提案する。学習可能なクエリとクロスアテンションを用いることで、SOTA性能を達成し、マルチスケール推論下でスウィン-Lバックボーンを用いた場合にADE20Kで57.4 mIoUを達成する。

ABSTRACT

The recently proposed MaskFormer gives a refreshed perspective on the task of semantic segmentation: it shifts from the popular pixel-level classification paradigm to a mask-level classification method. In essence, it generates paired probabilities and masks corresponding to category segments and combines them during inference for the segmentation maps. In our study, we find that per-mask classification decoder on top of a single-scale feature is not effective enough to extract reliable probability or mask. To mine for rich semantic information across the feature pyramid, we propose a transformer-based Pyramid Fusion Transformer (PFT) for per-mask approach semantic segmentation with multi-scale features. The proposed transformer decoder performs cross-attention between the learnable queries and each spatial feature from the feature pyramid in parallel and uses cross-scale inter-query attention to exchange complimentary information. We achieve competitive performance on three widely used semantic segmentation datasets. In particular, on ADE20K validation set, our result with Swin-B backbone surpasses that of MaskFormer's with a much larger Swin-L backbone in both single-scale and multi-scale inference, achieving 54.1 mIoU and 55.7 mIoU respectively. Using a Swin-L backbone, we achieve single-scale 56.1 mIoU and multi-scale 57.4 mIoU, obtaining state-of-the-art performance on the dataset. Extensive experiments on three widely used semantic segmentation datasets verify the effectiveness of our proposed method.

研究の動機と目的

  • マスクフォーマーのような1マスク分類モデルが、細粒度またはグローバルな文脈が不足する単一スケール特徴を用いる場合に性能を発揮しないという限界を解消する。
  • 計算コストが著しく増大するのを防ぎつつ、マルチスケール特徴を効果的に統合することで、セグメンテーションの正確性を向上させる。
  • 異なる特徴スケール間で意味的情報を交換できる、効率的なクロススケールアテンション機構を設計する。
  • 存在しないカテゴリに対応しないクエリを正則化する新しいアテンション重み損失を用いて、クエリが存在しないカテゴリに誤って注目するのを抑制する。
  • 計算効率を維持したまま、標準ベンチマークでSOTA性能を達成する。

提案手法

  • 1/8、1/16、1/32解像度の特徴マップを並列に処理するマルチスケール変換器デコーダーを提案し、共有の学習可能なオブジェクトクエリを用いる。
  • 異なるスケールのクエリ間での通信を可能にするクロススケール相互クエリアテンションを導入し、直接的なクロススケールトークン計算を回避しながら、補完的な意味的情報を交換可能にする。
  • クエリとマルチスケール特徴の間で学習可能なクエリベースのクロスアテンション機構を用い、確率とマスク予測のペアを生成する。
  • 存在しないカテゴリに対応しないクエリを正則化する新しいアテンション重み損失を適用し、関係のない画像領域への誤った注目を低減する。
  • 正則化のバランスを保つために、訓練の最初の3/4のイテレーション間でのみアテンション重み損失を最適化する。
  • デコーダーからの各スケールの予測を平均化して最終的なセグメンテーションマップを生成し、耐性と正確性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1過度な計算コストを伴わずに、変換器ベースのデコーダーがマルチスケール特徴を効果的に統合できるか。
  • RQ2すべてのトークンに対して自己アテンションを適用するのと比較して、クロススケール相互クエリアテンションは、単純な連結や自己アテンションに比べて、異なる解像度レベル間での特徴通信をどのように改善するか。
  • RQ3訓練中に存在しないカテゴリへの注目を抑制するアテンション重み損失を導入することで、どのような影響が生じるか。
  • RQ4特定の訓練段階でアテンション重み損失を削除することで、モデルの一般化性能と性能が向上するか。
  • RQ5パフォーマンスとFLOPsのバランスを最適化するには、マルチスケール特徴の最適な数と解像度は何か。

主な発見

  • マルチスケール推論下でスウィン-Bバックボーンを用いた場合、PFTはADE20Kで55.7 mIoUを達成し、はるかに大きなスウィン-Lバックボーンを用いたマスクフォーマーを上回る。
  • スウィン-Bバックボーンを用いた場合、マルチスケール推論下でADE20Kで57.4 mIoUを達成し、このデータセットで新たなSOTA結果を樹立する。
  • アブレーションスタディの結果、1/8、1/16、1/32解像度の特徴を用いることでパフォーマンスと計算コストの最良トレードオフが達成され、48.7 mIoUを記録する。1/4解像度の特徴を追加してもパフォーマンスはわずかに48.9 mIoUに向上するが、FLOPsのコストが著しく増加する。
  • アテンション重み損失を120kイテレーションまで適用することで、最良のパフォーマンス(48.7 mIoU)と最小の分散が得られ、早期に正則化を解除することでモデル容量が向上することが示唆される。
  • 初期クエリに対する追加の監視を削除すると、パフォーマンスがわずかに低下(48.7から48.5 mIoU)するが、これは初期監視がクエリとネットワークダイナミクスを一致させるのを支援していることを示唆する。
  • 可視化の結果、アテンション重み損失を削除すると、アテンション重みとカテゴリマスクの相関性が低下し、クエリがターゲットカテゴリ外の領域により多く注目するようになることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。