[論文レビュー] Feature Selective Transformer for Semantic Image Segmentation
本稿では、スケールレベル特徴選択(SFS)とフルスケール特徴統合(FFF)の2つの主要モジュールを用いて、動的で柔軟なマルチスケール特徴統合を実現する、新たなセマンティック画像セグメンテーションフレームワークである特徴選択型トランスフォーマー(FeSeFormer)を提案する。SFSは、各クエリごとに全スケールから情報量の多い特徴を動的に選択し、冗長な特徴を除外する。FFFは、学習可能なクロススケールアテンション機構を用いて、各クエリが全スケールの特徴に適応的にアテンションを提供し統合する。FeSeFormerは、PASCAL Contextで58.91%のmIoU、Cityscapesで84.46%のmIoUを達成し、4つのベンチマークで最先端性能を示した。
Recently, it has attracted more and more attentions to fuse multi-scale features for semantic image segmentation. Various works were proposed to employ progressive local or global fusion, but the feature fusions are not rich enough for modeling multi-scale context features. In this work, we focus on fusing multi-scale features from Transformer-based backbones for semantic segmentation, and propose a Feature Selective Transformer (FeSeFormer), which aggregates features from all scales (or levels) for each query feature. Specifically, we first propose a Scale-level Feature Selection (SFS) module, which can choose an informative subset from the whole multi-scale feature set for each scale, where those features that are important for the current scale (or level) are selected and the redundant are discarded. Furthermore, we propose a Full-scale Feature Fusion (FFF) module, which can adaptively fuse features of all scales for queries. Based on the proposed SFS and FFF modules, we develop a Feature Selective Transformer (FeSeFormer), and evaluate our FeSeFormer on four challenging semantic segmentation benchmarks, including PASCAL Context, ADE20K, COCO-Stuff 10K, and Cityscapes, outperforming the state-of-the-art.
研究の動機と目的
- 既存のマルチスケール特徴統合手法が固定または局所的な統合パターンに依存し、不要な特徴を含むことがあるという限界を解消する。
- 各クエリ特徴が隣接スケールや事前定義されたサブセットに限定されず、全スケールから情報量の多い特徴に選択的にアテンションできるように、文脈モデリングを向上させる。
- 計算コストを著しく増加させることなく、特徴表現を強化する柔軟で適応的な統合メカニズムを構築する。
- 改善されたマルチスケール特徴統合により、主要なセマンティックセグメンテーションベンチマークで最先端の性能を達成する。
提案手法
- 各クエリスケールに対して、全マルチスケール特徴集合から情報量の多い特徴のサブセットを、学習可能なアテンションを用いて選択するスケールレベル特徴選択(SFS)モジュールを提案する。冗長な特徴は除外される。
- 各クエリが全スケールの特徴に学習可能なクロススケールアテンション機構を用いてアテンションを提供し、特徴を統合するフルスケール特徴統合(FFF)モジュールを導入する。
- SFSとFFFを、Swin Transformerをバックボーンとして使用するトランスフォーマーに基づくエンコーダ・デコーダフレームワークに統合し、デコードには軽量なFCNヘッドを採用する。
- 特に細かいスケールに対して計算およびメモリオーバーヘッドを低減するため、高解像度特徴マップにプロジェクション機構を適用する。
- 特徴選択のスパarsityを制御するためのレシピエーション損失を最適化し、ネットワークが意味のあるコンパクトな特徴サブセットを学習できるように促進する。
- 入力解像度を480×480として、標準的なデータオーグメンテーションと学習率スケジューリングを用い、標準ベンチマーク上でエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1全マルチスケール特徴から動的かつフルスケールの特徴選択が、段階的または局所的統合と比較してセマンティックセグメンテーション性能を向上させられるか?
- RQ2全スケールからスパarselyで情報量の多い特徴サブセットを選択することは、表現品質と計算効率にどのように影響するか?
- RQ3各スケールあたりの最適な特徴選択割合は何か? そして、その割合はセグメンテーション精度にどのように影響するか?
- RQ4全スケールにわたる適応的統合は、固定または双方向統合機構(FPT や GFFNet など)を上回る性能を発揮できるか?
- RQ5提案手法は、シーンの複雑さやカテゴリ分布が異なる多様なベンチマークに一般化可能か?
主な発見
- PASCAL Contextでは58.91%のmIoUを達成し、前回SOTAを+2.54% mIoU上回った。
- ADE20Kでは54.43%のmIoUを達成し、前回SOTAを+1.29% mIoU上回った。
- COCO-Stuff 10Kでは49.80%のmIoUを達成し、大規模で長尾分布を示すデータセットにおいても強力な一般化性能を示した。
- Cityscapesでは84.46%のmIoUを達成し、高解像度の都市景観理解において、このベンチマークで新たなSOTAを樹立した。
- アブレーションスタディの結果、SFSとFFFを組み合わせることでベースライン比+1.6% mIoUの向上が確認され、SFS単体でも+0.71%のさらなる向上が得られた。
- 最適な特徴選択割合はρ=0.6であり、α=0.4の比率損失が最良の性能を示した。これは、全アテンションよりも選択的統合がより効果的であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。