[論文レビュー] IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation
IncepFormerは、畳み込みとピラミッドプーリングを統合したインセプション型のマルチスケール自己注意機構を備えた、セマンティックセグメンテーション向けの新規で効率的なトランスフォーマー基盤アーキテクチャを提案する。グローバルなコンテキストと詳細な局所化を同時に捉えることができ、ADE20Kで47.7%のmIoU、Cityscapesで82.0%のmIoUを達成し、従来手法を上回る最先端の性能を発揮するが、パラメータ数は半分で、FLOPsも少ない。
Semantic segmentation usually benefits from global contexts, fine localisation information, multi-scale features, etc. To advance Transformer-based segmenters with these aspects, we present a simple yet powerful semantic segmentation architecture, termed as IncepFormer. IncepFormer has two critical contributions as following. First, it introduces a novel pyramid structured Transformer encoder which harvests global context and fine localisation features simultaneously. These features are concatenated and fed into a convolution layer for final per-pixel prediction. Second, IncepFormer integrates an Inception-like architecture with depth-wise convolutions, and a light-weight feed-forward module in each self-attention layer, efficiently obtaining rich local multi-scale object features. Extensive experiments on five benchmarks show that our IncepFormer is superior to state-of-the-art methods in both accuracy and speed, e.g., 1) our IncepFormer-S achieves 47.7% mIoU on ADE20K which outperforms the existing best method by 1% while only costs half parameters and fewer FLOPs. 2) Our IncepFormer-B finally achieves 82.0% mIoU on Cityscapes dataset with 39.6M parameters. Code is available:github.com/shendu0321/IncepFormer.
研究の動機と目的
- 標準のトランスフォーマーがセマンティックセグメンテーションにおいて抱える課題、特に高い計算コストと不十分なマルチスケール特徴モデリングの制限を解消すること。
- 畳み込みとプーリングからのインダクティブバイアスを自己注意に統合することで、局所的およびグローバルなコンテキスト学習を向上させること。
- 異なるエンコーダーステージからのマルチスケール特徴を効果的に統合する軽量で効率的なデコーダーを設計し、高解像度予測を実現すること。
- 複数のベンチマークで、モデルの精度、パラメータ数、計算効率のバランスを優れたものにすること。
提案手法
- 深さ方向畳み込みと複数のスケールのカーネルサイズ、およびプーリングを組み合わせた、インセプション型マルチヘッド自己注意(Incep-MHSA)を導入し、受容 field の柔軟性とインダクティブバイアスを向上させる。
- 標準の位置埋め込みをバッチノーマライゼーションに置き換え、計算コストを低減するとともに、2次元空間モデリングを改善するための軽量なフィードフォワードネットワーク(E-FFN)を採用する。
- インセプション型の設計を用いて、各自己注意層内およびステージ間の両方でマルチスケール特徴を捉えるピラミッド構造のエンコーダーを採用する。
- アップサンプリング後に特徴を連結する軽量なUpsample-Concatデコーダーを提案し、局所的およびグローバルコンテキストの効率的統合を実現する。
- 位置埋め込みを一切使用せず、畳み込みと正規化層からの空間的インダクティブバイアスに依存する、シンプルでエンドツーエンドのトレーニングパラダイムを採用する。
- 効率性と性能のトレードオフを考慮し、3つのバリアント(T, S, B)にスケーリングし、多様な展開環境に対応できる。
実験結果
リサーチクエスチョン
- RQ1畳み込みとプーリングからのインダクティブバイアスを統合したトランスフォーマー基盤エンコーダーは、セマンティックセグメンテーションにおける特徴表現を向上させることができるか?
- RQ2オブジェクトの局所化とコンテキストモデリングを向上させるために、トランスフォーマーレイヤー間およびレイヤー内でのマルチスケール特徴学習をどのように強化できるか?
- RQ3計算コストを増加させることなく、異なるステージからのマルチスケール特徴を効果的に統合できる軽量デコーダーは実現可能か?
- RQ4自己注意にピラミッドプールとインセプション型モジュールを統合することで、標準のトランスフォーマーと比較して、精度と効率のトレードオフが改善されるか?
- RQ5提案されたアーキテクチャは、従来手法と比較して顕著に少ないパラメータ数とFLOPsで最先端の性能を達成できるか?
主な発見
- IncepFormer-SはADE20Kで47.7%のmIoUを達成し、前回のSOTAを1%上回るが、パラメータ数は半分で、FLOPsも少ない。
- IncepFormer-Bは39.6MパラメータでCityscapesで82.0%のmIoUを達成し、パラメータ数とFLOPsを減らしながらPascal ContextでHRNet-OCR(56.2%)を上回った。
- IncepFormer-SはCityscapesでSegFormer-B2を0.6%のmIoU上回り、計算コストを88.5%も削減(83.2G vs. 717.1G FLOPs)。
- 提案されたUpsample-Concatデコーダーは、SegFormerスタイルのデコーダーと比較してmIoUを0.2%向上させ、ステージ間の特徴統合の有効性を示した。
- ADE20Kでは、IncepFormerがスウィントランスフォーマー、SETR、SegFormerと比較して、精度と効率の両面で優れたパフォーマンスを発揮した。
- 定性的な結果から、特に複雑な都市環境において、IncepFormerはSegFormerよりも鋭く正確なセグメンテーションマスクを生成することがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。