Skip to main content
QUICK REVIEW

[論文レビュー] S$^2$-FPN: Scale-ware Strip Attention Guided Feature Pyramid Network for Real-time Semantic Segmentation

Mohammed A. M. Elhassan, Chenhui Yang|arXiv (Cornell University)|Jun 15, 2022
Advanced Neural Network Applications被引用数 13
ひとこと要約

本稿では、スケールに敏感なストリップアテンションとアテンションベースの特徴マップピラミッド統合モジュールを用いて、計算コストを低減しつつマルチスケール特徴表現を強化する、軽量でリアルタイムなセマンティックセグメンテーションネットワークS²-FPNを提案する。本手法は、最先端の精度/速度トレードオフを達成し、Cityscapesでは30.5 FPSで77.8% mIoU、Camvidでは55.5 FPSで74.2% mIoUを達成する。効率的なアテンション機構と特徴統合戦略により、リアルタイム性能が実現されている。

ABSTRACT

Modern high-performance semantic segmentation methods employ a heavy backbone and dilated convolution to extract the relevant feature. Although extracting features with both contextual and semantic information is critical for the segmentation tasks, it brings a memory footprint and high computation cost for real-time applications. This paper presents a new model to achieve a trade-off between accuracy/speed for real-time road scene semantic segmentation. Specifically, we proposed a lightweight model named Scale-aware Strip Attention Guided Feature Pyramid Network (S$^2$-FPN). Our network consists of three main modules: Attention Pyramid Fusion (APF) module, Scale-aware Strip Attention Module (SSAM), and Global Feature Upsample (GFU) module. APF adopts an attention mechanisms to learn discriminative multi-scale features and help close the semantic gap between different levels. APF uses the scale-aware attention to encode global context with vertical stripping operation and models the long-range dependencies, which helps relate pixels with similar semantic label. In addition, APF employs channel-wise reweighting block (CRB) to emphasize the channel features. Finally, the decoder of S$^2$-FPN then adopts GFU, which is used to fuse features from APF and the encoder. Extensive experiments have been conducted on two challenging semantic segmentation benchmarks, which demonstrate that our approach achieves better accuracy/speed trade-off with different model settings. The proposed models have achieved a results of 76.2\%mIoU/87.3FPS, 77.4\%mIoU/67FPS, and 77.8\%mIoU/30.5FPS on Cityscapes dataset, and 69.6\%mIoU,71.0\% mIoU, and 74.2\% mIoU on Camvid dataset. The code for this work will be made available at \url{https://github.com/mohamedac29/S2-FPN

研究の動機と目的

  • リアルタイム応用における高性能セマンティックセグメンテーションモデルの高い計算コストとメモリ使用量を低減すること。
  • 特徴マップピラミッドネットワークにおけるマルチスケール特徴表現を向上させ、特徴レベル間の意味的ギャップを低減すること。
  • 最小限の計算オーバーヘッドで長距離依存関係をモデル化できる効率的なアテンション機構を設計すること。
  • 軽量アーキテクチャと効果的な特徴統合を用いて、リアルタイムの道路シーンセグメンテーションにおける優れた精度/速度トレードオフを達成すること。
  • アブレーションとベンチマーク比較を通じて、スケールに敏感なストリップアテンションとアテンションピラミッド統合の有効性を検証すること。

提案手法

  • 長距離依存関係を効率的にモデル化するため、垂直ストリップ演算とスケールに敏感なアテンションを用いたスケールに敏感なストリップアテンションモジュール(SSAM)を提案する。
  • 意味的ギャップを低減するために、チャネルワイドな再重み付けとアテンション機構を用いてマルチスケール特徴を統合するアテンションピラミッド統合(APF)モジュールを導入する。
  • エンコーダーとデコーダーの特徴を統合してセグメンテーション出力を強化するため、グローバル特徴アップサンプル(GFU)モジュールを採用する。
  • 推論速度を維持するため、軽量バックボーン(例:ResNet18/34)とS²-FPNヘッドを組み合わせる。
  • フルアテンションマップの代わりに垂直ストリップ演算を活用することで、空間的およびチャネルアテンションのFLOPsを削減する。
  • 入力解像度の制御とストライドの調整を用いて、精度と速度のバランスを最適化する。

実験結果

リサーチクエスチョン

  • RQ1軽量アテンション機構は、計算コストを最小限に抑えつつ、セマンティックセグメンテーションにおける長距離依存関係を効果的にモデル化できるか?
  • RQ2標準的なFPNやラテラル接続と比較して、スケールに敏感なストリップアテンションはマルチスケール特徴統合をどのように改善するか?
  • RQ3アテンションピラミッド統合(APF)モジュールは、特徴マップピラミッド内の特徴レベル間の意味的ギャップをどの程度低減するか?
  • RQ4S²-FPNは、CityscapesやCamvidといった標準ベンチマークでどの程度の精度/速度トレードオフを達成するか?
  • RQ5ステージ2のストライドを1に置き換えることで、推論時間に顕著な増加を伴わずに性能が向上するか?

主な発見

  • ResNet18を用いたS²-FPNは、Cityscapesで87.3 FPSで76.2% mIoUを達成し、優れたスピード/精度トレードオフを示している。
  • ResNet34を用いることで、モデルは67 FPSで77.4% mIoUに到達し、やや速度を犠牲にしつつも精度が向上している。
  • S²-FPN34Mは、ステージ2のストライドを1に置き換えたバージョンであり、30.5 FPSで77.8% mIoUを達成し、アーキテクチャの最適化による顕著な性能向上が示された。
  • Camvidでは、S²-FPN18が124.2 FPSで69.6% mIoU、S²-FPN34Mが55.5 FPSで74.2% mIoUを達成し、先行する軽量モデルを上回った。
  • アブレーションスタディの結果、スケールに敏感なストリップアテンションとAPFモジュールの両方が性能向上に顕著な寄与をしていることが確認された。
  • mIoUにおいて、BiSeNetV2 や STDC-Seg といった最先端手法を上回りつつ、競争力ある推論速度を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。