Skip to main content
QUICK REVIEW

[論文レビュー] MSCFNet: A Lightweight Network With Multi-Scale Context Fusion for Real-Time Semantic Segmentation

Guangwei Gao, Guoan Xu|arXiv (Cornell University)|Mar 24, 2021
Advanced Neural Network Applications参考文献 50被引用数 9
ひとこと要約

MSCFNetは、非対称エンコーダ・デコーダアーキテクチャを用いたマルチスケールコンテキストフュージョン(MSCF)方式を採用した軽量でリアルタイムなセマンティックセグメンテーションネットワークを提案する。因子化されたディープワイドおよび拡張畳み込みを組み合わせた効率的な非対称残差(EAR)モジュールに加え、空間的およびチャネル注意機構を統合することで、わずか115万パラメータで高い精度を達成し、Cityscapesで71.9%のmIoUを達成するとともに、50フレーム/秒以上の推論速度を実現した。

ABSTRACT

In recent years, how to strike a good trade-off between accuracy and inference speed has become the core issue for real-time semantic segmentation applications, which plays a vital role in real-world scenarios such as autonomous driving systems and drones. In this study, we devise a novel lightweight network using a multi-scale context fusion (MSCFNet) scheme, which explores an asymmetric encoder-decoder architecture to dispose this problem. More specifically, the encoder adopts some developed efficient asymmetric residual (EAR) modules, which are composed of factorization depth-wise convolution and dilation convolution. Meanwhile, instead of complicated computation, simple deconvolution is applied in the decoder to further reduce the amount of parameters while still maintaining high segmentation accuracy. Also, MSCFNet has branches with efficient attention modules from different stages of the network to well capture multi-scale contextual information. Then we combine them before the final classification to enhance the expression of the features and improve the segmentation efficiency. Comprehensive experiments on challenging datasets have demonstrated that the proposed MSCFNet, which contains only 1.15M parameters, achieves 71.9\% Mean IoU on the Cityscapes testing dataset and can run at over 50 FPS on a single Titan XP GPU configuration.

研究の動機と目的

  • リソース制限のあるアプリケーションにおけるリアルタイムセマンティックセグメンテーションにおいて、精度、推論速度、モデルサイズの間の重要なトレードオフを解消すること。
  • 計算コストとメモリコストを顕著に低減しつつも、高いセグメンテーション精度を維持する軽量ネットワークの設計。
  • 効率的な注意機構を用いて、異なるネットワーク段階からのマルチスケールコンテキスト情報を統合することで、特徴表現を向上させること。
  • モデルサイズと推論遅延を最小限に抑えることで、ドローン、自動運転車両、モバイルシステムなどのエッジデバイスへのリアルタイムデプロイを可能にすること。

提案手法

  • パラメータ数を低く抑えながら受容 field を拡大できる、因子化されたディープワイド畳み込みと拡張畳み込みを統合した効率的な非対称残差(EAR)モジュールを提案する。
  • エンコーダにEARモジュールを、デコーダにシンプルな逆畳み込みを用いて効率的なアップサンプリングを実現する非対称エンコーダ・デコーダアーキテクチャを実装する。
  • 異なるエンコーダ段階から得られるマルチスケール注意ブランチを導入し、空間的およびチャネルワイドなコンテキスト特徴を適応的に捉える。
  • 要素ごとの加算(連結ではなく)を用いて複数ブランチからの特徴を統合することで、計算コストを最小限に抑えつつ特徴表現を強化する。
  • ECA(eXtreme Channel Attention)と空間注意モジュールを適用し、パラメータ増加をほとんど認めない範囲でチャネルおよび空間特徴の相互作用を向上させる。
  • EARブロック内で2の累乗の倍率を持つ拡張畳み込みを用いることで、パラメータ数を増やさずにマルチスケールコンテキストを効果的に集約する。

実験結果

リサーチクエスチョン

  • RQ1軽量ネットワークは、標準ベンチマーク上で高いセグメンテーション精度を維持しながら、リアルタイム推論速度を達成できるか?
  • RQ2異なるエンコーダ段階からのマルチスケールコンテキストフュージョンは、単一スケール特徴抽出と比較して、セグメンテーション性能にどのように影響を与えるか?
  • RQ3リアルタイムセマンティックセグメンテーションにおいて、モデルサイズ、推論速度、精度の最適なバランスは何か?
  • RQ4空間的およびチャネル注意機構は、モデル複雑性を顕著に増加させない範囲で、性能向上にどのように寄与するか?
  • RQ5軽量セグメンテーションネットワークにおいて、加算による特徴統合は連結よりも精度と効率の点で優れているか?

主な発見

  • MSCFNetは、Cityscapesバリデーションセットとテストセットの両方で71.9%の平均交差率(mIoU)を達成し、パラメータ数はわずか115万。
  • 単一のTitan XP GPU上で50フレーム/秒以上の速度で推論が可能であり、優れたリアルタイム推論能力を示した。
  • ICNetと比較して、15%のパラメータ数で高い精度とより速い推論速度を達成した。
  • DABNetはわずか0.4Mパラメータ少ないが、mIoUで1.8%劣り、MSCFNetの優れた精度・効率のトレードオフを裏付けた。
  • CamVidデータセットでは、小さなサイズにもかかわらず、69.3%のクラスmIoUを達成し、大多数の最先端の軽量モデルを上回った。
  • アブレーションスタディの結果、マルチスケールコンテキストフュージョンにより性能が1%以上向上し、連結よりも加算による統合が精度と効率の点で優れていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。