Skip to main content
QUICK REVIEW

[論文レビュー] Simple and Efficient Architectures for Semantic Segmentation

Dushyant Mehta, Andrii Skliar|arXiv (Cornell University)|Jun 16, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、畳み込み層にドーナツ型畳み込みを用いずに、基本ブロックを用いたResNetに類似したバックボーンと軽量なマルチスケールデコーダヘッドを備えた単純なエンコーダデコーダアーキテクチャであるFFNetを提案する。Cityscapes上での最先端性能を達成しており、複雑な操作を伴わない。HRNet、FANet、DDRNetを上回るか同等の精度を達成しながら、はるかに効率的かつハードウェアフレンドリーである。

ABSTRACT

Though the state-of-the architectures for semantic segmentation, such as HRNet, demonstrate impressive accuracy, the complexity arising from their salient design choices hinders a range of model acceleration tools, and further they make use of operations that are inefficient on current hardware. This paper demonstrates that a simple encoder-decoder architecture with a ResNet-like backbone and a small multi-scale head, performs on-par or better than complex semantic segmentation architectures such as HRNet, FANet and DDRNets. Naively applying deep backbones designed for Image Classification to the task of Semantic Segmentation leads to sub-par results, owing to a much smaller effective receptive field of these backbones. Implicit among the various design choices put forth in works like HRNet, DDRNet, and FANet are networks with a large effective receptive field. It is natural to ask if a simple encoder-decoder architecture would compare favorably if comprised of backbones that have a larger effective receptive field, though without the use of inefficient operations like dilated convolutions. We show that with minor and inexpensive modifications to ResNets, enlarging the receptive field, very simple and competitive baselines can be created for Semantic Segmentation. We present a family of such simple architectures for desktop as well as mobile targets, which match or exceed the performance of complex models on the Cityscapes dataset. We hope that our work provides simple yet effective baselines for practitioners to develop efficient semantic segmentation models.

研究の動機と目的

  • 標準のImageNet学習済みResNet(ボトルネックブロックを含む)がセマンティックセグメンテーションに適用された際に有効受容 field が低下することで性能が低下する問題を解消する。
  • 単純なアーキテクチャが広い受容 field と効率的な演算を備えることで、低い計算コストで高い精度を達成できることを示す。
  • デスクトップおよびモバイルデバイスへの実装を念頭に置いた実用的でハードウェアフレンドリーなベースラインを提供すること。

提案手法

  • ボトルネックブロックではなく基本ブロックを用いたResNetバックボーンを採用することで、有効受容 field を拡大する、軽量なFPNに類似したエンコーダデコーダアーキテクチャ(FFNet)を設計する。
  • ドーナツ型畳み込みを標準畳み込みに置き換え、ターゲットプラットフォームに応じてデコーダヘッドで双方向補間または最近傍補間を用いる。
  • バックボーンの複数の残差段階から特徴量を抽出し、それらをデコーダヘッドで統合することでマルチスケール特徴量を構築する。
  • マルチスケール特徴量から最終的なセマンティックラベルを予測する、コンactなタスク固有のセグメンテーションヘッドを用いる。
  • Cityscapesデータセットを用いて標準プロトコルに従い、異なるバックボーンの深さと幅を用いてモデルを訓練・評価する。
  • ドーナツ型畳み込みのようなハードウェア非効率な演算を避け、CPUおよびエッジデバイスで広くサポートされている演算を優先することで、効率性を最適化する。

実験結果

リサーチクエスチョン

  • RQ1標準のResNetバックボーンを用いた単純なエンコーダデコーダアーキテクチャが、HRNet や DDRNet といった複雑な最先端モデルを上回る性能を発揮できるか?
  • RQ2標準のImageNetで学習されたResNetにボトルネックブロックが使用されていることが、セマンティックセグメンテーションにおける性能低下(有効受容 field の低下)を引き起こすか?
  • RQ3ボトルネックブロックを排除し、ドーナツ型畳み込みを一切使わない単純なアーキテクチャが、競争力のある精度を達成しながらエッジデバイスでの実装が容易になるか?
  • RQ4同じアーキテクチャファミリー内において、標準のImageNet事前学習モデルとタスク固有のアーキテクチャとの間に性能差があるか?

主な発見

  • 基本ブロックを用いたResNetバックボーンを搭載したFFNetモデルは、Cityscapes検証セットにおいてHRNet、FANet、DDRNetと同等またはそれ以上の性能を達成する。
  • C-C-Cヘッドを備えたResNet-122 NSモデルは、Cityscapesで78.7%の平均IoUを達成し、多数の複雑なアーキテクチャを上回る。
  • ボトルネックブロックではなく基本ブロックを用いることで、有効受容 field が拡大され、標準のResNetバックボーンに比べて顕著な性能向上が得られる。
  • すべてのFFNetモデルはドーナツ型畳み込みを含まず、標準的かつハードウェア効率の良い演算のみを用いるため、高速な推論と容易なデバイス内デプロイが可能である。
  • 最近傍補間と狭い幅を採用したモバイル最適化FFNetバージョンは、低FLOPs(12.0 GFLOPs)で高い精度(例:76.5% IoU)を達成し、エッジデバイスに適している。
  • FFNetのメタアーキテクチャの単純さのおかげで、神経ネットワーク探索(NAS)パイプラインへの容易な統合が可能であり、将来的な効率指向のモデル探索の強力なベースラインを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。