Skip to main content
QUICK REVIEW

[論文レビュー] Dilated SpineNet for Semantic Segmentation

Abdullah Rashwan, Xianzhi Du|arXiv (Cornell University)|Mar 23, 2021
Advanced Neural Network Applications参考文献 53被引用数 6
ひとこと要約

本稿では、スケールパーミュテーション特徴融合と拡張畳み込みを統合することで空間分解能を保持し、マルチスケール特徴学習を強化する、ニューラルアーキテクチャサーチ(NAS)で発見されたセマンティックセグメンテーション用バックボーン、Dilated SpineNet(SpineNet-Seg)を提案する。単一モデル・単一スケール推論で、Cityscapes(83.04% mIoU)およびPASCAL VOC2012(85.56% mIoU)で最先端性能を達成し、すべてのモデルスケールでDeepLabv3/v3+ベースラインを上回りながら、パラメータ数とFLOPsを削減している。

ABSTRACT

Scale-permuted networks have shown promising results on object bounding box detection and instance segmentation. Scale permutation and cross-scale fusion of features enable the network to capture multi-scale semantics while preserving spatial resolution. In this work, we evaluate this meta-architecture design on semantic segmentation - another vision task that benefits from high spatial resolution and multi-scale feature fusion at different network stages. By further leveraging dilated convolution operations, we propose SpineNet-Seg, a network discovered by NAS that is searched from the DeepLabv3 system. SpineNet-Seg is designed with a better scale-permuted network topology with customized dilation ratios per block on a semantic segmentation task. SpineNet-Seg models outperform the DeepLabv3/v3+ baselines at all model scales on multiple popular benchmarks in speed and accuracy. In particular, our SpineNet-S143+ model achieves the new state-of-the-art on the popular Cityscapes benchmark at 83.04% mIoU and attained strong performance on the PASCAL VOC2012 benchmark at 85.56% mIoU. SpineNet-Seg models also show promising results on a challenging Street View segmentation dataset. Code and checkpoints will be open-sourced.

研究の動機と目的

  • オブジェクト検出で成功を収めたスケールパーミュテーションネットワークを、高い空間分解能とマルチスケールコンテキストを必要とするセマンティックセグメンテーションに効果的に適用できるかを評価すること。
  • セマンティックセグメンテーションに最適化された、スケールパーミュテーション、クロススケール接続、ブロック調整、拡張率を統合的に最適化するための共同探索空間を設計すること。
  • 通常サイズおよびモバイルサイズの両方のセマンティックセグメンテーションに対して、精度と効率性の両面で優れた性能を発揮する効率的なモデルを開発すること。
  • 追加の学習データやマルチスケール推論を用いずに、主要ベンチマークで最先端の性能を達成すること。

提案手法

  • アーキテクチャサーチの高速化のため、ダウンサンプルされたImageNetスタイルの画像(384×384)と低次元の特徴を用いたプロキシタスクを設計する。
  • スケールパーミュテーション接続、クロススケール特徴融合、ブロックの深さ調整、および各ブロックごとの拡張率の4つの要素を同時に最適化する、新しい探索空間を導入する。
  • NASコントローラーは、PASCAL VOC2012検証セットのmIoUを報酬信号として用い、10,000の候補アーキテクチャを迅速に評価可能なプロキシタスクを活用して訓練する。
  • 最終アーキテクチャであるSpineNet-S49は、高精度セグメンテーション用にSpineNet-S143+にスケールアップされ、効率的な推論用にMobile SpineNet-Segに変換される。
  • 空間分解能を低下させることなく大きな感受野を維持するため、探索されたアーキテクチャに拡張畳み込みを統合する。
  • 探索ベースラインとして、NAS中に出力ストライドを8に調整した変更済みDeepLabv3バックボーンを用いる。

実験結果

リサーチクエスチョン

  • RQ1オブジェクト検出で有効であったスケールパーミュテーションネットワークを、高い空間分解能を要するセマンティックセグメンテーションに効果的に適用できるか?
  • RQ2スケールパーミュテーション接続、クロススケール融合、ブロックの深さ、拡張率を同時に探索することで、個別探索や固定設計に比べて優れたセマンティックセグメンテーションモデルが得られるか?
  • RQ3プロキシタスクを用いたNASが、計算コストを低減しつつも、セマンティックセグメンテーションベンチマークで高い性能を達成できるか?
  • RQ4最終アーキテクチャが、単一モデル・単一スケール推論で、従来の最先端モデル(例:DeepLabv3/v3+)を上回る性能を示すか?
  • RQ5探索されたアーキテクチャを、高精度とモバイル最適化の両方の用途に効果的にスケーリングできるか?

主な発見

  • SpineNet-S143+は、追加の学習データを用いずに、単一モデル・単一スケール推論でCityscapesベンチマークで83.04% mIoUという新たな最先端性能を達成した。
  • PASCAL VOC2012では、SpineNet-S143+が85.56% mIoUを達成し、DeepLabv3/v3+ベースラインをmIoUで2.47%上回りながら、FLOPsを15%削減した。
  • モバイル最適化されたSpineNet-S49-モデルは、計算コストを削減しながら、MobileNetV3ベースのDeepLabモデルを+2.5% mIoUで上回った。
  • COCO Thingsアノテーションを用いたNASプロキシタスクが最も優れた性能を示し、PASCAL VOC2012でベースライン比+2.47% mIoUの向上を達成した。
  • アブレーションスタディの結果、スケールパーミュテーションネットワークと拡張率の共同探索により+2.47% mIoUの向上が確認され、出力ストライド8が最適であることが示された。
  • ResNet-S50を探索ベースとして用いた場合、ベースラインのDeepLabv3を+2.06% mIoU上回った。これは、NASアプローチの有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。