Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Multi-Scale Feature Fusion for Semantic Segmentation

Tianjian Meng, Golnaz Ghiasi|arXiv (Cornell University)|Mar 23, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、高解像度の内部特徴量や高価なアトラス畳み込みに依存せずに最先端の精度を達成する、簡素化されたセマンティックセグメンテーションモデルであるESegを提案する。$P_9$ まで拡張されたマルチスケール特徴空間と、双方向的BiFPNを用いた特徴統合により、ESegはCityScapesで189 FPSで76.0%のmIoUを達成し、速度と精度の両面でFasterSegを上回った。これは、洗練されたアーキテクチャによって、効率的で高性能なセグメンテーションが可能であることを示している。

ABSTRACT

It is commonly believed that high internal resolution combined with expensive operations (e.g. atrous convolutions) are necessary for accurate semantic segmentation, resulting in slow speed and large memory usage. In this paper, we question this belief and demonstrate that neither high internal resolution nor atrous convolutions are necessary. Our intuition is that although segmentation is a dense per-pixel prediction task, the semantics of each pixel often depend on both nearby neighbors and far-away context; therefore, a more powerful multi-scale feature fusion network plays a critical role. Following this intuition, we revisit the conventional multi-scale feature space (typically capped at P5) and extend it to a much richer space, up to P9, where the smallest features are only 1/512 of the input size and thus have very large receptive fields. To process such a rich feature space, we leverage the recent BiFPN to fuse the multi-scale features. Based on these insights, we develop a simplified segmentation model, named ESeg, which has neither high internal resolution nor expensive atrous convolutions. Perhaps surprisingly, our simple method can achieve better accuracy with faster speed than prior art across multiple datasets. In real-time settings, ESeg-Lite-S achieves 76.0% mIoU on CityScapes [12] at 189 FPS, outperforming FasterSeg [9] (73.1% mIoU at 170 FPS). Our ESeg-Lite-L runs at 79 FPS and achieves 80.1% mIoU, largely closing the gap between real-time and high-performance segmentation models.

研究の動機と目的

  • 高解像度の内部特徴量やアトラス畳み込みが、正確なセマンティックセグメンテーションに不可欠であるという一般的な信念に挑戦すること。
  • より豊富なマルチスケール特徴空間と改善された特徴統合が、アトラス畳み込みのような高コストなモジュールを代替できるかを調査すること。
  • 複雑なSOTAモデルに匹敵またはそれを上回る性能を維持しながら、より単純で高速かつ効率的なセグメンテーションモデルを開発すること。
  • リアルタイムと高精度のセグメンテーションモデルの間の性能ギャップを埋めること。

提案手法

  • 従来のマルチスケール特徴空間を $P_5$ から $P_9$ まで拡張し、最小の特徴量が入力サイズの $1/512$ にまで小さくなるようにすることで、大きな受容 field を実現する。
  • 市販のEfficientNetをエンコーダとして使用し、変更を加えたBiFPNをデコーダとして用いた、軽量なエンコーダデコーダ構造を採用する。
  • 双方向的特徴統合のためのBiFPNを活用し、トップダウンとボトムアップの両方のパスを組み合わせて、スケール間での特徴統合を強化する。
  • アトラス畳み込みと高解像度特徴マップを完全に回避することで、計算コストとメモリ使用量を削減する。
  • Mapillary Vistasなどの大規模データセットを用いた自己学習と事前学習により、CityScapesでの性能を向上させる。
  • FLOPsとモデルサイズを最小限に抑えつつmIoUを最大化するように、推論効率を最適化する。

実験結果

リサーチクエスチョン

  • RQ1高解像度の内部特徴量やアトラス畳み込みに依存せずに、セマンティックセグメンテーションがSOTAの精度を達成できるか?
  • RQ2マルチスケール特徴空間を $P_9$ まで拡張することで、特徴表現とセグメンテーション精度にどのような影響を与えるか?
  • RQ3豊富なマルチスケール環境下で、BiFPNのような双方向特徴統合機構が、従来のトップダウン型またはスキップ接続を上回れるか?
  • RQ4最小限の構成要素を持つ単純なエンコーダデコーダアーキテクチャが、複雑なSOTAモデルに匹敵またはそれを上回れるか?
  • RQ5大規模データセットでの自己学習と事前学習により、リアルタイムと高パフォーマンスのセグメンテーションモデルのギャップをさらに埋められるか?

主な発見

  • ESeg-Lite-Sは、CityScapesで189 FPSで76.0%のmIoUを達成し、FasterSeg(170 FPSで73.1%のmIoU)を精度と速度の両面で上回った。
  • ESeg-Lite-Lは79 FPSで80.1%のmIoUを達成し、リアルタイムと高精度モデルの間の性能ギャップを顕著に縮めた。
  • ESegは、競合する手法と比較して2倍から9倍のパラメータ数、4倍から50倍のFLOPsを削減しながら、同等またはそれ以上の精度を達成した。
  • Mapillary Vistasでの事前学習とCityScapesの粗いデータを用いた自己学習により、ESeg-LはCityScapesで84.8%のmIoUを達成し、単一モデル・単一スケールでのSOTAを樹立した。
  • BiFPNは、アトラス畳み込みの有無に関わらずDeepLabV3+を上回り、特徴統合アーキテクチャの重要性が、高コストなモジュールよりも顕著であることを証明した。
  • アブレーションスタディにより、強力なマルチスケール統合機構と組み合わせた場合、高解像度の内部特徴量は高価で不必要であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。