Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Neural Representational Decoders for High-Resolution Semantic Segmentation

Bowen Zhang, Yifan Liu|arXiv (Cornell University)|Jul 30, 2021
Advanced Neural Network Applications参考文献 22被引用数 6
ひとこと要約

本稿では、局所的なセマンティックラベルパッチをコンactなニューラルネットワークとして表現する、新しい効率的な高解像度セマンティックセグメンテーション用デコーダーである動的ニューラル表現デコーダー(NRD)を提案する。エンコーダー特徴量からこれらのニューラル表現を動的に生成し、ラベルの滑らかさを活用することで、DeeplabV3+ よりも最大30%少ない計算コストで最先端の精度を達成している。

ABSTRACT

Semantic segmentation requires per-pixel prediction for a given image. Typically, the output resolution of a segmentation network is severely reduced due to the downsampling operations in the CNN backbone. Most previous methods employ upsampling decoders to recover the spatial resolution. Various decoders were designed in the literature. Here, we propose a novel decoder, termed dynamic neural representational decoder (NRD), which is simple yet significantly more efficient. As each location on the encoder's output corresponds to a local patch of the semantic labels, in this work, we represent these local patches of labels with compact neural networks. This neural representation enables our decoder to leverage the smoothness prior in the semantic label space, and thus makes our decoder more efficient. Furthermore, these neural representations are dynamically generated and conditioned on the outputs of the encoder networks. The desired semantic labels can be efficiently decoded from the neural representations, resulting in high-resolution semantic segmentation predictions. We empirically show that our proposed decoder can outperform the decoder in DeeplabV3+ with only 30% computational complexity, and achieve competitive performance with the methods using dilated encoders with only 15% computation. Experiments on the Cityscapes, ADE20K, and PASCAL Context datasets demonstrate the effectiveness and efficiency of our proposed method.

研究の動機と目的

  • 低解像度のエンコーダー特徴量から高解像度のセマンティック予測を回復する際の従来のデコーダーの非効率性を解消すること。
  • 局所的な滑らかさなどのセマンティックラベル空間内の構造的プライオリティを活用して、デコーディングの効率性と精度を向上させること。
  • PCA などの線形次元削減に依存せずに、ラベル依存性を暗黙的にモデル化できるコンパクトで学習可能なデコーダーを設計すること。
  • エンコーダー特徴量に条件づけた動的生成によってニューラル表現を生成することで、エンドツーエンドの学習を可能にすること。
  • 拡張畳み込みや高解像度バックボーンを用いる最先端手法と比較して、顕著に低い計算複雑性で競争力のある性能を達成すること。

提案手法

  • 各セマンティックラベルの局所的パッチは、パラメータ $ \boldsymbol{\theta} $ を持つコンパクトなニューラルネットワーク $ g_{\boldsymbol{\theta}}(\cdot) $ で表現され、座標マップとガイダンスマップを入力としてラベルを予測する。
  • ニューラル表現のパラメータ $ \boldsymbol{\theta} $ は、各空間的位置でエンコーダー特徴量に条件づけられた軽量ネットワークによって動的に生成される。
  • デコーダーは、座標マップ $ (x,y) $ とガイダンスマップ $ m $ をニューラル表現ネットワークの入力として用い、ピクセルごとのセマンティックラベルを予測する。
  • ニューラル表現の動的生成により、ラベル空間における滑らかさの事前知識を暗黙的に活用でき、一般化性能と効率性が向上する。
  • 全アーキテクチャはエンドツーエンド学習をサポートしており、ニューラル表現デコーダーを標準的なエンコーダ-デコーダー・セグメンテーションフレームワークに統合できる。
  • 重い空洞畳み込みや複雑なマルチスケール統合を避けており、代わりにコンパクトで条件付きに生成されたニューラル表現を用いて効率的なアップサンプリングを実現している。

実験結果

リサーチクエスチョン

  • RQ1局所的なセマンティックラベルパッチのニューラル表現は、高解像度セマンティックセグメンテーションにおけるデコーディングの効率性と精度を向上させ得るか?
  • RQ2動的に生成されたニューラル表現は、セマンティックラベル空間における滑らかさの事前知識を効果的に活用できるか?
  • RQ3コンパクトで学習可能なデコーダーは、PCA に依存する従来のデコーダーよりも顕著に低い計算コストで優れた性能を達成できるか?
  • RQ4提案手法は、FLOPs の半分未満で最先端のモデルと同等の性能を達成できるか?
  • RQ5動的ニューラル表現デコーダーは、標準的なエンコーダ-デコーダー構造に効果的に統合され、エンドツーエンド学習が可能か?

主な発見

  • Cityscapes において、ResNet-50 を用いた NRD は、234.6 GFlops の計算量で 80.0% mIoU(マルチスケール)を達成し、243.9 GFlops の SFNet(79.5% mIoU)を上回った。
  • ResNet-101 を用いた NRD は、Cityscapes で 390.0 GFlops の計算量で 80.5% mIoU を達成し、81.5% mIoU を記録した RGNet と同等の性能を示したが、計算コストはその 30%未満であった。
  • ADE20K では、NRD は 59 クラスで 54.1% mIoU、60 クラスで 49.0% mIoU を達成し、82.7 GFlops を要する HRNet-W48 を上回ったが、計算量は 42.9 GFlops にとどまった。
  • DeeplabV3+ よりも約30%の計算複雑性を削減しながら、すべてのベンチマークで優れたもしくは同等の性能を達成した。
  • 空洞畳み込みを用いる最先端手法と比較して、計算量の15%未満で競争力のある性能を達成し、優れた速度・精度トレードオフを示した。
  • アブレーションスタディの結果、バイリニア補間やPCAベースのベースラインと比較して、動的ニューラル表現が顕著に性能向上をもたらしたことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。