Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic-structured Semantic Propagation Network

Xiaodan Liang, Hongfei Zhou|arXiv (Cornell University)|Mar 16, 2018
Advanced Neural Network Applications参考文献 33被引用数 6
ひとこと要約

本稿では、動的構造的ニューロングラフを介して意味的コンセプト階層を明示的にモデル化する、動的構造的意味的伝搬ネットワーク(DSSPN)という新しいセマンティックセグメンテーションフレームワークを提案する。各画像に対して関連するニューロンのみを活性化することで、すべての先祖ニューロンからの知識を密接に伝搬する、密度の高い意味的強化ブロックを用いる。DSSPNは4つのベンチマークで最先端の性能を達成し、異なるデータセットにまたがる統合的モデル訓練を可能にし、タスク固有のファインチューニングを上回る。

ABSTRACT

Semantic concept hierarchy is still under-explored for semantic segmentation due to the inefficiency and complicated optimization of incorporating structural inference into dense prediction. This lack of modeling semantic correlations also makes prior works must tune highly-specified models for each task due to the label discrepancy across datasets. It severely limits the generalization capability of segmentation models for open set concept vocabulary and annotation utilization. In this paper, we propose a Dynamic-Structured Semantic Propagation Network (DSSPN) that builds a semantic neuron graph by explicitly incorporating the semantic concept hierarchy into network construction. Each neuron represents the instantiated module for recognizing a specific type of entity such as a super-class (e.g. food) or a specific concept (e.g. pizza). During training, DSSPN performs the dynamic-structured neuron computation graph by only activating a sub-graph of neurons for each image in a principled way. A dense semantic-enhanced neural block is proposed to propagate the learned knowledge of all ancestor neurons into each fine-grained child neuron for feature evolving. Another merit of such semantic explainable structure is the ability of learning a unified model concurrently on diverse datasets by selectively activating different neuron sub-graphs for each annotation at each step. Extensive experiments on four public semantic segmentation datasets (i.e. ADE20K, COCO-Stuff, Cityscape and Mapillary) demonstrate the superiority of our DSSPN over state-of-the-art segmentation models. Moreoever, we demonstrate a universal segmentation model that is jointly trained on diverse datasets can surpass the performance of the common fine-tuning scheme for exploiting multiple domain knowledge.

研究の動機と目的

  • 既存のセマンティックセグメンテーションモデルにおける意味的コンセプト階層の明示的モデリングの欠如に対処すること。
  • データセット間でのラベルの不一致に起因するタスク固有モデルの限界を克服すること。
  • 異なるラベル語彙を持つ多様なデータセットに一般化可能な統合的セグメンテーションモデルを可能にすること。
  • 動的で構造化されたネットワーク計算を通じて、階層的意味的相関を活用して特徴表現を向上させること。
  • 各画像ごとに関連するサブグラフのみを活性化することで、高い効率性と性能を達成すること。

提案手法

  • 各ニューロンが事前に定義されたコンセプト階層内の特定のコンセプト(例:'food' や 'pizza')に対応する意味的ニューロングラフを構築する。
  • トレーニングおよび推論時に、各画像のターゲットラベルに関連するニューロンサブグラフのみを活性化することで、動的構造的伝搬を実行する。
  • 親ニューロンの特徴を統合するのではなく、すべての先祖ニューロンからの特徴を融合する、密な意味的強化ニューラルブロックを導入し、DenseNetにインspiredする。
  • クラス間競合を回避し、部分的なラベルオーバーラップを持つ複数のデータセット間での共同学習を可能にするために、ピクセル単位のシグモイドとバイナリクロスエントロピー損失を用いる。
  • テスト時に階層の各レベルで混乱しやすいコンセプトを区別するように焦点を当てる、階層的予測スキームを採用することで、効率的な学習を実現する。
  • 複数の先祖からの特徴を加算することで統合するなど、柔軟なグラフ構造(複数の先祖ノードを含む)をサポートする。

実験結果

リサーチクエスチョン

  • RQ1意味的コンセプト階層の明示的統合が、多様なデータセットにまたがるセマンティックセグメンテーションにおける一般化性能を向上させるか?
  • RQ2意味的階層に基づく動的サブグラフ活性化が、モデルの効率性と性能にどのように影響するか?
  • RQ3親ニューロンのみまたは和集合ベースの集約と比較して、すべての先祖からの密な特徴伝搬が特徴表現をどのように改善するか?
  • RQ4複数のデータセットでトレーニングされた単一の統合モデルが、タスク固有のファインチューニングモデルを上回る性能を発揮できるか?
  • RQ5オープンボリューム、マルチデータセットトレーニングにおいて、損失関数の選択(シグモイド対Softmax)が性能にどのように影響するか?

主な発見

  • DSSPNは、ADE20K、COCO-Stuff、Cityscapes、Mapillaryの4つの公的ベンチマークで最先端の性能を達成した。
  • 複数のデータセットにまたがって統合的にトレーニングされたDSSPNモデルは、マルチドメイン知識を活用するための標準的なファインチューニング手法を上回る性能を示した。
  • シグモイド損失とバイナリクロスエントロピーを組み合わせた手法は、特にラベルオーバーラップが部分的な状況において、Softmax損失を著しく上回った。
  • 動的構造的伝搬スキームにより、総パラメータ数が増加しても、各画像ごとに関連するニューロンサブグラフのみを活性化することで、計算コストとメモリ使用量を削減した。
  • 特徴の連結を用いた密な意味的強化ブロックは、特徴の加算や密接続なしのバージョンよりも優れた性能を発揮し、効率性を維持したまま性能を向上させた。
  • 中程度の小さな隠れ特徴マップサイズ(m=48)が、主要な特徴を捉えるのに十分であることが示され、良好なパrameter効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。