Skip to main content
QUICK REVIEW

[論文レビュー] Class-wise Dynamic Graph Convolution for Semantic Segmentation

Hanzhe Hu, Deyi Ji|arXiv (Cornell University)|Jul 19, 2020
Advanced Neural Network Applications参考文献 42被引用数 16
ひとこと要約

本論文では、粗い予測からクラス固有のグラフを構築し、動的にハードな正例および負例をサンプリングすることで、適応的で文脈に配慮した特徴抽出を実現する、新たなモジュールであるクラス別ダイナミックグラフ畳み込み(CDGC)を提案する。CDGCを基盤とするCDGCNetは、Cityscapes(82.0% mIOU)、PASCAL VOC 2012(83.9% mIOU)、COCO Stuff(40.7% mIOU)で最先端性能を達成し、優れた境界保持性と文脈的推論能力を示している。

ABSTRACT

Recent works have made great progress in semantic segmentation by exploiting contextual information in a local or global manner with dilated convolutions, pyramid pooling or self-attention mechanism. In order to avoid potential misleading contextual information aggregation in previous works, we propose a class-wise dynamic graph convolution (CDGC) module to adaptively propagate information. The graph reasoning is performed among pixels in the same class. Based on the proposed CDGC module, we further introduce the Class-wise Dynamic Graph Convolution Network(CDGCNet), which consists of two main parts including the CDGC module and a basic segmentation network, forming a coarse-to-fine paradigm. Specifically, the CDGC module takes the coarse segmentation result as class mask to extract node features for graph construction and performs dynamic graph convolutions on the constructed graph to learn the feature aggregation and weight allocation. Then the refined feature and the original feature are fused to get the final prediction. We conduct extensive experiments on three popular semantic segmentation benchmarks including Cityscapes, PASCAL VOC 2012 and COCO Stuff, and achieve state-of-the-art performance on all three benchmarks.

研究の動機と目的

  • ピクセル単位のセマンティックセグメンテーションにおいて、長距離の文脈的情報を効果的に統合する手法の限界を解消すること。
  • 意味的に異なる領域からの特徴を無差別に統合することで生じる特徴学習の非特徴的化という問題を克服すること。
  • 推論中に困難なサンプルに注目するクラス固有の動的グラフ構造を活用することで、特徴表現を向上させること。
  • グラフに基づく特徴精錬を用いて初期予測を段階的に改善する粗〜細のフレームワークを開発すること。
  • 改善された文脈モデリングと境界保持性により、主要ベンチマークで最先端の性能を達成すること。

提案手法

  • 粗いセグメンテーション予測をクラスマスクとして用い、各セマンティッククラスごとにノード特徴を抽出することで、クラス別グラフを構築する。
  • 各クラス固有のグラフ上で動的グラフ畳み込みを実行し、エッジ重みを特徴の類似度に基づいて動的に学習する。
  • 困難なピクセルに注目するために、ハード正例およびハード負例をグラフ構築プロセスに組み込む。
  • 二本の特徴精錬機構を用いる:グラフ畳み込みにより元の特徴マップを精錬し、それを元の特徴と統合して最終予測を生成する。
  • 基本的なセグメンテーションネットワーク(例:ResNet-101 + ASPP)にCDGCモジュールを粗〜細のパラダイムで統合する。
  • 推論時にマルチスケールおよびフリップ増強を適用して、さらなる性能向上を図る。

実験結果

リサーチクエスチョン

  • RQ1クラス固有のグラフ構築は、セマンティックセグメンテーションにおける長距離の文脈的推論を改善できるか?
  • RQ2一様または固定のサンプリングと比較して、ハード正例およびハード負例の動的サンプリングは特徴学習を向上させるか?
  • RQ3グローバル自己注意または標準的なGCNと比較して、クラス別グラフ畳み込みは特徴の特徴抽出能および境界精度において優れているか?
  • RQ4グラフ精錬を用いた粗〜細フレームワークは、標準ベンチマークにおけるmIOUをどの程度向上させるか?
  • RQ5複雑な都市環境やごみだらけのシーンにおいて、ハードサンプルマイニングの貢献度はどの程度か?

主な発見

  • Cityscapesの検証セットにおいて、CDGCNetは82.0% mIOUを達成し、以前の最先端手法を上回った。
  • PASCAL VOC 2012では、CDGCNetが83.9% mIOUを達成し、比較対象のすべての先行手法を上回った。
  • COCO Stuffでは、CDGCNetが40.7% mIOUを達成し、この挑戦的なデータセットで新たな最先端性能を樹立した。
  • アブレーションスタディの結果、ハード負例の組み込みにより、Cityscapesでの性能が80.5%から81.1% mIOUに向上した。
  • 可視化結果から、CDGCモジュールが特にオブジェクト境界付近の困難なサンプルを効果的に処理し、細部を保持していることが示された。
  • マルチスケールおよびフリップ増強の組み合わせにより、Cityscapesでの性能が0.8%向上し、本手法のロバスト性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。