Skip to main content
QUICK REVIEW

[論文レビュー] Bidirectional Graph Reasoning Network for Panoptic Segmentation

Yangxin Wu, Gengwei Zhang|arXiv (Cornell University)|Apr 14, 2020
Advanced Neural Network Applications参考文献 36被引用数 8
ひとこと要約

本稿では、前景オブジェクト(things)と背景領域(stuff)の間の双方向で学習可能な情報伝達を、グラフ畳み込みネットワークを用いてモデル化する、パンタピクスセグメンテーションのための新規フレームワークであるBidirectional Graph Reasoning Network(BGRNet)を提案する。インスタンス分岐およびセマンティック分岐において画像固有のグラフを構築し、Bidirectional Graph Connection Moduleを導入することで、意味的関係および共起関係を捉える。COCOおよびADE20Kベンチマークにおいて、それぞれ50.8 PQおよび43.1 PQの最先端性能を達成した。

ABSTRACT

Recent researches on panoptic segmentation resort to a single end-to-end network to combine the tasks of instance segmentation and semantic segmentation. However, prior models only unified the two related tasks at the architectural level via a multi-branch scheme or revealed the underlying correlation between them by unidirectional feature fusion, which disregards the explicit semantic and co-occurrence relations among objects and background. Inspired by the fact that context information is critical to recognize and localize the objects, and inclusive object details are significant to parse the background scene, we thus investigate on explicitly modeling the correlations between object and background to achieve a holistic understanding of an image in the panoptic segmentation task. We introduce a Bidirectional Graph Reasoning Network (BGRNet), which incorporates graph structure into the conventional panoptic segmentation network to mine the intra-modular and intermodular relations within and between foreground things and background stuff classes. In particular, BGRNet first constructs image-specific graphs in both instance and semantic segmentation branches that enable flexible reasoning at the proposal level and class level, respectively. To establish the correlations between separate branches and fully leverage the complementary relations between things and stuff, we propose a Bidirectional Graph Connection Module to diffuse information across branches in a learnable fashion. Experimental results demonstrate the superiority of our BGRNet that achieves the new state-of-the-art performance on challenging COCO and ADE20K panoptic segmentation benchmarks.

研究の動機と目的

  • 従来のパンタピクスセグメンテーションモデルが、前景オブジェクト(things)と背景領域(stuff)の間の意味的および共起関係を明示的にモデル化できないという限界に対処すること。
  • インスタンス分岐とセマンティック分岐の間での相互特徴強化を可能にすることで、包括的なシーン理解を向上させること。
  • 既存のパンタピクスセグメンテーションアーキテクチャにグラフ推論を統合できる、柔軟でエンドツーエンドで訓練可能なモジュールを開発すること。
  • 学習されたグラフ構造を通じた双方向情報伝達を活用することで、大規模ベンチマークで最先端の性能を達成すること。

提案手法

  • マルチヘッドアテンションを用いてインスタンス分岐の領域特徴から、インスタンス内およびインスタンス間の関係をモデル化するThing-Graphを構築する。
  • セマンティック分岐の局所的特徴からカテゴリ中心を抽出することで、背景カテゴリを表すStuff-Graphを生成する。
  • アテンションベースの隣接行列を用いて、thingsとstuffのグラフ間で学習可能で双方向の特徴伝搬を可能にするBidirectional Graph Connection Moduleを導入する。
  • 拡散されたグラフノード特徴を元の特徴空間に再投影することで、両分岐における視覚的表現を精緻化する。
  • 動的隣接行列を計算するためにマルチヘッドアテンションを用い、固定された言語的または意味的類似度を超える、複雑でシーン固有の関係を捉える。
  • さまざまなバックボーンを搭載した既存の二分岐パンタピクスセグメンテーションネットワークの上にモジュールをスタックすることで、エンドツーエンドの訓練を可能にする。

実験結果

リサーチクエスチョン

  • RQ1thingsとstuffの間の明示的な双方向関係のモデル化が、パンタピクスセグメンテーションの性能向上に寄与するか?
  • RQ2学習可能なグラフベースの特徴伝搬が、単方向または固定知識グラフ接続と比較して、シーンレベルの文脈をどれほど効果的に捉えられるか?
  • RQ3意味的類似度や固定知識グラフと比較して、アテンションベースのグラフ構築が性能に与える影響は何か?
  • RQ4双方向情報伝達が、インスタンス分岐およびセマンティック分岐の両方における特徴精緻化に、単方向強化よりも優れているか?
  • RQ5クラス中心に基づくstuffグラフは、曖昧または重複する背景領域を効果的に表現できるか?

主な発見

  • BGRNetは、COCOパンタピクスセグメンテーションベンチマークで50.8 PQという新たな最先端性能を達成した。
  • ADE20Kデータセットでは、43.1 PQを達成し、新たなSOTA結果を樹立した。
  • 提案されたBidirectional Graph Connection Moduleは、単方向強化よりも0.3 PQ高い性能を示し、二重方向情報伝達の利点を実証した。
  • アテンションベースのグラフ接続機構は31.8 PQを達成し、意味的類似度ベースの接続で得られた31.5 PQを上回った。
  • アブレーションスタディにより、thingsのためのアテンションベースのグラフ構築と、stuffのためのクラス中心ベースのグラフ構築が、性能と計算コストの最良のトレードオフを実現することが確認された。
  • 可視化結果から、クラス中心が、クラスの曖昧性や境界の曖昧さがあるシーンでさえも、局所的特徴の精緻化を効果的に導くことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。