Skip to main content
QUICK REVIEW

[論文レビュー] Visual Relationship Detection using Scene Graphs: A Survey

Aniket Agarwal, Ayush Mangal|arXiv (Cornell University)|May 16, 2020
Multimodal Machine Learning Applications参考文献 97被引用数 13
ひとこと要約

本調査では、要因分解可能なネットワーク(Factorizable-Net)を提示する。この手法は、シーングラフを用いた効率的な視覚的関係検出のためのもので、関係予測タスクを意味的に類似した対象ペアの部分グラフに分解することで、計算コストを低減する。空間重み付きメッセージパッシングとスパースグラフ生成戦略を用いることで、Visual Genomeで最先端の性能を達成するとともに、長尾分布の関係に対して一般化性能を向上させる。

ABSTRACT

Understanding a scene by decoding the visual relationships depicted in an image has been a long studied problem. While the recent advances in deep learning and the usage of deep neural networks have achieved near human accuracy on many tasks, there still exists a pretty big gap between human and machine level performance when it comes to various visual relationship detection tasks. Developing on earlier tasks like object recognition, segmentation and captioning which focused on a relatively coarser image understanding, newer tasks have been introduced recently to deal with a finer level of image understanding. A Scene Graph is one such technique to better represent a scene and the various relationships present in it. With its wide number of applications in various tasks like Visual Question Answering, Semantic Image Retrieval, Image Generation, among many others, it has proved to be a useful tool for deeper and better visual relationship understanding. In this paper, we present a detailed survey on the various techniques for scene graph generation, their efficacy to represent visual relationships and how it has been used to solve various downstream tasks. We also attempt to analyze the various future directions in which the field might advance in the future. Being one of the first papers to give a detailed survey on this topic, we also hope to give a succinct introduction to scene graphs, and guide practitioners while developing approaches for their applications.

研究の動機と目的

  • オブジェクト数の増加に伴い、完全結合型シーングラフの計算非効率性を解消すること。
  • すべてのペアワイズ関係を処理する代わりに、意味的に類似した対象ペアを部分グラフにグループ化することで、重複する関係候補を削減すること。
  • 対象-関係共起の事前知識を組み込むことで、長尾分布の関係クラスにおけるモデルの一般化性能を向上させること。
  • グラフ構築プロセスにおける非微分可能要素を扱うハイブリッド学習戦略を開発すること。
  • 要因分解接続グラフを介して部分グラフとオブジェクト間でメッセージパッシングを実施し、特徴の精練を向上させること。

提案手法

  • 共有ベースの畳み込みニューラルネットワーク(CNN)を用いたRPNを用い、オブジェクト領域候補を生成し、検出されたオブジェクト間に完全結合グラフを構築する。
  • 結合ボックスの信頼度と非最大抑制(NMS)を基に、対象ペアを部分グラフにグループ化することで、冗長性を低減する。
  • 部分グラフの2次元特徴マップとオブジェクトの1次元ベクトルを抽出するためのROIプーリングを適用し、空間的および意味的特徴の統合を可能にする。
  • 要因分解されたグラフに沿って注意に基づくメッセージパッシングを実行する空間重み付きメッセージパッシング(SMP)モジュールを採用し、オブジェクトおよび部分グラフの特徴を精練する。
  • 統合された文脈、境界ボックス、およびRoIAlign特徴を用いて述語を予測する空間感受性関係推論モジュール(SRI)を導入する。
  • ハイブリッド学習戦略を採用:木構造の構築における非微分可能スコア行列Sには方策勾配法を、その他のすべてのパラメータには教師あり学習を適用する。

実験結果

リサーチクエスチョン

  • RQ1関係予測の正確性を損なわせることなく、シーングラフ構築をどのようにしてより効率化できるか?
  • RQ2部分グラフの要因分解は、視覚的関係検出における重複する関係候補の数をどの程度削減できるか?
  • RQ3対象-関係の共起に関する事前知識を組み込むことで、長尾関係クラスにおける性能向上が達成できるか?
  • RQ4標準的なGCNと比較して、要因分解されたグラフ上でメッセージパッシングを実行することで、特徴表現がどのように向上するか?
  • RQ5非微分可能なコンponentsを含むシーングラフモデルの学習において、強化学習と教師あり学習を組み合わせた場合の影響は何か?

主な発見

  • Factorizable-Netは、意味的に類似した対象ペアを部分グラフにグループ化することで関係候補の数を削減し、計算コストを顕著に低減する。
  • Visual Genomeデータセットにおいて最先端の性能を達成しており、視覚的関係検出における平均平均精度(mAP)で先行研究を上回る。
  • 非微分可能なスコア行列Sのグラフ構築プロセスに対しても、ハイブリッド学習戦略により効果的な学習が可能である。
  • SMPおよびSRIモジュールは、空間的および文脈的ヒントを効果的に活用することで、特徴精錬および述語分類を向上させる。
  • 対象クラスと関係の間の統計的相関を明示的にモデル化することで、長尾関係において一般化性能が向上している。
  • 単純なベースライン(与えられた対象ペアに対して頻度の高い関係を予測するもの)ですら、先行SOTA比で3.6%の相対的改善を達成しており、データセットに強いバイアスが存在していることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。