Skip to main content
QUICK REVIEW

[論文レビュー] Referring Expression Grounding by Marginalizing Scene Graph Likelihood

Daqing Liu, Hanwang Zhang|arXiv (Cornell University)|Jun 9, 2019
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、シーングラフを用いてオブジェクト、属性、関係性をモデル化し、条件付きランダムフィールドと和積ブールドプルービングを用いてラベルなしコンテキスト上で推論する、参照表現定位のための新規手法Marginalized Scene Graph Likelihood (MSGL)を提案する。MSGLは3つのベンチマークで最先端の性能を達成するとともに、文に言及されたすべてのオブジェクトの解釈可能で完全な定位を実現する。

ABSTRACT

We focus on task of grounding referring expressions images, e.g., localizing the white truck front of a one. To resolve this task fundamentally, one should first find out contextual objects (e.g., yellow truck) and then exploit them to disambiguate referent from other similar objects, by using attributes and relationships (e.g., white, yellow, in front of). However, it is extremely challenging to train such a model as ground-truth of contextual objects and their relationships are usually missing due to prohibitive annotation cost. Therefore, nearly all existing methods attempt to evade above joint grounding and reasoning process, but resort to a holistic association between sentence and region feature. As a result, they suffer from heavy parameters of fully-connected layers, poor interpretability, and limited generalization to unseen expressions. In this paper, we tackle this challenge by training and inference with proposed Marginalized Scene Graph Likelihood (MSGL). Specifically, we use scene graph: a graphical representation parsed from referring expression, where nodes are objects with attributes and edges are relationships. Thanks to conditional random field (CRF) built on scene graph, we can ground every object to its corresponding region, and perform reasoning with unlabeled contexts by marginalizing out them using sum-product belief propagation. Overall, our proposed MSGL is effective and interpretable, e.g., on three benchmarks, MSGL consistently outperforms state-of-the-arts while offers a complete grounding of all objects a sentence.

研究の動機と目的

  • 高いアノテーションコストのため、画像内での参照表現定位において、真のコンテキストオブジェクトや関係性がほとんど入手できないという課題に対処すること。
  • 全文と領域の統合的関係に依存する従来の手法が抱える、パラメータ数の増加、解釈不能性、一般化性能の低さといった制限を克服すること。
  • 構造的なシーングラフ表現を用いて、参照表現内のオブジェクト、属性、関係性を統合的に推論できること。
  • 条件付きランダムフィールド上での和積信念伝搬を用いて、ラベルなしコンテキストオブジェクトを周辺化する学習および推論フレームワークを開発すること。
  • 文に含まれるすべてのオブジェクトをその対応する画像領域に定位させることで、高い性能と解釈可能性を両立させること

提案手法

  • オブジェクトに属性を付加したノードと、オブジェクト間の関係性を表すエッジを持つシーングラフを、参照表現から構築する。
  • オブジェクト予測とその空間的・意味的関係性の間の依存関係をモデル化するため、シーングラフ上に条件付きランダムフィールド(CRF)を構築する。
  • 推論時にラベルなしコンテキストオブジェクトを周辺化するために和積信念伝搬を用い、すべてのオブジェクトに完全な監視が必要ない状態でも頑健な推論を可能にする。
  • エンドツーエンド学習を可能にするために、シーングラフの周辺化尤度を最大化する微分可能目的関数を用いてモデルを学習する。
  • 局所的特徴と関係的文脈の両方を活用して、シーングラフ内の各オブジェクトの最も確率の高い領域を予測することで定位を実行する。
  • シーングラフ解析と定位を統合したフレームワークを構築し、統合的推論と解釈を可能にする

実験結果

リサーチクエスチョン

  • RQ1シーングラフベースの表現は、参照表現定位モデルの解釈可能性と性能を向上させるか?
  • RQ2信念伝搬によるラベルなしコンテキストオブジェクトの周辺化は、完全にアノテートされた関係性への依存を軽減するのにどの程度有効か?
  • RQ3属性と関係性を明示的にモデル化することは、統合的文領域マッチングと比較して、未観測の参照表現における一般化性能を向上させるか?
  • RQ4CRFベースの構造的予測フレームワークは、文に含まれるすべてのオブジェクトを完全に定位させながら、最先端の結果を達成できるか?
  • RQ5提案手法MSGLは、多様なベンチマークにおいて、精度と頑健性の観点から、既存手法をどの程度上回るか?

主な発見

  • MSGLは3つの標準的参照表現定位ベンチマークで最先端の性能を達成し、常に先行手法を上回る。
  • モデルは、参照対象オブジェクトだけでなく、コンテキストオブジェクトを含め、文に言及されたすべてのオブジェクトを完全に定位する。
  • ラベルなしコンテキストを周辺化することで、完全にアノテートされた関係性への依存が軽減され、頑健性と一般化性能が向上する。
  • シーングラフとCRFベースの推論を用いることで、モデルの解釈性が向上し、関係性や属性が定位意思決定にどのように寄与しているかを追跡可能になる。
  • 関係性の構造的モデリングにより、完全連結層ベースのアプローチと比較して、少ないパラメータ数で高い精度を達成できる。
  • 和積信念伝搬により、すべてのオブジェクトに真の関係性がアノテートされていなくても、複雑な関係構造に対して効果的な推論が可能になる

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。