Skip to main content
QUICK REVIEW

[論文レビュー] Joint Visual Grounding with Language Scene Graphs

Daqing Liu, Hanwang Zhang|arXiv (Cornell University)|Jun 9, 2019
Multimodal Machine Learning Applications参考文献 54被引用数 7
ひとこと要約

本稿では、言語的シーングラフと信念伝播による要因グラフの周辺化を活用することで、参照対象と文脈的対象を同時に接地する、新たなフレームワークであるJoint Visual Grounding with Language Scene Graphs (JVGN) を提案する。この手法は、複数のベンチマークで最先端の性能を達成するとともに、オブジェクト、属性、関係性を統合的にモデル化することにより、解釈可能で構成的ないくつかの要因を統合的にモデル化することにより、解釈可能で構成的な推論を実現する。

ABSTRACT

Visual grounding is a task to ground referring expressions in images, e.g., localize "the white truck in front of the yellow one". To resolve this task fundamentally, the model should first find out the contextual objects (e.g., the "yellow" truck) and then exploit them to disambiguate the referent from other similar objects by using the attributes and relationships (e.g., "white", "yellow", "in front of"). However, due to the lack of annotations on contextual objects and their relationships, existing methods degenerate the above joint grounding process into a holistic association between the expression and regions, thus suffering from unsatisfactory performance and limited interpretability. In this paper, we alleviate the missing-annotation problem and enable the joint reasoning by leveraging the language scene graph which covers both labeled referent and unlabeled contexts (other objects, attributes, and relationships). Specifically, the language scene graph is a graphical representation where the nodes are objects with attributes and the edges are relationships. We construct a factor graph based on it and then perform marginalization over the graph, such that we can ground both referent and contexts on corresponding image regions to achieve the joint visual grounding (JVG). Experimental results demonstrate that the proposed approach is effective and interpretable, e.g., on three benchmarks, it outperforms the state-of-the-art methods while offers a complete grounding of all the objects mentioned in the referring expression.

研究の動機と目的

  • 既存の視覚的接地手法が文と画像領域の包括的関連として接地を扱うため、文脈的対象や関係性を無視するという限界に対処すること。
  • 構造的な言語的構成を活用することで、参照表現に言及されるすべてのオブジェクト(参照対象および文脈的実体)を統合的に推論可能にする。
  • 文脈的対象のアノテーションが欠落している課題を、言語的シーングラフから構築された要因グラフにおける周辺化によって克服すること。
  • グラフィカル構造にオブジェクトの属性と関係性を明示的にモデル化することで、モデルの解釈可能性と一般化性能を向上させること。
  • 標準ベンチマークで最先端の性能を達成するとともに、表現に言及されるすべてのエンティティの完全な接地を提供すること。

提案手法

  • 参照表現からオフザシェルフのパーサーを用いて言語的シーングラフを構築し、ノードに属性付きのオブジェクト、エッジに関係性を割り当てる。
  • 言語的シーングラフに基づいて要因グラフを構築し、画像領域をノードの潜在的ラベルとして用い、視覚言語関連性を条件付きランダムフィールド(CRF)でモデル化する。
  • 学習済みの視覚言語埋め込みと特徴量の連結を用いて単一および二項のポテンシャルを定義し、スコアは多層パーセプトロンを介して計算する。
  • 要因グラフ上で和積信念伝播を適用し、すべてのノードの周辺確率を計算することで、参照対象および文脈的対象の間で統合推論を可能にする。
  • 参照ノードの真値とのKLダイバージェンス損失を定義し、チェーンルールに従って全グラフを通過する勾配逆伝播でモデルを学習する。
  • メッセージパッシングを用いてラベルなしの文脈的ノードを周辺化し、完全なアノテーションがなくても、参照対象と文脈を同時に推論できるようにする。

実験結果

リサーチクエスチョン

  • RQ1参照対象のみがアノテーションされている状況において、構造的な言語的構成を活用することで、統合的視覚的接地を効果的に達成できるか?
  • RQ2言語的シーングラフに基づくグラフィカルモデルは、視覚的接地における解釈可能性と性能をどのように向上させるか?
  • RQ3ラベルなしの文脈的ノードに対する周辺化は、接地精度と推論の整合性をどの程度向上させるか?
  • RQ4視覚言語ポテンシャルを有する要因グラフは、参照表現内の複数のエンティティにわたる統合推論を可能にするか?
  • RQ5提案手法は、包括的接地モデルと比較して、未観測の表現への一般化性能が優れているか?

主な発見

  • 提案されたJVGNモデルは、RefCOCO、RefCOCO+、RefCOCOgという3つの主要ベンチマークで最先端の性能を達成し、既存手法を上回っている。
  • RefCOCOgのテストセットでは、トップ1正答率72.47%、トップ5正答率63.68%を達成し、DGA や VC といった先行手法を上回っている。
  • モデルは、参照対象および文脈的対象を含め、参照表現に言及されるすべてのエンティティを完全に接地しており、解釈可能性が向上している。
  • 定性的な結果から、信念伝播が初期の単一ポテンシャルを効果的に改善し、シーングラフ内のすべてのノードにおいてより正確で整合性のある接地を実現していることが示された。
  • 失敗事例から、モデルは曖昧またはレアな属性や関係性に対しては苦労しており、稀なエンティティの認識における改善の余地があることが示唆された。
  • アブレーションスタディにより、周辺化とメッセージパッシングが統合的推論に不可欠であることが確認され、それらを除去すると性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。