Skip to main content
QUICK REVIEW

[論文レビュー] Learning Cross-modal Context Graph for Visual Grounding

Yongfei Liu, Bo Wan|arXiv (Cornell University)|Nov 20, 2019
Multimodal Machine Learning Applications参考文献 35被引用数 8
ひとこと要約

本稿では、モジュラーなグラフニューラルネットワークを用いてフレーズと視覚的オブジェクト間のグローバルな文脈と関係性をモデル化する言語誘導型クロスモーダルグラフネットワークを提案する。これにより、グローバルに一貫性のある視覚的オブジェクトの位置特定が可能となる。言語と視覚的シーングラフを構築し、文脈に配慮した表現学習にメッセージパッシングを用いることで、Flickr30K Entitiesベンチマークで76.19%の最先端性能を達成した。

ABSTRACT

Visual grounding is a ubiquitous building block in many vision-language tasks and yet remains challenging due to large variations in visual and linguistic features of grounding entities, strong context effect and the resulting semantic ambiguities. Prior works typically focus on learning representations of individual phrases with limited context information. To address their limitations, this paper proposes a language-guided graph representation to capture the global context of grounding entities and their relations, and develop a cross-modal graph matching strategy for the multiple-phrase visual grounding task. In particular, we introduce a modular graph neural network to compute context-aware representations of phrases and object proposals respectively via message propagation, followed by a graph-based matching module to generate globally consistent localization of grounding phrases. We train the entire graph neural network jointly in a two-stage strategy and evaluate it on the Flickr30K Entities benchmark. Extensive experiments show that our method outperforms the prior state of the arts by a sizable margin, evidencing the efficacy of our grounding framework. Code is available at "https://github.com/youngfly11/LCMCG-PyTorch".

研究の動機と目的

  • 視覚的および言語的特徴の変動に起因する高い意味的曖昧性を示す複雑なシーンにおける視覚的オブジェクトの位置特定の課題に対処する。
  • 従来の手法がフレーズを独立して扱い、長距離の依存関係やグローバルな文脈を無視するという限界を克服する。
  • 言語的記述内のフレーズ関係とそれに対応する視覚的オブジェクト間の関係をモデル化することで、位置特定の正確性を向上させる。
  • 文脈に配慮した表現とモダリティ間のグローバルマッチングを最適化する、統合的かつエンドツーエンドで学習可能なフレームワークを開発する。
  • 誤検出を低減し、マッチング効率を向上させるために、言語的文脈に従って選択的かつ高品質なオブジェクト候補を生成できるようにする。

提案手法

  • ノームフレーズをノードとし、それらの間の意味的関係をエンコードするエッジを備えた言語的シーングラフをテキスト記述から構築する。
  • フレーズグラフネットワーク(PGN)を用い、メッセージパッシングにより言語的シーングラフ上で文脈に配慮した表現を伝搬する。
  • PGNによるフレーズグラフを用いて視覚的オブジェクト候補の選択を誘導し、関連するオブジェクト候補をノードとし、言語的関係を模倣するエッジを持つ視覚的シーングラフを構築する。
  • 視覚的オブジェクトグラフネットワーク(VOGN)を用い、視覚的シーングラフ上でメッセージパッシングにより文脈に配慮した視覚的表現を計算する。
  • ノード特徴とエッジ関係を、言語的グラフと視覚的グラフの間で比較することで、グローバルマッチングを実行するグラフ類似度ネットワークを実装する。
  • 2段階の戦略でモデルを学習する:まずPGNとオブジェクト特徴を事前学習し、次に全ネットワークを共同で微調整して、クロスモーダルな整合性を最適化する。

実験結果

リサーチクエスチョン

  • RQ1フレーズ記述における長距離依存関係をグラフ構造でモデル化することで、視覚的オブジェクトの位置特定性能が向上するか?
  • RQ2言語的関係に従って誘導される視覚的オブジェクト関係を組み込むことで、位置特定の正確性と耐障害性にどのような影響を与えるか?
  • RQ3局所的でフレーズごとのマッチングに比べて、グローバルなグラフマッチングが曖昧性をどれほど低減できるか?
  • RQ4文脈に配慮したフレームワークにおいて、正確性と計算コストのバランスを取るために最適なオブジェクト候補数(K)はどの程度か?
  • RQ5高い性能を達成するために、フレーズグラフおよび視覚的グラフの両方における関係特徴はどの程度重要か?

主な発見

  • 提案手法は、Flickr30K Entitiesの検証セットで76.19%という新たな最先端の正確性を達成し、従来手法を大きく上回った。
  • フレーズグラフネットワーク(PGN)により、フレーズ間の長距離意味的依存関係を捉えることで、位置特定の正確性がベースラインの73.46%から74.40%に向上した。
  • PGNに従って行われる候補のプルーニングにより、曖昧な候補が削減され、正確性が1.1%向上した。これにより、言語誘導型の候補選択の価値が示された。
  • 視覚的オブジェクトグラフネットワーク(VOGN)により、周囲のオブジェクトからの文脈特徴を活用することで、オブジェクト表現学習が向上し、正確性が75.85%に上昇した。
  • グローバルなグラフマッチングによる構造的予測を組み込むことで、正確性がさらに76.19%に向上した。これにより、局所的マッチングではなく統合的最適化の利点が確認された。
  • アブレーションスタディの結果、PGNおよびVOGNの両方で関係特徴を除去すると性能が0.41%低下した。これは関係モデリングの重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。