Skip to main content
QUICK REVIEW

[論文レビュー] Relational Reasoning using Prior Knowledge for Visual Captioning

Jingyi Hou, Xinxiao Wu|arXiv (Cornell University)|Jun 4, 2019
Multimodal Machine Learning Applications参考文献 33被引用数 13
ひとこと要約

本稿では、事前学習済みオブジェクト検出器を必要とせず、外部の知識グラフを活用して常識的・関係的推論を可能にする視覚的キャプション生成のための統合推論フレームワークを提案する。繰り返しのプロセスで事前知識からセマンティックグラフを構築し、グラフ畳み込みネットワーク(GCN)を用いてそれを精緻化することで、MS-COCOおよびMSVDベンチマークで最先端の性能を達成し、隠蔽された、または欠落しているオブジェクトに対しても効果的に対処できる。

ABSTRACT

Exploiting relationships among objects has achieved remarkable progress in interpreting images or videos by natural language. Most existing methods resort to first detecting objects and their relationships, and then generating textual descriptions, which heavily depends on pre-trained detectors and leads to performance drop when facing problems of heavy occlusion, tiny-size objects and long-tail in object detection. In addition, the separate procedure of detecting and captioning results in semantic inconsistency between the pre-defined object/relation categories and the target lexical words. We exploit prior human commonsense knowledge for reasoning relationships between objects without any pre-trained detectors and reaching semantic coherency within one image or video in captioning. The prior knowledge (e.g., in the form of knowledge graph) provides commonsense semantic correlation and constraint between objects that are not explicit in the image and video, serving as useful guidance to build semantic graph for sentence generation. Particularly, we present a joint reasoning method that incorporates 1) commonsense reasoning for embedding image or video regions into semantic space to build semantic graph and 2) relational reasoning for encoding semantic graph to generate sentences. Extensive experiments on the MS-COCO image captioning benchmark and the MSVD video captioning benchmark validate the superiority of our method on leveraging prior commonsense knowledge to enhance relational reasoning for visual captioning.

研究の動機と目的

  • オブジェクト検出器に依存する視覚的キャプション手法が、隠蔽・微小・長尾オブジェクトを処理する際の限界を解消すること。
  • 実世界のオブジェクト・関係制約と生成された語彙的用語を一致させることで、キャプションの意味的整合性を向上させること。
  • 視覚的手がかりが曖昧または欠落している場合に、外部の常識的知識を用いてオブジェクト間の関係を推論できること。
  • トレーニングに事前学習済み検出器やシーングラフアノテーションに依存しないこと。
  • より良いキャプション生成を実現するため、常識的推論と関係的推論を同時に実行する統合推論フレームワークを開発すること。

提案手法

  • 外部の知識グラフ(例:Visual Genome)を事前知識として用い、画像/動画領域における意味的推論を支援する。
  • 常識的推論(領域を意味空間にマッピング)と関係的推論(GCNを用いたセマンティックグラフのエンコーディング)を交互に実行する反復的統合推論アルゴリズムを導入する。
  • 常識的推論は、知識グラフからの制約を用いて、視覚的領域を高次元の意味的コンセプトに選択的・マッピングし、セマンティックグラフを構築する。
  • 関係的推論は、グラフ畳み込みネットワーク(GCN)を用いて領域表現を精緻化し、一貫性のあるテキスト記述を生成する。
  • 事前学習済みオブジェクト検出器やアノテート済みシーングラフに依存せず、キャプションデータセット上の弱教師付き学習にのみ依存する。
  • 代替最適化戦略を用いてエンドツーエンドで学習され、収束性が向上し、過学習を回避する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクト検出器が遮蔽や小さなオブジェクトサイズのため失敗する状況下でも、外部の常識的知識が視覚的キャプションの性能向上に寄与するか?
  • RQ2検出器依存の手法と比較して、統合的常識的・関係的推論は生成キャプションの意味的整合性をどのように向上させるか?
  • RQ3知識グラフベースの推論システムは、MS-COCO や MSVD のような標準ベンチマークで、検出器依存モデルをどの程度上回るか?
  • RQ4事前学習済み検出器への依存を排除することで、ドメインシフトが生じる分野間での一般化性能が向上するか?
  • RQ5各コンポonent(常識的推論と関係的推論)が、全体のキャプション生成性能に果たす寄与度はどの程度か?

主な発見

  • MS-COCOベンチマークでは、提案手法がCIDErスコア117.3を達成し、先行SOTA手法であるGCN-LSTM(117.1)やKMSL(110.3)を上回った。
  • MSVD動画キャプションベンチマークでは、CIDErスコア89.6を達成し、SCN(77.7)、GRU-EVE(78.1)、Up-Down(72.2)を大きく上回った。
  • アブレーションスタディの結果、常識的推論を除去すると性能が低下し、B@4が43.7に低下し、CIDErが70.5にまで低下した。これは、コンセプト選択と意味的整合性の維持において、常識的推論が極めて重要であることを示している。
  • 関係的推論(GCNモジュール)を除去した場合、B@4は50.8、CIDErは85.4に低下した。これは、グラフエンコーディングが表現の精緻化に不可欠であることを裏付けている。
  • 反復的代替アルゴリズムは3反復目で収束し、CIDErおよびB@4スコアがピークに達した後、過学習のため低下した。これは、学習戦略の有効性を確認するものである。
  • 本手法はドメイン間での一般化性能が優れており、検出器依存モデル(例:GRU-EVE)でさえ、検出器とキャプションデータセットのドメインギャップがある状況でも、本手法が上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。