[論文レビュー] Multimodal Analogical Reasoning over Knowledge Graphs
本稿は、知識グラフ上でマルチモーダルな類推的推論を提示し、視覚的、文書的、構造的知識を統合した関係的推論のための新しいタスクを提案する。MARSデータセットとMarKG知識グラフを構築し、構造マッピング理論にインspiredされたモデルに依存しないTransformerフレームワークであるMarTを提案。関係の明示的教師信号なしで最先端の性能を達成し、強力な一般化能力とマルチモーダルな整合性を示した。
Analogical reasoning is fundamental to human cognition and holds an important place in various fields. However, previous studies mainly focus on single-modal analogical reasoning and ignore taking advantage of structure knowledge. Notably, the research in cognitive psychology has demonstrated that information from multimodal sources always brings more powerful cognitive transfer than single modality sources. To this end, we introduce the new task of multimodal analogical reasoning over knowledge graphs, which requires multimodal reasoning ability with the help of background knowledge. Specifically, we construct a Multimodal Analogical Reasoning dataSet (MARS) and a multimodal knowledge graph MarKG. We evaluate with multimodal knowledge graph embedding and pre-trained Transformer baselines, illustrating the potential challenges of the proposed task. We further propose a novel model-agnostic Multimodal analogical reasoning framework with Transformer (MarT) motivated by the structure mapping theory, which can obtain better performance. Code and datasets are available in https://github.com/zjunlp/MKG_Analogy.
研究の動機と目的
- 視覚的、文書的、構造的知識グラフ情報の統合を通じて、マルチモーダルな類推的推論におけるギャップを埋める。
- 明示的な関係アノテーションなしに類推的推論をリンク予測として定式化する新しいベンチマークタスクを開発する。
- 人間によるアノテーションが施された大規模データセット(MARS)とマルチモーダル知識グラフ(MarKG)を構築し、ニューラルモデルにおける類推的推論の評価を可能にする。
- マルチモーダル知識グラフ埋め込みと事前学習済みTransformerモデルの性能を、この新しいタスクで評価する。
- 関係構造の注目に基づく構造マッピングとエンドツーエンド学習を可能にする、モデルに依存しないフレームワークMarTを提案する。
提案手法
- タスクは $(e_h, e_t) : (e_q, ?)$ として形式化され、エンティティはマルチモーダル(テキスト、画像、または両方)であり、背景知識としてMarKGからの情報を用いて欠落しているターゲットエンティティを予測する。
- MARSデータセットはE-KARとBATsから構築され、WikidataのエンティティとLAION-5Bからの画像を追加し、人間による類推的関係のアノテーションが施されている。
- MarKGは、エンティティ、関係、およびモダリティ固有の埋め込み(テキスト、画像)を統合したマルチモーダル知識グラフであり、推論に用いられる。
- MarTは、関係的構造に注目し、[R]トークンを用いて関係の暗黙的モデリングを行うことで、マルチモーダル表現をアライメントするTransformerベースのアーキテクチャを採用している。
- このフレームワークはモデルに依存せず、任意のマルチモーダル事前学習済みTransformerモデル(例:VisualBERT、ViLT、FLAVA、MKGformer)に組み込むことができる。
- 関係に特化した評価は、予測された[R]トークンのHit@kと、正解関係埋め込みとの正規化された[R]表現のユークリッド距離の2つの指標を用いて実施される。
実験結果
リサーチクエスチョン
- RQ1ニューラルネットワークは、構造的知識グラフの背景知識を用いて、テキストや画像といった複数のモダリティ間で類推的推論を実行できるか?
- RQ2マルチモーダル統合は、単一モーダルまたは知識グラフを拡張しないベースラインと比較して、類推的推論性能をどのように向上させるか?
- RQ3エンドツーエンドモデル(例:MarT)は、明示的な関係の教師信号なしに、関係的構造をどの程度学習できるか?
- RQ4マルチモーダル類推的推論における主な失敗モードは何か?また、それらはモダリティの不均衡や抽象的概念に関連しているか?
- RQ5MarKGで事前学習することで、下流の類推的推論性能はどの程度向上するか?
主な発見
- MarTはMARSのすべてのベースラインを上回り、MarT_FLAVAが最も優れた関係に特化した性能(Hits@3: 0.078、ユークリッド距離: 1.380)を示した一方、MarT_MKGformerが最も高いエンティティ予測正答率を達成した。
- MPTモデルの性能はモデルサイズと相関しており、より大きなミックスストリームモデル(例:MKGformer)が、より小さなシングルストリームまたはデュアルストリームモデルを上回った。
- MarKGで事前学習することで、類推的推論性能が顕著に向上し、すべてのMPTベースラインで、事前学習段階および微調整段階で一貫した向上が観察された。
- [R]トークンに基づく評価により、MarT_FLAVAが関係の意味を最もよく捉えており(最小のユークリッド距離: 1.380)、エンティティ予測ではMarT_MKGformerに劣った。
- 誤差解析の結果、モダリティの不均衡、抽象的概念(例:'management')および直感的でない関係(例:'intersection to')が、現在のモデルにとって主要な課題であることが明らかになった。
- 1対多の問題—1つのエンティティが複数の有効なターゲットにマッピングされる—は、特に複雑な関係的状況において、モデルの一般化能力を著しく阻害することが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。