Skip to main content
QUICK REVIEW

[論文レビュー] MoSE: Modality Split and Ensemble for Multimodal Knowledge Graph Completion

Yu Zhao, Xiangrui Cai|arXiv (Cornell University)|Oct 17, 2022
Advanced Graph Neural Networks被引用数 6
ひとこと要約

MoSEは、マルチモーダル知識グラフ補完(MKGC)のためのモダリティ別表現学習とアンサンブル推論フレームワークを提案する。関係埋め込みをモダリティごとに分離することで、モダリティレベルの矛盾を軽減し、アンサンブル手法による動的重み付けでモダリティ固有の重要性を反映する。実験の結果、3つのベンチマークデータセットにおいて最先端の手法を上回り、テキストモダリティが視覚モダリティよりも情報量が多いことが示された。

ABSTRACT

Multimodal knowledge graph completion (MKGC) aims to predict missing entities in MKGs. Previous works usually share relation representation across modalities. This results in mutual interference between modalities during training, since for a pair of entities, the relation from one modality probably contradicts that from another modality. Furthermore, making a unified prediction based on the shared relation representation treats the input in different modalities equally, while their importance to the MKGC task should be different. In this paper, we propose MoSE, a Modality Split representation learning and Ensemble inference framework for MKGC. Specifically, in the training phase, we learn modality-split relation embeddings for each modality instead of a single modality-shared one, which alleviates the modality interference. Based on these embeddings, in the inference phase, we first make modality-split predictions and then exploit various ensemble methods to combine the predictions with different weights, which models the modality importance dynamically. Experimental results on three KG datasets show that MoSE outperforms state-of-the-art MKGC methods. Codes are available at https://github.com/OreOZhao/MoSE4MKGC.

研究の動機と目的

  • 異なるモダリティ(例:テキスト対ビジョン)から生じる矛盾する関係が、単一の関係埋め込みを共有することで干渉するマルチモーダル知識グラフ補完(MKGC)におけるモダリティレベルの矛盾問題に対処すること。
  • 予測においてすべてのモダリティを同等に扱うという制限を克服し、推論中にモダリティ固有の重要性を動的にモデル化すること。
  • 訓練段階でモダリティ間の関係表現の密結合を解体し、推論段階で適応的統合を可能にする、新たなフレームワークの提案。
  • テキストモダリティが視覚モダリティよりも信頼性が高く、関係予測においてより優れた情報を提供することを実証的に検証すること。

提案手法

  • 訓練段階では、単一の共有埋め込みではなく、モダリティ別に分離された関係埋め込みを学習することで、モダリティ間の相互干渉を低減する。
  • 各モダリティに対して、テキスト、ビジョン、知識グラフ構造から導出されたエンティティおよび関係埋め込みを用いて、別々の表現学習を実施する。
  • 推論段階では、モダリティ別に分離された埋め込みを用いて、各モダリティごとに独立した予測を生成する。
  • 早期、後期、適応的推論の複数のアンサンブル戦略を適用し、モダリティの信頼性に基づいて予測を可学習重みで統合する。
  • 適応的推論法では、温度制御されたソフトアテンションメカニズムを用いて、モダリティの重みを動的に調整し、温度スケーリングによる信頼性補正を実施する。
  • フレームワークは、3つのデータセット(FB15K-237、WN18、WN9)における標準的なMKGC指標(MR、MRR、Hits@10)を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1モダリティ間で関係表現を分離することで、マルチモーダル知識グラフ補完の性能にどのような影響を与えるか?
  • RQ2固定または共有統合戦略と比較して、モダリティ固有の予測を動的アンサンブル重み付けすることでMKGC性能を向上させられるか?
  • RQ3テキストモダリティと視覚モダリティのどちらが、エンティティ予測においてより信頼性が高く寄与するか?これは関係タイプによって変化するか?
  • RQ4モダリティ予測の不確実性は最終推論にどのように影響するか?また、温度スケーリングを用いて効果的にモデル化できるか?

主な発見

  • MoSEは、すべての3つのベンチマークデータセット(FB15K-237、WN18、WN9)で最先端の性能を達成し、9つのベースライン手法を上回った。
  • FB15K-237では、MRRが0.448、Hits@10が0.687を達成し、以前のSOTA手法RSMEを上回った。
  • テキストモダリティは視覚モダリティよりも顕著に寄与し、国名関係のケースではテキストの平均モダリティ重みが70%、視覚が0%であった。
  • 温度スケーリングを用いた適応的推論法(MoSE-AI)は、温度が0.5から32に上昇するに従い、性能が安定化・向上し、より高いロバスト性を示した。
  • 事例研究により、MoSE-BIが関係ごとに高信頼性のモダリティを正しく同定し、関連情報が豊富な場合にテキストモダリティに高い重みを割り当てることが確認された。
  • 視覚モダリティはデータセット全体を通して不安定な性能を示したが、テキストモダリティは一貫して予測品質を向上させ、文脈理解を要する関係において特に顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。