Skip to main content
QUICK REVIEW

[論文レビュー] Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge

Violetta Shevchenko, Damien Teney|arXiv (Cornell University)|Jan 15, 2021
Multimodal Machine Learning Applications被引用数 13
ひとこと要約

本論文は、学習済みの表現を外部知識ベース(KB)の埋め込みと一致させるように調整することで、視覚・言語トランスフォーマーの性能を向上させる知識注入技術を提案する。ConceptNet や Wikidata と一致する補助的コントラスト型目的関数を用いることで、知識集約型 VQA タスク(例:OK-VQA で +1.78%)における性能が顕著に向上し、驚くべきことに視覚的推論ベンチマーク(例:NLVR2 で +1.28%)に対しても向上が見られた。これは、KB正則化が意味的および関係的表現学習を強化することを示している。

ABSTRACT

The limits of applicability of vision-and-language models are defined by the coverage of their training data. Tasks like vision question answering (VQA) often require commonsense and factual information beyond what can be learned from task-specific datasets. This paper investigates the injection of knowledge from general-purpose knowledge bases (KBs) into vision-and-language transformers. We use an auxiliary training objective that encourages the learned representations to align with graph embeddings of matching entities in a KB. We empirically study the relevance of various KBs to multiple tasks and benchmarks. The technique brings clear benefits to knowledge-demanding question answering tasks (OK-VQA, FVQA) by capturing semantic and relational knowledge absent from existing models. More surprisingly, the technique also benefits visual reasoning tasks (NLVR2, SNLI-VE). We perform probing experiments and show that the injection of additional knowledge regularizes the space of embeddings, which improves the representation of lexical and semantic similarities. The technique is model-agnostic and can expand the applicability of any vision-and-language transformer with minimal computational overhead.

研究の動機と目的

  • 画像・テキストのペaired データセットにのみ学習させた視覚・言語モデルに、限定的な事実的知識および常識的知識が欠けている問題に対処すること。
  • 汎用的知識ベース(KB)から外部知識を注入することで、マルチモodal トランスフォーマーにおける推論性能が向上するかどうかを調査すること。
  • 多様な視覚・言語ベンチマークにおける異なる KB(例:ConceptNet、Wikidata)の影響を評価すること。
  • 知識注入が、外部事実を明示的に必要としない視覚的推論タスクに対しても、性能向上をもたらすかどうかを分析すること。
  • 知識注入がモデルに依存せず、計算コストが低いため、広範な適用が可能であることを示すこと。

提案手法

  • 本手法は、外部 KB(ConceptNet、Wikidata)からの知識を補助的コントラスト型学習目的関数を介して視覚・言語トランスフォーマーに注入する。
  • 事前学習済みのグラフ埋め込みモデル(例:TransE、DistMult)を用いて、知識ベースのエンティティをベクトル空間に埋め込む。
  • 訓練中、モデルのアテンションおよび表現層をコントラスト型損失関数を用いて、対応する KB 埋め込みと一致させるように正則化する。
  • 本手法は LXMERT アーキテクチャに適用され、VQA、NLVR2、SNLI-VE、OK-VQA データセットで微調整が行われる。
  • 本手法はモデルに依存せず、計算コストを最小限に抑えながら、任意の視覚・言語トランスフォーマーに適用可能である。
  • 語彙的・意味的・関係的表現学習への影響を分析するために、プローブ実験が実施される。

実験結果

リサーチクエスチョン

  • RQ1外部 KB からの知識を注入することで、視覚・言語推論タスクの性能が向上するか?
  • RQ2知識注入は、外部事実を明示的に必要としない視覚的推論タスクに対しても利益をもたらすか?
  • RQ3マルチモーダル表現の向上において、異なる知識ベース(例:ConceptNet と Wikidata)の有効性はどのように比較されるか?
  • RQ4知識注入が埋め込み空間をどの程度正則化し、意味的および関係的類似性学習をどの程度向上させるか?
  • RQ5本手法は、最小限のアーキテクチャ的変更で、多様な視覚・言語ベンチマークに効果的に適用可能か?

主な発見

  • 知識注入手法により、ベースラインの LXMERT-GitHub モデルと比較して、OK-VQA における性能が 1.78 パcent 点向上(37.26% から 39.04% に)。
  • NLVR2 においても 1.28 パcent 点の向上(71.31% から 72.59% に)を達成し、視覚的推論タスクに対しても恩恵があることが示された。
  • アブレーションスタディの結果、KB から栄養関連エンティティを削除すると、栄養関連の質問に対する精度が 91.11% から 68.89% に低下し、知識注入が性能向上の要因であることが実証された。
  • プローブ実験の結果、知識注入により語彙的および意味的類似性の捉え込み能力が向上し、より良い表現学習が実現していることが示された。
  • 本手法は複数のベンチマークで有効であり、モデルに依存せず、計算コストを最小限に抑えながら、任意の視覚・言語トランスフォーマーに統合可能である。
  • 一方で、Wikidata の性能はノイズと曖昧さの影響を受けていたため、大規模で構造の薄い KB を活用する際の課題が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。