Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Modal Answer Validation for Knowledge-Based VQA

Jialin Wu, Jiasen Lu|arXiv (Cornell University)|Mar 23, 2021
Multimodal Machine Learning Applications被引用数 16
ひとこと要約

本稿では、知識ベース型VQAにおけるマルチモーダルな回答検証フレームワークMAVExを提案する。MAVExは、回答候補を用いて視覚的(Google Images)、文章的(Wikipedia)、常識的(ConceptNet)な知識ソースからの検索をガイドする。回答固有の多スケール知識埋め込みを学習することで、MAVExはOK-VQAで単一モデルスコア40.3、アンサンブルスコア41.4という最先端の性能を達成した。

ABSTRACT

The problem of knowledge-based visual question answering involves answering questions that require external knowledge in addition to the content of the image. Such knowledge typically comes in various forms, including visual, textual, and commonsense knowledge. Using more knowledge sources increases the chance of retrieving more irrelevant or noisy facts, making it challenging to comprehend the facts and find the answer. To address this challenge, we propose Multi-modal Answer Validation using External knowledge (MAVEx), where the idea is to validate a set of promising answer candidates based on answer-specific knowledge retrieval. Instead of searching for the answer in a vast collection of often irrelevant facts as most existing approaches do, MAVEx aims to learn how to extract relevant knowledge from noisy sources, which knowledge source to trust for each answer candidate, and how to validate the candidate using that source. Our multi-modal setting is the first to leverage external visual knowledge (images searched using Google), in addition to textual knowledge in the form of Wikipedia sentences and ConceptNet concepts. Our experiments with OK-VQA, a challenging knowledge-based VQA dataset, demonstrate that MAVEx achieves new state-of-the-art results. Our code is available at https://github.com/jialinwu17/MAVEX

研究の動機と目的

  • 膨大な外部事実が正確な回答予測を妨げる、知識ベース型VQAにおけるノイズが多く不適切な知識検索の課題に対処すること。
  • 一般的な知識検索に依存する従来の2段階型VQAパイプラインの限界を克服し、しばしば低品質な支援的事実をもたらす問題を解決すること。
  • 候補となる回答に従って外部知識をガイドする検証に移行することで、回答の信頼性を向上させること。
  • 視覚的、文章的、常識的というマルチモーダル知識ソースを包括的に活用し、回答検証のパフォーマンスを向上させること。
  • 回答に従った知識検索と多スケール埋め込みを組み合わせることで、より情報量が多く信頼できる支援的事実が得られることを示すこと。

提案手法

  • すべての事実に対して網羅的な探索を避けるために、事前学習済みのVQAモデル(ViLBERT)を用いて高品質な回答候補の少数を生成する。
  • 各回答候補に対して、質問と回答から名詞句を抽出し、Wikipedia(文章)、ConceptNet(常識的コンセプト)、Google Images(視覚的情報)の3つのソースから知識を取得するためのターゲットクエリを生成する。
  • マルチヘッドアテンションを用いて、クエリレベル、名詞句レベル、質問レベルの複数のスケールで、各候補に対して重要情報を強調する多スケール埋め込みを生成する。
  • 多スケール埋め込みに対する学習済みアテンション機構を用いて、各知識ソースの信頼性を予測する回答検証モジュールを訓練する。
  • 重み付きスコアリング機構を用いて、各ソースからの証拠を統合し、各候補ごとに予測された重みでソースの信頼性を反映させる。
  • 知識検索と検証を同時に学習できるように、交差エントロピー損失を用いて、回答予測の上でエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1回答に従った知識検索は、質問や画像に従った検索と比較して、知識ベース型VQAにおける支援的事実の質を向上させることができるか?
  • RQ2文章的(Wikipedia)、常識的(ConceptNet)、視覚的(画像)というマルチモーダル知識ソースは、候補となる回答の検証においてどれほど効果的か?
  • RQ3クエリ、名詞句、質問レベルという多スケール知識埋め込みは、モデルが関連性があり信頼できる証拠を特定する能力を向上させるか?
  • RQ4外部知識を用いた回答検証は、オープンドメインで知識集約型のVQAにおいて、従来の回答生成パイプラインを上回る性能を発揮できるか?
  • RQ5各知識ソースの貢献度は何か?また、それらはどのように相互に補完し合うか?

主な発見

  • MAVExは、OK-VQAベンチマークで40.3という新たな単一モデルスコアを達成し、最先端の性能を記録した。
  • アンサンブルモデルは41.4のスコアを達成し、多様な知識集約型VQAの例にわたる強力な一般化能力と耐障害性を示した。
  • Wikipedia、ConceptNet、画像の3つの知識ソースをすべて使用した場合、ViLBERTベースラインに比べて5%のパフォーマンス向上が得られ、それぞれ+3.4、+3.3、+3.1ポイントの貢献が確認された。
  • アブレーションスタディの結果、名詞句レベルまたは質問レベルのマルチヘッドアテンションを平均プーリングに置き換えると、スコアはそれぞれ39.77および39.60に低下し、スケールに応じたアテンションの重要性が裏付けられた。
  • 回答検証ステップそのものだけで、知識を検索するが検証を行わないベースラインに比べ1.1%のスコア向上が確認され、その有効性が裏付けられた。
  • 最良の知識ソースを例ごとに選択するオラクル実験では47.76のスコアが得られ、将来的なソース選択の改善によりさらなる向上が期待できる余地があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。