Skip to main content
QUICK REVIEW

[論文レビュー] Deep Bayesian Active Learning for Multiple Correct Outputs

Khaled Jedoui, Ranjay Krishna|arXiv (Cornell University)|Dec 2, 2019
Multimodal Machine Learning Applications参考文献 74被引用数 10
ひとこと要約

本稿では、出力確率空間ではなく視覚的・意味的埋め込み空間における不確実性推定を行う、画期的なアクティブラーニングフレームワークを提案する。これは、VQAのような複数の正解が存在するタスクにおける従来の不確実性測定の限界を克服する。この構造的で意味的な空間におけるドロップアウトに基づくベイジアン不確実性を活用することで、Visual GenomeとVQA 2.0の両タスクで、それぞれ5倍および3倍のコスト効率向上を達成するとともに、並記表現のサンプリングを削減し、サンプル効率を向上させた。

ABSTRACT

Typical active learning strategies are designed for tasks, such as classification, with the assumption that the output space is mutually exclusive. The assumption that these tasks always have exactly one correct answer has resulted in the creation of numerous uncertainty-based measurements, such as entropy and least confidence, which operate over a model's outputs. Unfortunately, many real-world vision tasks, like visual question answering and image captioning, have multiple correct answers, causing these measurements to overestimate uncertainty and sometimes perform worse than a random sampling baseline. In this paper, we propose a new paradigm that estimates uncertainty in the model's internal hidden space instead of the model's output space. We specifically study a manifestation of this problem for visual question answer generation (VQA), where the aim is not to classify the correct answer but to produce a natural language answer, given an image and a question. Our method overcomes the paraphrastic nature of language. It requires a semantic space that structures the model's output concepts and that enables the usage of techniques like dropout-based Bayesian uncertainty. We build a visual-semantic space that embeds paraphrases close together for any existing VQA model. We empirically show state-of-art active learning results on the task of VQA on two datasets, being 5 times more cost-efficient on Visual Genome and 3 times more cost-efficient on VQA 2.0.

研究の動機と目的

  • 複数の正解が存在するタスクにおける視覚言語タスクのアクティブラーニングにおいて、従来の不確率サンプリングの失敗を是正すること。
  • VQAで使用されるようなモデルにおける並記表現出力に起因する不確実性の過大評価を克服すること。
  • 構造的な視覚的・意味的埋め込み空間における不確実性推定により、アクティブラーニングにおけるサンプル効率を向上させること。
  • 埋め込み空間におけるモンテカルロドロップアウトを用いて、系列生成タスクにおける有効なベイジアン不確実性推定を可能とすること。
  • 提案された枠組みを用いて、VQAベンチマークで最先端のパフォーマンスとコスト効率を実証すること。

提案手法

  • Visual Genomeの領域記述を用いて、答えの並記表現を近接するクラスタとして配置する視覚的・意味的埋め込み空間を構築する。
  • 出力トークン空間ではなく、学習済みの視覚的・意味的埋め込み空間内でのモンテカルロドロップアウトに基づくベイジアン不確実性推定を適用する。
  • 埋め込み表現を精緻化し、不確実性推定の精度を向上させるためのノイズ除去モジュールを導入する。
  • 埋め込み空間における複数回の順伝播の分散を、アクティブラーニングのサンプル選択における不確実性の指標として用いる。
  • 学習中の損失関数として視覚的・意味的空間を統合し、既存の不確実性関数との互換性を確保する。
  • 埋め込み空間の分散に基づく不確実性サンプリングを用いて、ラベル付けに最も有益なサンプルを選択する。

実験結果

リサーチクエスチョン

  • RQ1視覚的・意味的埋め込み空間における不確実性推定は、VQAのアクティブラーニングにおいて、従来の出力空間不確実性測定を上回る性能を発揮するか?
  • RQ2本手法は、ベースラインの不確実性戦略と比較して、並記表現の答えのサンプリングをどの程度削減するか?
  • RQ3本手法は、視覚言語生成タスクにおけるアクティブラーニングのサンプル効率をどの程度向上させるか?
  • RQ4ノイズ除去器と構造的な埋め込み空間の使用は、複数の正解が出力される状況下で、ベイジアン不確実性推定のロバストネスを向上させるか?
  • RQ5「何」や「どこ」の質問といった異なる質問タイプにおいて、本手法は、サンプルされた答えの新規性と多様性の観点でどの程度の性能を示すか?

主な発見

  • 本手法は、ランダムサンプリングおよび既存の不確実性ベースラインと比較して、Visual Genomeデータセットで5倍のコスト効率を達成した。
  • VQA 2.0データセットでは、ベースラインのアクティブラーニング戦略と比較して、3倍のコスト効率が向上した。
  • 「何」の質問では、新規概念のサンプリングが27%増加し、多様性の向上と冗長性の低減が示された。
  • 並記表現を含む長い答えのサンプリングが著しく減少し、「どこ」の質問において25.3%の削減が確認された。
  • アブレーションスタディの結果、視覚的・意味的空間、ベイジアン不確実性、ノイズ除去モジュールの組み合わせが最良のパフォーマンスを発揮し、各要素がロバストネスの向上に寄与していることが確認された。
  • 標準的な不確実性測定を用いても、視覚的・意味的空間そのものがある程度のパフォーマンス向上をもたらすことが示された。これは、複数の正解が出力されるタスクにおける出力空間の構造化に、その一般性が存在することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。