Skip to main content
QUICK REVIEW

[論文レビュー] Hyper-dimensional computing for a visual question-answering system that is trainable end-to-end

Guglielmo Montone, J. Kevin Ο’Regan|arXiv (Cornell University)|Nov 28, 2017
Multimodal Machine Learning Applications参考文献 6被引用数 7
ひとこと要約

本稿では、視覚的知識を高次元ベクトルとして表現するためのハイパーディメンショナル(HD)コンピューティングを用いた、エンド・ツー・エンドで学習可能な視覚質問応答(VQA)システムを提案する。画像の属性と関係をHDベクトル演算(からませあわせとグループ化)で符号化し、質問を微分可能類似度照合として定式化することで、訓練済みの質問に対して100%の正確性を達成し、新しい質問に対しても60–72%の正確性を示す。これは、HD空間における効果的なエンド・ツー・エンド学習と推論を示している。

ABSTRACT

In this work we propose a system for visual question answering. Our architecture is composed of two parts, the first part creates the logical knowledge base given the image. The second part evaluates questions against the knowledge base. Differently from previous work, the knowledge base is represented using hyper-dimensional computing. This choice has the advantage that all the operations in the system, namely creating the knowledge base and evaluating the questions against it, are differentiable, thereby making the system easily trainable in an end-to-end fashion.

研究の動機と目的

  • モジュラーなアーキテクチャに起因する計算タイプの不整合性を克服し、エンド・ツー・エンドで学習可能な視覚質問応答システムの開発。
  • 微分不能なコンponentsを含む複雑なVQAモデルの学習課題に、ハイパーディメンショナルコンピューティングを用いて、知覚と推論を微分可能演算として統合する。
  • HDコンピューティングが、視覚的知識とクエリ評価の効果的かつ微分可能な表現を可能にし、勾配ベース最適化を促進することを示すこと。
  • 訓練中に見られなかった新しい質問に対する一般化性能の評価、特にレアまたは未観測の形状に関する性能

提案手法

  • 入力画像(28×28 RGB)を1000次元のハイパーディメンショナル(HD)ベクトルにマップするフィードフォワードニューラルネットワークを用いる。このベクトルは画像の視覚的内容を表す。
  • 色、形状、位置といった各視覚的コンセプトはランダムなHDベクトルとして符号化され、画像特徴はHD演算を用いて統合される:属性と位置のバインディングにはからませあわせ(XORベース)、複数のオブジェクトの集約にはグループ化(ベクトル加算)が用いられる。
  • 質問は、HDベクトル間のコサイン類似度を用いた微分可能類似度照合として定式化され、質問の真偽は類似度が学習済みの閾値を超えるかどうかで決定される。
  • ネットワークは、5つの異なる質問タイプにおける予測値と正解値の二乗誤差を最小化する複合損失関数を用いてエンド・ツー・エンドで学習される。
  • ネットワークからのHDベクトル出力を用いて、すべての質問に対して、クエリパターンと符号化済み画像ベクトルとの類似度スコアを計算することで評価される。
  • 訓練プロセスでは確率的勾配降下法を用いてネットワークパラメータを最適化し、符号化、照合、損失計算のすべての操作が微分可能であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1ハイパーディメンショナルコンピューティングは、VQAシステムにおける視覚的知覚と推論を統合的かつ微分可能なフレームワークとして機能できるか?
  • RQ2HDコンピューティングに基づくエンド・ツー・エンドで学習可能なVQAモデルは、訓練中に見られなかった質問に対してどれほど一般化できるか?
  • RQ3複数の属性と空間的関係を含む複雑な関係的質問に対して、HDベースの推論はどの程度の性能を示すか?
  • RQ4HDベクトル演算は、正確で微分可能な質問応答を可能にする視覚的知識の符号化と取得を効果的に行えるか?
  • RQ5訓練データ外のレアまたは未観測の形状に対して、モデルはどの程度の性能を示すか?

主な発見

  • 訓練済みの5つの質問タイプすべてに対して、ホールドアウトされた30%のテストセットで100%の正確性を達成し、見慣れた質問パターンに対する完全な一般化を示した。
  • 訓練データに含まれなかった「square」、「triangle」、「cross」形状を含む新しい質問に対して、それぞれ72%、69%、60%の正確性を達成した。これは、新規性の増加に伴い性能が低下するが、依然として測定可能な性能であることを示している。
  • 最も悪い性能は「cross」形状で観測された。これは訓練中のいかなる質問でも使用されていなかったため、一般化性能が訓練分布内に形状が存在するかに敏感であることを示している。
  • システムは、オブジェクトの同一性、空間的位置、色、形状といった複雑な視覚的関係を、微分可能な操作のみで符号化・取得し、エンド・ツー・エンドの誤差逆伝播を可能にした。
  • HDコンピューティングの使用により、知識ベース構築と質問評価の両方のコンポーネントが微分可能となり、勾配降下法による効率的かつ安定した学習が可能になった。
  • 結果から、HDコンピューティングが、視覚的質問応答における知覚と推論の統合に実用的で微分可能な基盤を提供することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。